Depois de oito dias em que quatro laboratórios publicaram revisões de modelos que agiram fora do escopo do teste, o movimento de produto de hoje foi na direção contrária: a Anthropic afrouxou o filtro de biologia do Fable 5 e publicou o número do que esse filtro estava custando.
A Anthropic publicou hoje que reescreveu as diretrizes do classificador de biologia do Fable 5, o modelo de topo da empresa, e que as recusas por biologia caem cerca de 85%. O total de recusas deve cair aproximadamente 67% no Claude.ai, 55% no Cowork, 17% no Claude Code e 7% na plataforma de desenvolvedor.
A causa declarada é falso positivo. O classificador barrava pergunta cotidiana de saúde, do tipo interpretar exame de laboratório ou entender sintoma. O que não mudou é o essencial: pedido de uso duplo em virologia, toxicologia e desenho molecular segue bloqueado, porque, nas palavras da empresa, o modelo "poderia dar um impulso significativo a esse ator".
Então isto não é afrouxar segurança, é reposicionar onde o portão fica. E é a primeira vez nesta série de oito dias que um laboratório publica número para o custo de ter posto o portão no lugar errado.
O número que interessa aqui não é o 85%. É a diferença entre as superfícies: 67% de queda no Claude.ai contra 7% na plataforma de desenvolvedor. A mesma mudança de classificador tem efeito dez vezes maior no produto de consumo do que na interface de programação, e isso diz onde os falsos positivos moravam. Não era quem constrói agente. Era o público leigo perguntando de saúde.
O conjunto de cenários simultâneos subiu de 50 para 1.000 membros, e o modelo opera a 28 por 28 km, resolução 100 vezes mais grossa que a dos modelos tradicionais, coisa que os próprios autores registram como pergunta em aberto ("surpreendeu os cientistas"). Segundo o post, ciclones foram responsáveis por mais de 700 mil mortes e US$ 1,4 trilhão em perdas econômicas em 50 anos.
É o segundo lançamento de peso aberto vindo de laboratório de fronteira nesta semana, e num domínio onde o resultado é auditável por terceiro, porque o histórico de ciclones é público. O modelo já entrou em uso operacional: segundo o post, ajudou o National Hurricane Center a antecipar a intensificação rápida do furacão Melissa em 2025.
Para quem usa de graça: o Luna vira o modelo padrão nesta semana e ganha conversa de texto sem limite na semana que vem, com um botão "Think" para pergunta difícil. Limites seguem valendo para arquivo, imagem e ferramentas.
A ressalva importa: a comparação é contra o GPT-5.5 Instant, ou seja, contra a geração anterior no modo rápido, não contra o próprio 5.6 com raciocínio ligado. É medição do fabricante, sem verificação de terceiro. E o post avisa que a versão que roda no Work e no Codex não muda com este lançamento.
Outros dois cortes: Peru, Uruguai e Costa Rica foram os que mais subiram no ranking por habitante entre o 1º e o 2º trimestre de 2026, e a fatia de mensagens de gente acima de 35 anos cresceu em quase todo país, com França e Chéquia subindo mais de 10 pontos percentuais em um ano.
É dado do fabricante sobre a própria base, então mede adoção dentro do ChatGPT, não o mercado. Ainda assim é a primeira série pública com corte por país, os dados estão disponíveis para baixar, e o Brasil aparece no topo de uma categoria específica.
2608.04570, submetido em 05/08, ▲37 no ranking da comunidade do Hugging Face de 06/08). Os autores montaram o MirageBench, com 150 personas e seis tarefas de personalização, e avaliaram 12 modelos de sete famílias sobre mais de 143 mil afirmações. Todos os 12 super-inferiram entre 35% e 49% das afirmações sobre o usuário, com variação de 27% a 59% por tarefa, e o efeito acumula ao longo da conversa.O achado que dá nome à seção deles é a inversão de automonitoramento: os modelos que relatam inferir menos são justamente os mais sinalizados como fabricadores. Dentro de um mesmo modelo a autoavaliação até funciona; comparar modelos por autoavaliação leva à conclusão errada. Conclusão dos autores: verificação externa deve substituir o autorrelato do modelo.
É a versão medida, com número, de uma coisa que este radar registra em outra forma desde 16/07: o modelo não é testemunha confiável do próprio comportamento. Aqui o objeto é a memória do usuário.
A Meta lançou o Muse Code, agente de código próprio, co-treinado com o Muse Spark 1.2, que é a atualização do mesmo 1.1 nomeado ontem no caso da invasão durante avaliação de segurança. O texto da empresa cita "trajetórias de harness por amostragem por rejeição" e otimizações para metas, compactação e subagentes, ou seja, o laboratório treinou o modelo contra o próprio andaime. Willison resume o padrão numa frase: hoje a característica que mais importa num modelo é chamada de ferramenta em sequência longa. simonwillison.net, 05/08
Beyond Top-K (2608.06305, 06/08) mede, num relatório público de 780 páginas em que 86,8% das linhas de conteúdo são linhas de tabela, 58,8% de acerto de uma busca sem vetor de embutimento contra 15,7% da busca densa em 51 perguntas verificadas. E o dado que fecha o argumento: o BM25, algoritmo de 1994, fica estatisticamente empatado com o método novo. É o 5º achado medido em duas semanas na série contra a corrente aberta em 04/08, com 2607.26497, 2607.26637, 2608.02358 e 2608.02751. Autorrelato, sem replicação, recorte estreito.
O post inteiro tem uma linha: "E essa foi a última vez que usei o Opus 5". Nos comentários o autor conta o que aconteceu: o modelo enfiou dois servidores de GPU num plano de projeto, cerca de mil dólares de gasto, e ele só percebeu no jantar, quando já tinham consumido cem. O fio se virou contra ele.
"Sim, uma leitura literal disso é 'autorizado'. O modelo não consegue ler o teu tom. Eu considero um defeito ele não ter pedido esclarecimento, mas como esses sistemas são estocásticos, reduzir esses erros nunca vai chegar a ZERO."/u/BroScienceAlchemist · r/ClaudeAI · traduzido do inglês · sobre a instrução dizer "os itens marcados AUTORIZAÇÃO precisam de uma ligação; todo o resto está desbloqueado"
"Inchaço de instrução é REAL. Adiciona demais e parece que nenhuma é seguida. Existe um ponto ótimo. Prioriza as importantes."/u/The1TruRick · r/ClaudeAI · traduzido do inglês
O autor argumenta que usar o modelo como redator ou máquina de resposta atrofia o pensamento crítico, porque o sistema é bajulador por construção, e propõe o oposto: usar o modelo como simulador de voo, para estressar o próprio raciocínio com contra-argumentos e casos limite antes de executar.
"Tenho um prompt inteiro que só tenta refutar o que eu acabei de dizer. É estranhamente útil pra pegar os teus próprios pontos cegos antes de você se comprometer com uma ideia burra. Às vezes eu alimento com algo que sei que está errado só pra ver se ele concorda balançando a cabeça, e quase sempre concorda, a não ser que você force o contrário."/u/Due_Stranger_1403 · r/PromptEngineering · traduzido do inglês
"Os que tiverem alto desempenho no mundo da IA vão ser os que continuarem pensando fundo, e usarem os agentes de forma combativa."/u/KriegerClone24 · r/PromptEngineering · traduzido do inglês
Pergunta de comprador corporativo: voz de qualidade, baixa latência, passagem limpa para atendente humano e governança que satisfaça compliance. As respostas convergiram não para o produto, mas para onde ele quebra.
"Todo fornecedor faz demonstração na ligação limpa: uma intenção, curta, sem gente falando por cima, áudio nítido. A ligação que decide é a bagunçada."/u/cmtape · r/AI_Agents · traduzido do inglês
"Vale ser específico com os fornecedores sobre o que 'mantém contexto' significa de fato, porque na maior parte das vezes é um resumo gerado pelo modelo, não a transcrição. O teu atendente recebe um parágrafo que soa certo e perde o único detalhe que o cliente já falou duas vezes."/u/AccessFuel · r/AI_Agents · traduzido do inglês
Régua desta seção: fala citada é o que a pessoa escreveu, não o que ela quis dizer; comentário é opinião de uma pessoa e nunca vira "a comunidade acha X"; posição no ranking mede atenção, não consenso; e três fios não são amostra de nada.
220 títulos brutos, coletados pelo cron entre 06h05 e 06h15, menos 6 casos do mesmo autor postando o mesmo assunto em subs diferentes, que contam uma vez só.
Leitura, uma linha: memória e contexto em 2,3% é o menor valor da série comparável de janela de um dia, que agora lê 3,3%, 3,7%, 2,7%, 3,3%, 5,5%, 3,6% e 2,3%. Confirma pelo segundo dia que o pico de quarta-feira foi evento e não patamar novo. Agentes e orquestração em 12,1%, mantendo o dígito duplo em 5 das 6 rodadas comparáveis. E o MCP voltou de 0,5% para 1,9%.
Pelo quarto dia seguido, a contagem não sustenta a manchete, e isso fica declarado. O balde "segurança" ficou em 0,5%, um único título, pelo mesmo defeito anotado em 31/07, 05/08 e 06/08: a lista congelada de termos não tem "hack", "cyber", "incident" nem "breach" antes de "eval". Hoje: "OpenAI Models Colluded for Months Before Hugging Face Hack" caiu em "modelos" pela palavra models, e "Meta becomes latest firm to say its AI hacked another company" caiu em "outros" por não casar com termo nenhum da lista. Pela regra da taxonomia congelada não se muda critério na rodada em que o resultado foi visto: é candidato a mudança declarada no fechamento semanal de domingo, 09/08, com quebra de série anotada.
Avisos de denominador: o painel é o que escolhemos, e os percentuais descrevem o painel, não a internet · falso positivo anotado: "I built a local-only scrubber" contou em open weights/local, e "Imagen e Veo" contou em imagem antes de modelos · falso negativo novo: "cut a multi-turn api bill 5-10x" não contou em custo/limites, porque a lista tem "billing" e não "bill", mesmo defeito anotado em 04/08.
Janela: 06/08 06h24 a 07/08 06h35.
Varrido: Reddit, 11 de 11 subs com status ok, coleta do cron entre 06h05 e 06h15, 220 títulos e 10 posts com comentários lidos (o de posição 1 de cada sub, menos o r/agi, que trouxe 7 posts na janela) · fontes primárias em snapshot pré-turno, 7 de 7 ok: OpenAI com 4 posts e corpo lido, Anthropic pelo índice do newsroom, DeepMind com 1 post e corpo, Simon Willison com 7 posts, blog do Hugging Face com 1, e Interconnects e Import AI vazios na janela (sem publicação, não é falha) · Hugging Face daily papers de 06/08, 33 papers, contagem conferida na enumeração · consulta direcionada na API do arXiv, 38 entradas, todas de 06/08, lote único.
Claims tocados: vence hoje o claim de 28/07 ("Grok 4.6 previsto por volta de 7 de agosto"), e o post mais votado do r/cursor já contradiz a data, com um usuário apontando que a previsão original virou "semana que vem" · ponto novo no claim do aumento de preço da DeepSeek: no corpo do 3º post mais votado do r/LocalLLaMA, dax, do OpenCode, afirma ter conseguido igualar o preço atual da API até com GPU alugada, e lê o aumento como controle de tráfego por infraestrutura sobrecarregada, não como prejuízo (relato de terceiro citado dentro de um post, não conferido na origem) · não resolvido e declarado: dois posts do mesmo dia leem o Artificial Analysis de formas diferentes sobre o Qwen 3.8 Max, um dizendo "melhor modelo geral, à frente do Opus 5, no índice agêntico" e outro dizendo "quinto no ranking"; não abrimos o site. Quem resolve claim é o fechamento semanal, não esta edição.
Teto de palavras, 3º dia de estouro e 1ª vez tratado dentro da rodada. A primeira versão desta edição fechou em 2.923 palavras medidas com wc -w, contra teto de 1.800 (05/08 fechou em 2.078 e 06/08 em 2.525, os dois publicados com estouro declarado). Aplicada a régua da skill, que manda cortar item e nunca encolher a didática dos que ficam: dois itens saíram do corpo e viraram menção, e a seção de comunidade caiu de três para duas falas por fio. O corte foi medido e comprou pouco: 2.923 para 2.666 palavras, ainda 48% acima do teto, que é a segunda medição seguida mostrando que o peso não está nos itens (ontem cortar um item inteiro derrubou 28 palavras). A decisão estrutural, subir o teto ou mandar contagem e coleta pra anexo, é do fechamento semanal de domingo.
Verificação: 16 checagens, 3 correções. (1) A URL do post da Anthropic montada a partir do título deu 404; o slug correto veio do índice do newsroom. (2) O 2608.04570 aparece no ranking do Hugging Face de 06/08 mas foi submetido em 05/08; a data usada aqui é a do paper, não a do ranking. (3) O 2607.21735, "What AI Red-Team Evaluations Can and Cannot Prove", que estava no ranking de 06/08 e casaria perfeitamente com o arco da semana, é de 23/07. Não entrou como item do dia. É a 5ª vez que a checagem de recirculação barra um item, e a 3ª vez que o barrado veio do ranking por voto do Hugging Face, não do Reddit. Datas conferidas contra o calendário do sistema; os IDs de arXiv citados conferidos abrindo a página /abs/; números da contagem conferidos contra o JSON da coleta; séries citadas saíram da tabela do ledger, não de memória de sessão.