Uma empresa israelense publicou o relatório de uma campanha em que agentes de IA invadiram sistemas do governo de Taiwan sozinhos, e Taiwan confirmou na quinta. A ferramenta roda sobre dois projetos de código aberto que qualquer pessoa baixa hoje. Poucas horas depois, a Z.ai lançou o GLM-5.3 dizendo que a capacidade cibernética do modelo cresceu mais rápido do que ela esperava.
Uma empresa israelense de segurança publicou o relatório de uma campanha em que agentes de IA invadiram sistemas do governo de Taiwan sozinhos, do reconhecimento à extração de dados, e Taiwan confirmou o ataque na quinta-feira. A ferramenta não foi escrita do zero: ela roda sobre dois arcabouços de agente de código aberto que qualquer pessoa baixa hoje, o Hermes e o OpenClaw. Poucas horas depois, a Z.ai lançou o GLM-5.3 dizendo que a capacidade cibernética do modelo cresceu mais rápido do que a empresa esperava conforme o treino escalava, e que os pesos abertos saem em duas semanas. As duas notícias tratam da mesma pergunta pelos dois lados: o que acontece quando a peça que dirige o ataque deixa de ser cara e passa a ser um download.
Ressalva da própria casa, e ela desmente a manchete: o painel de fóruns que este radar mede todo dia pôs segurança em 2,4% dos títulos, cinco posts em 207, justamente no dia em que o assunto é este.
Os incidentes que este radar registra desde 30/07 eram de laboratório, com o modelo saindo do escopo do próprio teste. Este tem alvo real, sem consentimento e sem avaliação em volta, e o que muda a economia da operação é o arcabouço, que ninguém precisou de acesso privilegiado para obter. A atribuição a atores ligados à China é suspeita levantada por especialistas, não confirmação de Taiwan nem da Dream.
Um post do r/LocalLLaMA já circulava na madrugada com o título "GLM 5.3 weights", e o corpo dele é uma frase de expectativa. Os pesos não estão publicados. O argumento de quem defende peso aberto tem sido que modelo aberto é ativo defensivo, e aqui a mesma empresa publica um recorde ofensivo, um prazo de abertura e uma quarentena entre os dois.
A tese de que o preço por token só cai perdeu o dia, e o caso da DeepSeek fecha o claim aberto em 06/08, quando a empresa avisou de aumento "significativo" sem número e sem data. No mesmo movimento, os pesos do V4 Pro apareceram no Hugging Face, com 1,7 trilhão de parâmetros e 893 GB, registrado por Simon Willison como atualização do post dele.
É a própria empresa dizendo, em post de produto, que triplicar a nota veio de duas configurações de API e não de peso novo. O arco do arcabouço como variável de confusão do benchmark, aberto aqui em 16/07, ganha o registro mais explícito que já teve, e vindo do fabricante.
O exercício também mediu o limite dos agentes que fizeram o trabalho pesado, com os organizadores registrando que a execução puramente automática "esbarra em limites reais", em agentes presos em laço e lendo errado comportamento que depende de escala. Vale ler ao lado dos autorrelatos que este radar publica todo dia com a etiqueta "sem replicação".
2608.12888, de 13/08. O ReFind não transforma a conversa em resumo nem em grafo de conhecimento: ele deixa o arquivo intacto, indexa por turno e deixa o agente buscar. Sobre cerca de 2.800 perguntas do MemoryAgentBench, marca 58,2 de acerto médio contra 53,2 do HippoRAG 2, sistema de memória estruturada usado como referência, e faz 93,2 e 89,3 nos dois recortes do LongMemEval.Sétimo trabalho em duas semanas apontando que a estrutura construída em volta do agente cobra em custo e não devolve em acerto, série aberta aqui em 04/08. Autorrelato sem replicação, e sete papers concordando não é um resultado replicado. Do mesmo lote, 2608.12851 mede o outro lado: agentes que aprendem sozinhos guardam também o atalho inseguro que funcionou. Em 25 configurações e 13.125 tarefas, 21 das 25 produziram artefato inseguro, 15 causaram dano em sessão nova, e a taxa de sucesso de ataque por herança subiu de 16,0% para 35,3%.
2608.11924, o maior voto do lote de 13/08. O Spark-to-Paper implementa treze skills componíveis dentro de um assistente de código já existente, separando o julgamento do modelo das operações determinísticas. Números declarados: 99,5% de validade de citação, detecção de fabricação de 14% em passada única para 92% com o sistema completo, 11,9 milhões de tokens e US$ 8,10 por manuscrito, média de 3,2 horas para 24 páginas com 10 figuras, sobre 8 temas controlados. Do lado cético, 2608.13417 avaliou 7 modelos de fronteira em 36 tarefas longas de pesquisa e desenvolvimento e conclui que os agentes atuais operam "mais como otimizadores de engenharia do que como pesquisadores autônomos", com novidade metodológica rara e desempenho sensível ao desenho do arcabouço.Terceiro ponto do arco aberto no fechamento da W32, quando 5,7% dos títulos de um lote semanal do arXiv traziam "skill" ou "harness" sem que nenhuma das duas estivesse na consulta. No lote agnóstico de hoje, sem filtro de tema, são 5 de 120 títulos (4,2%), e duas entradas novas do GitHub trending desta semana são pacotes de skill: kepano/obsidian-skills (46.106 estrelas, +292 no dia) e anthropics/skills (169.292, +312). Estrela mede atenção, não adoção.
O índice existe porque parte do trabalho que se espera de IA sobre risco de IA não tem resposta conferível, ao contrário de matemática e código. O teto de 91 é estimativa dos autores, não medição.
O autor abre dizendo que o conteúdo genérico de "a IA vai substituir tudo" cansou e deu lugar a caso de uso chato e específico. A resposta que fica estranha ao lado do item 1 veio de quem não sabia da notícia:
"Parece que a empolgação com o OpenClaw esfriou. Acho que o Hermes pode ter tomado o lugar. Ou então ele não é tão útil quanto as pessoas achavam."/u/b00000001 · r/artificial · traduzido do inglês
E o comentário mais concreto do fio trocou demonstração por operação:
"A moda que estou feliz de ver sumindo é a empolgação de agente feito para demonstração. O que entra no lugar é automação de fluxo com escopo mais estreito, checkpoint humano, registro e governança sem graça em cima do que o agente pode tocar. Um agente que roda em segurança por 30 dias é muito mais interessante que um que fica incrível por 30 segundos."/u/InfoTechRG · r/artificial · traduzido do inglês
O autor argumenta que os índices de manchete do Grok 4.6 empatam com os do GPT-5.6 Sol, e que o número que ninguém publica é a taxa de abstenção: das perguntas que o modelo erra, quantas ele responde com "não sei" em vez de inventar. Ele cita 7,8% para o GPT-5.6 Sol contra 65,7% para o Grok 4.6, ante 45,9% do 4.5, e liga isso a erro que se acumula em cadeia de decisões:
"Cem por cento menos sessenta e cinco vírgula sete por cento dá trinta e quatro vírgula três por cento, ou seja, ainda tem 34% de chance de você levar gaslighting. O que parece ser bem menos que os outros modelos de topo."/u/Optimal_External1434 · r/cursor · traduzido do inglês
"Botei num repositório que era React e Vite e ele falava sem parar da engine Godot e de como a funcionalidade não cabe no Godot. Aí eu: meu chapa, é React e Vite. Ele: ah, foi mal, você tem razão."/u/Celstra · r/cursor · traduzido do inglês
Vale a régua: são falas de duas pessoas num fio, e o número do autor vem de um teste de terceiro que ele não linkou.
O fio mais votado do sub sobre o item 3 não discutiu a nota, discutiu a cadência:
"Meio surpreendente, porque parece que o Google de repente começou a soltar um modelo Flash por mês. Fico pensando se isso virou o normal. Um passo pequeno por mês."/u/Longjumping_Kale3013 · r/singularity · traduzido do inglês
Outro lembrou que Sundar Pichai anunciou essa cadência quase mensal na chamada de resultados do segundo trimestre, e a objeção comercial mais direta foi: "considerando o quanto ele é mais barato e melhor na maioria das avaliações, por que alguém usaria a API do Sonnet 5.0 em vez desta?"
209 títulos brutos, coleta do cron às 06h05, menos 2 descartes por mesmo autor e mesmo tema: /u/KeanuRave100 publicou "AI researchers are receiving strange emails from AIs..." e "Imagine boomers not following AI reading this sentence" no r/OpenAI e no r/agi.
Agentes/orquestração em 11,1%, 11º ponto comparável, dois dígitos em 10 de 11. Sequência: 10,0% · 15,5% · 12,2% · 8,5% · 12,3% · 12,1% · 12,7% · 10,8% · 11,9% · 10,7% · 11,1%. Média dos onze: 11,7%, a mesma da medição anterior. 8 das 23 ocorrências vêm do r/AI_Agents, a menor concentração proporcional já medida (35% contra cerca de metade em todas as rodadas anteriores), e isso importa para o julgamento marcado na W34: o limite escrito no fechamento da W32 dizia que a leitura de "fracasso operacional" vale para aquele sub, e hoje o balde está mais espalhado, com 3 ocorrências no r/artificial e 3 no r/LangChain. Revisita: W34.
Memória/contexto em 1,9%, menor valor da série t=day desde o congelamento da taxonomia. Sequência: 3,3% · 3,7% · 2,7% · 3,3% · 5,5% · 3,6% · 2,3% · 3,6% · 5,2% · 3,6% · 2,6% · 1,9%. O piso anterior era 2,3% (07/08). São quatro ocorrências em quatro subs: r/OpenAI (o ChatGPT Computer History, que lembra trabalho entre aplicativos do Mac), r/AI_Agents (camada de memória do Amazon Bedrock AgentCore), r/LangChain (arquiteturas de memória de longo prazo) e r/cursor (janela de contexto por prompt). Nenhuma é memória RAM de hardware. Duas quedas seguidas abaixo da faixa histórica de 2,3% a 3,7%: registrado, não interpretado. Revisita: W34.
MCP em 0,0%, 3º zero da série, e o primeiro par de zeros seguidos. Sequência: 0,9% · 1,9% · 1,5% · 0,5% · 1,9% · 1,2% · 0,0% · 1,5% · 0,0% · 0,0%. Com base histórica de cerca de 1%, a expectativa em 207 títulos era 2 posts.
Segurança em 2,4%, 5º ponto da série v2.9.0, e o instrumento volta a perder a manchete. Sequência: 2,4% · 3,8% · 1,0% · 2,6% · 2,4%. Os cinco títulos: "Hackers used autonomous AI agents to attack Taiwan" (r/artificial, hack e cyber), "Taiwan says it was hit by 'abnormal' AI-assisted cyber-attack" (r/agi, cyber), "If an AI agent can hack systems during testing, should we be treating agents like security principals?" (r/artificial), "OpenAI, Anthropic AI Incidents Raise Questions Over Cybercrime Laws" (r/OpenAI, cyber) e "What ai agent security actually requires beyond model guardrails" (r/AI_Agents, security). Dois dos cinco são a manchete, o que é melhor que em 12/08, quando nenhum casou. O que a lista congelada perdeu hoje: "GLM 5.3 released: Frontier Coding with Emergent Cyber Capabilities" (r/singularity) caiu em open weights/local pela palavra GLM, porque o balde 6 vem antes do 7, e "The attack surface of your agent" (r/artificial) caiu em agentes porque a lista tem exploit e breach e não tem attack. Quinto defeito medido em cinco dias. Vai ao fechamento semanal junto com "vulnerability" (10/08), "zero-day" (11/08), roubo e extração de raciocínio (12/08) e exclusão por contexto para hackathon (13/08). Anotado sem recontar nada nesta rodada.
Outras aplicações de critério declaradas: "Open weights model usage on OpenRouter declined to below 50%" (r/OpenAI) tem usage, do balde 5, e foi para open weights por assunto · "Finally, Claude Code has 'Auto-continue when limits reset'" (r/ClaudeAI) foi para custo/limites e não para coding tools, pela regra de que o assunto ganha do substantivo · "Decoupling Intent from Execution: Why Deterministic Policy Gateways Must Replace LLM-Based Guardrails" (r/LangChain) casa policy do balde 14 e trata de guardrail de agente; ficou em outros para não inflar segurança no dia em que segurança é a manchete · "I spent weeks testing ChatGPT & Claude prompts for local brick-and-mortar shops" (r/PromptEngineering) tem local do balde 6 e trata de comércio de bairro; ficou em outros.
| sub | posts | status |
|---|---|---|
| r/LocalLLaMA | 25 | ok |
| r/OpenAI | 25 | ok |
| r/singularity | 25 | ok |
| r/ClaudeAI | 25 | ok |
| r/AI_Agents | 25 | ok |
| r/cursor | 25 | ok |
| r/artificial | 17 | ok |
| r/PromptEngineering | 14 | ok |
| r/LangChain | 12 | ok |
| r/agi | 9 | ok |
| r/MachineLearning | 7 | ok |
r/agi em 9 posts, 6º ponto da série, e o maior valor já medido para o sub (7 em 07/08, 3 em 10/08, 7 em 11/08, 3 em 12/08, 6 em 13/08, 9 hoje; média das seis: 6,2). Pela terceira vez em seis medições ele não é o menor do painel: hoje o r/MachineLearning veio com 7. Seis subs empatam no teto de coleta de 25, então esses seis são piso e não medida. Dado qualitativo para o julgamento da W34: dos 9 posts do r/agi, 2 são repostagem do mesmo autor vinda do r/OpenAI e descartada na dedup, e o post do ataque a Taiwan é um dos que o sub trouxe e o painel geral quase não trouxe.
120 títulos, todos com data de submissão de 13/08, ou seja, announcement de véspera, status ok direto do cron pelo segundo dia seguido. Contagens sobre esse lote: "agent" em 11 de 120 (9,2%) · "skill" ou "harness" em 5 de 120 (4,2%) · "memor" em 3 de 120 (2,5%).
Comparação com os lotes anteriores, e a leitura segue sendo de cautela: "agent" fez 11,7% (10/08), 17,2% (11/08) e 10,0% (13/08); "skill"/"harness" fez 0,8%, 6,0% e 3,3%; "memor" fez 7,5%, 0,9% e 1,7%. A camada não serve de âncora sozinha, e agora são quatro pontos dizendo isso.
100 títulos, todos de 13/08, status ok. Foi daqui que saíram os itens 6 e 7 (com o 2608.11924 vindo do ranking orgânico do Hugging Face, e por isso etiquetado ORGÂNICO). Outros do lote que batem em arcos abertos e ficam registrados para a semanal: RippleMem · LycheeMemory V2 · Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories · Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation · Predictive Memory Localization · Agent Behavioral Contracts II · Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents.
Lembrete de procedência, pedido pelo Pedro em 13/08: a camada direcionada filtra por oito termos (agent, memory, retrieval, RAG, MCP, interpretability, mechanistic, planning), que são focos declarados. Por isso todo paper leva etiqueta de origem, e não há cota.
Lote de 13/08, 27 papers na página. Topo por voto: 2608.11924 (Spark-to-Paper, ▲547), 2608.11574 (Hand Visibility Detector, ▲42), 2608.12036 (Mechanist, ▲30) e 2608.09926 (world models por dinâmica latente, ▲30). Quatro dos 27 são de skill ou de arcabouço: além do primeiro, 2608.12307 (AI4AI at Test-Time, via arcabouços), 2608.05604 (SkillZip) e 2608.11350 (Self-Evolving Embodied Agents via Skill-Harness Evolution).
Coleta ok pelo segundo dia, 17 repositórios estruturados pelo parser próprio. Base do delta desta semana: os repos citados em 10, 11, 12 e 13/08 (semantica, diagram-design, agency-agents, macro, needle, ragflow, Switchyard). Dez entradas novas, das quais três interessam ao radar:
1. kepano/obsidian-skills, skills de agente para o Obsidian, ensinando o agente a usar a linha de comando do aplicativo e formatos abertos. 46.106 estrelas, +292 no dia.
2. anthropics/skills, repositório público de Agent Skills. 169.292 estrelas, +312.
3. holaboss-ai/holaOS (TypeScript), espaço de trabalho aberto para rodar Claude Code e Codex sobre mais de 100 integrações com memória compartilhada. 6.865 estrelas, +241.
As outras sete entradas novas do painel são fora de escopo do radar (dois pacotes de segurança ofensiva clássica, um app de ditado, um motor de animação, um gerador de vídeo, um gerador de 3D e uma interface local de treino).
10 de 10 fontes com status ok, segunda edição seguida sem nenhum gap de coleta. Janela declarada de 36h. Rendimento: OpenAI 3 itens no RSS, os três com corpo lido pelo leitor proxy · DeepMind 1 (o Gemini 3.7 Flash, lido direto) · Willison 5 posts · blog do Hugging Face 2 · Interconnects e Import AI vazios na janela · Anthropic pelo índice do newsroom, cujo item mais recente segue sendo o de biologia de 07/08. O Índice de Raciocínio Conceitual do item 8 não aparece ali: ele mora em alignment.anthropic.com, que o coletor não varre, e chegou pelo painel do Reddit. É o mesmo buraco anotado em 11/08 para anthropic.com/research/, e agora tem dois pontos.
arXiv agnóstico 120 · arXiv direcionado 100 · GitHub trending 17. O openai.com segue respondendo 403 no HTML e 200 no RSS, pelo 8º ciclo. A página z.ai/blog/glm-5.3 respondeu vazia ao WebFetch direto e 200 com conteúdo pelo leitor proxy, mesmo padrão medido em 05/08.
VENCE HOJE, e quem dá o veredito é o semanal: o auto mode vira padrão do Claude Code em 14/08 (claim registrado em 10/08 a partir de fonte primária). Não conferido nesta rodada.
FECHA o claim de 06/08 (aumento de preço da DeepSeek sem número e sem data): a tabela nova está publicada, vigente em 16/08, com aumento de 50% a mais de 1.000% e cobrança por horário de pico.
PONTO NOVO no claim de 16/07 (o arcabouço vale pontos de benchmark): a OpenAI publicou em post de produto que o ARC-AGI-3 foi de 13,3% para 38,3% com duas configurações de API e 6 vezes menos tokens de saída, sem trocar de modelo.
7º PONTO na série "a estrutura em volta do agente paga em custo, não em acerto" (aberta em 04/08): 2608.12888.
3º PONTO no arco "skill como objeto" (aberto no fechamento da W32 com âncora lexical de 5,7%): 2608.11924 no topo do ranking orgânico, 2608.12851, mais quatro dos 27 papers do lote do Hugging Face e duas entradas novas de skill no trending.
Novos registrados hoje: ataque autônomo a Taiwan · GLM-5.3 com 84,5 no CyberGym e pesos prometidos em duas semanas · Gemini 3.7 Flash a metade do preço com promoção até 31/12/2026 · pesos do DeepSeek V4 Pro no Hugging Face, 1,7 T e 893 GB · Ultrafast com a Cerebras a 750 tokens/s · reprodução de 2.226 papers do ICML · Índice de Raciocínio Conceitual com Opus 5 em 73,6 · volume por sub, 6º ponto do r/agi.
1. "CyberBench" corrigido para "CyberGym". A primeira redação do item 2 usava "CyberBench 84,5", número que veio de cobertura secundária. A página oficial da Z.ai, aberta pelo leitor proxy, diz CyberGym. O nome foi trocado antes de publicar, e o CyberGym é o mesmo teste em que a Sakana declarou 86,9% em 21/07, o que torna a confusão de nome mais cara do que parece.
2. "Os pesos do GLM-5.3 saíram" barrado antes de sair. Um post do r/LocalLLaMA às 04h45 (horário de Brasília) tem o título "GLM 5.3 weights"; o corpo é uma frase de expectativa e a página oficial diz que os pesos saem em cerca de duas semanas. O item foi reescrito para dizer o que a fonte primária diz.
Também conferido: dia da semana pelo relógio do sistema (sexta-feira, 14/08/2026) · 2608.12888, 2608.12851, 2608.13417 e 2608.11924 abertos em arxiv.org/abs/ com título, data e números batendo, os três primeiros submetidos em 13/08 e o último em 12/08 · preços da DeepSeek lidos na documentação oficial da API, não na cobertura, incluindo a data de vigência de 16/08 (uma manchete do Qz diz 16 e o texto de outra cobertura diz 17; a doc oficial diz 16 e é o que vale aqui) · preços e benchmarks do Gemini 3.7 Flash lidos no post do DeepMind, incluindo a nota de rodapé do fim da promoção · números do Ultrafast e do guia do GPT-5.6 lidos no corpo do snapshot das fontes primárias · números do ICML lidos no post do Hugging Face · composição do Índice de Raciocínio Conceitual lida no blog de alinhamento da Anthropic · a alegação de que a OpenAI comprou 4,2% da Cerebras, título de um post do r/OpenAI, ficou FORA do item 4: a busca não encontrou nada com esse número, e o que existe publicado é um acordo de mais de US$ 20 bilhões em chips que pode dar cerca de 11% da empresa, noticiado pela The Information · autores dos dois descartes verificados um a um · contagem por bucket reconciliada contra o JSON, com a soma por sub fechando em 209 e a contagem em 207 · séries lidas do ledger, não de memória de sessão.
O cold-read por subagente limpo NÃO rodou nesta edição. A instrução de sessão em vigor no canal proíbe abrir subagente sem pedido explícito, e a régua da skill diz que o cold-read é rede de segurança e nunca portão. Fica declarado, com a limitação que anda junto: a cicatriz de 27/07 é justamente que eu sou cego ao meu próprio padrão de escrita, e a contagem que eu mesmo faço acha uma fração dos casos.
Tetos declarados antes de escrever, e a contagem que consegui fazer sobre corpo e roteiro: antítese "X, não Y" teto ≤ 3, medido 3 · "não é X, é Y" teto ≤ 1, medido 1 · regra de três teto ≤ 4, medido 2 · sentença-veredito curta de fechamento teto ≤ 3, medido 3 · superlativo de relevância teto ≤ 3, medido 2. Nenhum teto estourado pela minha própria contagem, que é exatamente o resultado que a cicatriz manda desconfiar.
Corpo (manchete, oito itens e comunidade), medido com wc -w: 2.359 palavras, 31% acima da referência de cerca de 1.800. Nenhum item foi cortado, conforme a régua de 13/08: o estouro fica declarado e o aperto foi de prosa, numa passada que tirou 60 palavras. O contexto que a referência não captura: são 8 itens contra 5 ontem, e por item o corpo hoje tem 295 palavras contra 367 ontem, ou seja, 20% mais enxuto por item.
Roteiro de áudio, medido antes de salvar: 11 capítulos (abertura, item-1 a item-8, comunidade, fecho), 2.034 palavras de fala, cerca de 13 minutos e 34 segundos a 150 palavras por minuto. Todo item da página tem capítulo no áudio, conforme a paridade de informação decidida em 13/08, e por isso não há teto de duração. Densidade por item igual à de ontem (255 palavras por item hoje, 258 ontem). Uma passada mecânica reescreveu 11 frases acima de 25 palavras e quebrou 3 frases com mais de dois números. Nenhum assunto aparece em dois capítulos, e nenhum termo de método foi narrado.
Casamento de capítulo e seção, conferido antes de salvar. Não existe capítulo manchete: o botão dela aponta para o item-1, que é o dono do fato. O fio do Gemini da seção de comunidade é narrado dentro do capítulo item-3, e o fio do Grok dentro do capítulo comunidade. Todos os data-cap desta página existem como id no roteiro.
Resumo do Telegram: 3.537 caracteres, 1% acima do teto de 3.500 da skill, e bem abaixo do limite de 4.096 do Telegram mesmo depois do rodapé que o cron acrescenta. Cinco passadas de corte tiraram 283 caracteres sem perder bullet nenhum; a próxima teria custado fato.
Régua da seção de comunidade: fala citada é o que a pessoa escreveu, não o que ela quis dizer; comentário é opinião de uma pessoa e nunca vira "a comunidade acha X"; posição no ranking mede atenção, não consenso; e três fios não são amostra de nada.