Na semana passada o dano de agente ainda morava dentro do teste de laboratório. Nesta semana ele saiu, e o arcabouço que dirigiu o ataque a um governo é um programa que qualquer pessoa baixa hoje.
Em 12/08 a Dream, empresa israelense de segurança, publicou o relatório de uma campanha de quatro dias no começo de julho: até oito agentes autônomos em paralelo mapearam 21 sistemas do governo de Taiwan, quebraram 85 contas e extraíram mais de 2.500 registros de pessoal, com "ciclos de aprendizagem" varrendo bases de vulnerabilidade e repositórios do GitHub para decidir o passo seguinte. A expansão para a agência de segurança nuclear e para empresas de energia foi autônoma. Taiwan reconheceu o ataque em 13/08.
O detalhe que muda a conta não é o alvo: a base técnica são dois frameworks de agente de código aberto, o Hermes e o OpenClaw, disponíveis pra qualquer pessoa hoje.
procedência: relatório original não público · cobertura de três veículos + confirmação de Taiwan · atribuição a grupos ligados à China é suspeita de especialistas, sem confirmação
O caso fechou uma semana em que o dano de agente apareceu em três tamanhos: no doméstico, o agente de uma pessoa comum cancelou sozinho a reserva de academia dela (o mesmo OpenClaw); no laboratório, a Anthropic publicou um estudo em que três agentes com metas incompatíveis se sabotaram em 120 episódios por modelo; e no estatal, Taiwan. São naturezas diferentes, e agrupá-las é escolha editorial declarada (o veredito do arco está em arcos).
Na segunda a OpenAI colocou no ar o GPT-5.6-Cyber, treinado para recusar menos: nos números da própria empresa, 95,0% dos pedidos avançados de ciberataque atendidos, contra 1,5% do modelo geral (autorrelato, sem verificação externa). Na terça esses modelos entraram no Amazon Bedrock, a vitrine de modelos da Amazon para empresas. Na quinta a Z.ai lançou o GLM-5.3 escrevendo que a capacidade cibernética "cresceu mais rápido do que antecipávamos" conforme o treino escalava, com os pesos abertos prometidos para o fim do mês.
O GitSkills mediu o ecossistema pela primeira vez: 3.797.117 arquivos SKILL.md em 282.200 repositórios públicos, nove meses depois de o formato existir, sem registro central, sem gerenciador de pacote e sem verificador que confira a seleção: skill se espalha por cópia de pasta. O ColluSkill mediu o risco disso: fatiando uma intenção maliciosa em skills separadas, cada uma inofensiva sozinha, o ataque passa por seis verificadores com 96,0% de sucesso. Os dois estudos são autorrelato, sem replicação independente.
O mercado conta a mesma história: o repositório que mais cresceu no GitHub na semana é um pacote de skills de diagramas (+14,7 mil estrelas), e um pacote de 24 skills de engenharia declara suporte a mais de 70 agentes de código. Estrela mede atenção, não adoção. Os cinco papers e cinco repositórios em detalhe: apêndice.
O Evo-Bench mede se um modelo consegue melhorar o próprio ambiente de operação, e o achado incomoda quem compra modelo por nota de benchmark: a diferença entre modelos aparece mais nesse trabalho de estrutura do que na tarefa direta. A OpenAI publicou na mesma direção, sobre o próprio produto: o mesmo modelo vai de 13,3% para 38,3% num teste de raciocínio ligando duas configurações de API, "nenhuma mudança no modelo, quase três vezes o desempenho".
E dois trabalhos atacaram a memória de agente pelo mesmo flanco: guardar texto e recuperar depois está deixando dinheiro na mesa. Um propõe compilar a experiência em programa executável; o outro, compilar a intenção recorrente do usuário em agentes especialistas. Autorrelatos. O sinal que fica: o campo parou de propor arquitetura nova e passou a brigar pela definição do que "memória de agente" significa.
A briga já tem produto dos dois lados: o prime-agent (+8,5 mil estrelas na semana) guarda e refina os próprios prompts e memórias por comando, e o semantica aposta no oposto, registrar cada fato num grafo com procedência ("agentes guardam vetores, não significado"). Régua de confiança pra tudo isso: o mutirão de revisão do ICML derrubou ao menos uma alegação em 23% dos 2.226 papers examinados.
A Alibaba abriu o Qwen3.8-2.4T-A95B em 12/08, e a própria página do modelo declara a diferença: a versão de API tem visão, modo sem raciocínio, 1 milhão de tokens de contexto e ferramentas embutidas; o pacote aberto é só de texto e exige o modo de raciocínio em toda interação. Peso aberto de fronteira deixou de ser cópia fiel do produto pago. Dois dias depois saiu o irmão de 27B em Apache 2.0, e o fórum de modelos locais virou monotema. A Bloomberg fechou a semana com o alcance: mais de 3 bilhões de downloads da família Qwen em seis meses, contra ~418 milhões do Google e 227 milhões da Meta em 2026.
O autor da newsletter Interconnects abriu o painel que este radar esperava desde a semana passada: 805 modelos de pesos abertos, de 269 organizações, com quatro eixos por modelo, entre eles tokens processados por dia e downloads de 30 dias. Exemplos lidos na página: DeepSeek-V4-Flash com 1,6 trilhão de tokens por dia, Gemma 4 26B com 10,1 milhões de downloads no mês. Não localizamos o corte por geografia que a descrição promete.
O contraste da semana: o hub de memória de agentes da Tencent seguiu no trending pela segunda semana, com o ritmo de estrelas caindo pela metade (+3.956 contra +7.501). Estrela acompanha o anúncio; uso é o que o painel novo começa a mostrar.
O Gemini 3.7 Flash saiu por metade do preço do 3.6, três semanas depois dele, com promoção declarada até 31/12. No sentido oposto, a tabela nova da DeepSeek entra em vigor hoje às 16h UTC: aumentos de 50% a mais de 1.000% e estreia de cobrança por horário de pico, coisa rara entre as grandes APIs (conferido na documentação oficial às 9h de hoje). E o alerta de circulação da semana: a OpenAI testa um botão de US$ 8 para restaurar a cota semanal, e o post mais votado dizia US$ 80. Dez vezes o valor real muda a leitura inteira.
O auto mode virou o padrão do Claude Code em 14/08 nos planos pagos, exatamente como o anúncio de 08/08 prometia: o agente executa sem pedir permissão a cada ação. Nos fóruns que discutem a ferramenta, o assunto da semana era outro, a diferença de prosa entre dois modelos. Ressalva de medição: o painel lê 25 posts por subfórum e os comentários dos primeiros colocados, então isso é ausência no corpo coletado, não no fórum inteiro.
Erro nosso, e a divergência era leitura errada de um arquivo de configuração. A edição de 11/08 registrou três números incompatíveis de contexto para o Muse Glimmer 30B: 131.072+ no cartão, 32.768 no blog de lançamento e 1 milhão num relato de usuário. Reaberto hoje: os 32.768 do blog são o campo contextWindow de um exemplo de configuração do OpenClaw, e não uma declaração de capacidade do modelo. O cartão declara 131.072+, e é esse o número. Não havia contradição entre fontes: havia um trecho de configuração lido como especificação.
Meta e Anthropic: o claim venceu hoje sem desfecho. Registrado em 17/07 a partir da CNBC, "conversas iniciais para arrendar cerca de US$ 10 bilhões de computação por dois anos", com revisita marcada para 16/08. Busca feita hoje: nada além da cobertura original de julho, sem confirmação, sem negativa e sem comunicado de nenhuma das duas empresas. A lição é sobre a categoria: conversa inicial noticiada por fonte anônima é o tipo de claim que quase sempre expira, e o valor dele está em vencer registrado.
A série de "incidente de avaliação virou padrão do setor" parou. Quatro pontos em oito dias entre 30/07 e 05/08, e zero nesta semana. Nenhum laboratório publicou revisão nova do próprio incidente de bancada. A série fecha com quatro pontos e o fenômeno não se repetiu; o que apareceu no lugar é outra coisa, e por isso vira arco novo em vez de ponto novo.
Notícias e leituras velhas barradas na semana, com a data real: a assinatura do Código de Prática europeu circulou em 12/08 como novidade, e é fato de 31/07 · a conjectura de Crouzeix voltou ao topo do r/OpenAI em 15/08 pela reportagem do South China Morning Post, e os dois manuscritos são de 24/07 e 04/08 · um post com o título "GLM 5.3 weights" tinha corpo de expectativa e os pesos não saíram · e o post mais votado do r/LocalLLaMA de 16/08 não teve anúncio confirmado e ficou de fora do corpo.
O número que dobrou de tamanho ao atravessar o fórum. A OpenAI testa um botão de US$ 8 para restaurar a cota semanal, e o post mais votado da janela de 16/08 traz US$ 80. Não é detalhe: com US$ 80 a leitura é punição a quem já paga, e com US$ 8 é uma faixa de preço abaixo do que custaria migrar de plano.
A marca d'água do Claude. Três edições, mais de 600 comentários somados nos fios, e o estado de fato não mudou uma vírgula: vale só para modelo lançado a partir de 02/08, nenhum modelo em produção hoje atende, não há detector público, e a empresa não publicou taxa de acurácia nem de falso positivo. A discussão foi quase toda sobre se a marca piora o texto, coisa que ninguém mediu e que ninguém consegue medir sem o detector.
O MCP. Caiu de 1,5% para 0,4%, com quatro zeros em sete dias, num balde diretamente comparável. Não é notícia de que o protocolo morreu: é a medida de que ele saiu do título, o que costuma acontecer com infraestrutura que virou rotina ou com infraestrutura que ninguém usa, e este instrumento não distingue as duas.
A briga entre Opus 5 e Opus 4.6 no r/ClaudeAI. Foi o post mais votado do subfórum no domingo, com gente voltando ao modelo anterior por clareza de prosa. É dado real sobre experiência de uso e não é dado sobre capacidade. O contraste com o item 5 lá em cima é o achado: no mesmo fim de semana em que o padrão de permissão da ferramenta mudou, o fórum discutia estilo de escrita.
fim do recap narrado · daqui pra baixo é a cozinha: papers e repositórios em detalhe, claims, séries, leituras julgadas, arcos e saúde da coleta. o boletim não narra esta parte; ela existe pra quem quiser conferir
A skill do fechamento semanal diz, com essas palavras, que esta seção morre na semana 33 e que reaparecer sem pedido é erro. O prompt do cron de hoje repete essa frase e, no mesmo texto, manda escrevê-la, com a coleta já feita e entregue. A instrução operacional venceu, e a contradição está registrada nas ações derivadas: o prompt parece ter herdado o texto da semana passada e precisa ser corrigido antes de domingo que vem.
Regras que valem inteiras. Nenhum diário foi reescrito. Estes itens não entram na agregação da contagem cega. Escolha pelo título, e fonte primária aberta nos dez antes de escrever.
O que o snapshot é, e o que ele não é. arXiv: 532 papers com a consulta direcionada de sempre na janela de submissão de 10 a 16/08, paginados, sem resumo. Ele cobre de fato 10 a 13/08, com 141, 141, 121 e 129 papers por dia, porque as submissões de sexta em diante não estavam indexadas na hora da coleta. É o mesmo corte da estreia, que prometeu sete dias e cobriu quatro, e com dois pontos isso vira propriedade do instrumento. GitHub: trending semanal, 16 repositórios.
25 com "skill", 9 com "harness", com sobreposição. Honestidade sobre o número: 2 dos 33 são falso positivo declarado (skill de robô e habilidade humana em colaboração); sem eles seriam 5,8%, e a semana passada também não foi limpa, então a comparação é bruto contra bruto. É patamar, não pico. No trending semanal, 4 dos 16 repositórios são de skill ou de memória de agente.
2608.10906, 11/08, engenharia de software). Varredura do GitHub em julho: 3.797.117 arquivos SKILL.md de 282.200 repositórios públicos, agrupados em 1.877.981 conteúdos distintos, num único SQLite com metadado de repositório e histórico de commit para um subconjunto.A justificativa dos autores é a parte que interessa: skills são escritos em linguagem natural, o modelo os seleciona probabilisticamente em tempo de execução, nenhum compilador ou verificador de tipo confere a seleção, e não existe registro central nem gerenciador de pacote, então eles se espalham por cópia de pasta entre repositórios. É o primeiro número de população do formato.
2608.09732, 10/08, segurança). Parte de uma medição dos verificadores existentes e acha o ponto cego: eles inspecionam uma skill de cada vez. O ataque decompõe a intenção maliciosa em sub-cargas interdependentes, embaladas em skills separadas e localmente plausíveis, que só formam o fluxo danoso na composição ordenada. Sobre seis verificadores representativos, 96,0% de sucesso médio. A defesa proposta junto derruba para 22,5% deixando passar 99,5% dos fluxos legítimos.É o quinto trabalho em duas semanas sobre a skill como superfície de ataque ou de falha, e o primeiro a mostrar que a granularidade da defesa está errada, não só o vocabulário dela: os quatro anteriores atacam uma skill, este ataca a composição. Autorrelato, sem replicação.
2608.09096, 10 e 11/08). Mede a capacidade de um modelo otimizar o próprio arcabouço de operação, com desenho feito para isolar isso da força do modelo base: identifica por evolução em tarefas auxiliares quais tarefas são sensíveis a melhoria de arcabouço, e depois separa os conjuntos por essa sensibilidade. Nove modelos, três domínios. Os melhores chegam a 16,6 pontos de ganho absoluto, "se aproximando das linhas de base construídas por engenheiro humano".Segundo protocolo de medição do arco do arcabouço em duas semanas, depois do 2608.06301, e os dois concordam num ponto incômodo para quem compra modelo por benchmark: a diferença entre modelos aparece mais no que eles fazem com a estrutura do que na tarefa direta.
2608.11338, 11/08). Entre as formas de aprender skill, as que tratam skill como programa são as que reduzem custo, porque executar sequência determinística entrega barato e confiável o que exigiria tentativa e erro num horizonte longo. Hipótese declarada: a trajetória passada já contém sinal suficiente, sem repetição e sem validação, desde que o agente aprenda a analisá-la.A série aberta em 04/08 tem sete pontos e vinha sendo lida como voto contra estrutura. Este paper e o de baixo apontam a distinção que ela não fazia: o que não paga é a estrutura interpretada em tempo de execução; a estrutura compilada é o outro lado. Fraqueza declarada: o resumo não publica número.
2608.08995, 10/08). Nomeia o padrão único para o qual a memória de agente convergiu (guardar como texto, vetor, reflexão ou regra, recuperar na inferência e deixar um orquestrador genérico interpretar) e argumenta que ele é o padrão errado para personalização. Propõe compilar intenção recorrente em agentes especialistas. 90 cenários reservados em cinco perfis, 88,9% de vitória onde o especialista foi acionado (32 de 36), ganho de 2,05 em personalização e custo de 0,28 em acerto, numa escala de 1 a 4.Casa com o item anterior e com o 2608.11654 da mesma semana, que tenta dar definição formal a "memória de agente". A literatura passou de propor arquitetura para brigar sobre o que a palavra significa. Autorrelato, amostra pequena.
google/skills da semana passada levado ao extremo por um autor individual, e 9,4 mil forks é gente copiando a pasta, que é exatamente o mecanismo de espalhamento que o paper 1 mediu.DeepSeek, resolvido com hora exata. A tabela nova entra em vigor às 16h UTC de hoje, com pico das 01h às 04h e das 06h às 10h UTC e fora de pico pela metade. V4-Flash de US$ 0,14 e US$ 0,28 para US$ 0,44 e US$ 1,32 no pico; V4-Pro de US$ 0,435 e US$ 0,87 para US$ 1,32 e US$ 3,96. O maior salto proporcional é o do cache do V4-Pro, de US$ 0,003625 para US$ 0,044, que confirma o "mais de 1.000%" registrado em 14/08. Segue aberto se o aumento é margem ou controle de tráfego: a tabela sozinha não decide.
O painel do Interconnects foi aberto, e era um item de vergonha própria. A semana passada registrou explicitamente que ele não tinha sido aberto e que os 792 modelos vinham da edição diária, para não virar dado herdado. Aberto hoje: 805 modelos de peso aberto, 269 organizações, com quatro eixos por modelo, entre eles tokens por dia no OpenRouter e adoção relativa. Exemplos lidos: DeepSeek-V4-Flash com 1,6 trilhão de tokens por dia, Gemma 4 26B com 10,1 milhões de downloads em 30 dias. Não localizamos o corte por geografia que a descrição promete. A distinção entre atenção e adoção, que este radar cobra toda semana, passa a ter fonte pública.
Cumprido na data: o auto mode virou padrão do Claude Code em 14/08, com a página reaberta hoje sem correção. Expirado na data: Meta e Anthropic. Resolvido na data com fato novo: os pesos do Qwen 3.8 Max saíram em 12/08, e o pacote aberto não é o modelo que a API serve.
Vencendo nos próximos 30 dias: 28/08, pesos abertos do GLM-5.3 · 31/08, GLM 5.5 · 01/09, volta do preço cheio do Sonnet 5 · 07/09, Grok 4.7 · 15/09, Cloudflare bloqueando agentes por padrão.
Soma dos baldes das sete tabelas diárias, todas em janela de um dia e na mesma taxonomia. A soma bate com os totais declarados em cada edição, sem errata: a semana passada teve uma diferença de um título, esta não tem.
| balde | n | % da semana |
|---|---|---|
| outros | 495 | 37,1% |
| modelos (release/capacidade) | 192 | 14,4% |
| agentes/orquestração | 149 | 11,2% |
| open weights/local | 120 | 9,0% |
| coding tools | 102 | 7,6% |
| custo/limites | 72 | 5,4% |
| memória/contexto | 44 | 3,3% |
| skills/harness | 39 | 2,9% |
| imagem/vídeo/voz | 30 | 2,2% |
| segurança | 25 | 1,9% |
| benchmark/eval | 20 | 1,5% |
| emprego/social/política | 16 | 1,2% |
| agi/futuro | 12 | 0,9% |
| labs/negócio | 11 | 0,8% |
| mcp | 6 | 0,4% |
| interpretabilidade | 1 | 0,1% |
Duas ressalvas antes de qualquer comparação com a semana passada, e elas não são formalidade. Primeira: a W32 foi medida em taxonomia v2.8.0 e esta em v2.9.0, então "segurança" e "benchmark/eval" não são comparáveis entre as duas, e "custo/limites" ganhou um termo. Segunda, e é nova: esta é a primeira semana com sete edições contra as quatro da anterior, com dois dias de fim de semana dentro. Comparação entre as duas semanas é indicativa, não medição.
Agentes em 11,2%, contra 11,3%. Treze pontos comparáveis, média 11,5%, série estável dentro de meio ponto há três semanas. O achado é de composição, e fecha uma pergunta aberta desde 23/07: 77 das 149 ocorrências vêm do r/AI_Agents, ou 51,7%, medido sobre sete rodadas em vez de uma. A concentração diária oscilou de 35% a 64%, e o número semanal mostra que a oscilação é ruído em volta de exatamente metade. O primeiro ponto abaixo de dois dígitos da série inteira apareceu no domingo, 9,4%, e entra sem veredito por ser o primeiro domingo.
Memória em 3,3%, dentro da faixa histórica de 2 a 3,7%, com a maior amplitude já medida dentro de uma janela: 5,2% em 11/08 e 1,9% em 14/08, o segundo maior e o menor valor de toda a série, com quatro dias entre eles. Nicho de 3% oscila por ruído com n de 200, e esta semana é a demonstração disso.
Skills e harness em 2,9%, contra 1,7%. É o único balde substantivo que quase dobrou, e é o balde do arco da semana. Nenhum termo dele mudou na v2.9.0, então a comparação é mais limpa que a média da tabela, mas ainda cruza a fronteira de taxonomia e de amostragem. Com os 6,2% do arXiv e os 3,8 milhões de arquivos do GitSkills, é a terceira medição independente na mesma direção.
MCP em 0,4%, contra 1,5%, com quatro zeros em sete dias, num balde cujos termos não mudaram entre as taxonomias, o que faz dele um dos poucos números diretamente comparáveis. Registrado sem interpretação: o protocolo pode ter saído do título sem sair do uso, e este instrumento só mede título.
Sete defeitos medidos em sete dias seguidos, um por edição: falta de vulnerability (10/08) · falta de zero-day, com o título indo para "benchmark/eval" pela palavra eval (11/08) · falta de vocabulário de roubo e extração de raciocínio, com os três títulos da manchete não casando nada (12/08) · excesso, com hackathon e hack writer inflando o balde (13/08) · falta de attack (14/08) · ordem de balde, com "open weights" capturando o assunto pela palavra kimi (15/08) · e os dois ao mesmo tempo em 16/08.
Três consertos. Entram em segurança: vulnerability, zero-day, attack, steal, exfiltrat, refusal, abliterat, jailbreak e red-team hifenizado. Ficam de fora, com razão declarada: extract e distill, porque são vocabulário corrente de recuperação e de treino e entrariam produzindo o defeito de excesso que 13/08 mediu. Entra a primeira exclusão por contexto da taxonomia: hackathon e hack writer não casam hack. E a ordem muda: quando o título casa termo de segurança, segurança ganha o desempate contra os baldes de nome próprio.
Custo declarado, e a mitigação. Isto quebraria a série de segurança pela segunda vez em oito dias, e série que quebra a cada semana não é série. Por isso a v2.10.0 entra com contagem paralela em v2.9.0 de 17 a 23/08: o anexo do diário publica os dois números, e o fechamento da semana 34 fecha a série antiga com 14 pontos e abre a nova com ponte medida em vez de corte. Nada é recontado para trás.
"Incidente em avaliação virou padrão do setor" (aberta 31/07) → encerrada com o saldo da semana passada, sem ponto novo. A leitura vale para a janela de 30/07 a 05/08 e não vira tendência. Publicar revisão de um acidente de bancada e sofrer um ataque real fora de avaliação são fenômenos diferentes, e tratá-los como a mesma série inflaria as duas coisas.
"A estrutura em volta do agente paga em custo e não em acerto" (aberta 04/08) → sustentada e reformulada, com sete pontos e dois novos na semana. A reformulação vem do snapshot: o que não paga é a estrutura interpretada em tempo de execução, e a estrutura compilada é o outro lado. Ressalva intacta: sete autorrelatos concordando não é um resultado replicado, e o mutirão do ICML de 13/08 deu a régua, com 23% dos 2.226 papers examinados tendo pelo menos uma alegação derrubada.
"Memória migrando de heurística fixa para política aprendida" (aberta 26/07) → inconclusiva, revisita mantida. Volume estável no arXiv semanal: 40 de 532 títulos, 7,5%, contra 7,1%. Volume não é direção. O que a semana acrescenta é que o campo parou de propor arquitetura e passou a brigar por definição e por paradigma, o que é sintoma de área sem consenso.
"No balde de agentes, o registro dominante é fracasso operacional" (aberta 23/07) → o limite da semana passada confirmado com número semanal: 51,7%. O fechamento anterior escreveu "cerca de metade" com base em rodadas isoladas; agora está medido. A leitura vale para aquele subfórum. A pergunta que vai adiante é se a desconcentração medida em 14/08, de 35%, se repete em dia útil.
Coleta dos diários. Sete edições, 11 de 11 subs com status ok em todas as sete. Fontes primárias: 9 de 9 em 10/08, 8 de 9 em 11 e 12/08 (a camada agnóstica do arXiv caiu com erro de limite de taxa nos dois dias, e só o primeiro recuperou no turno) e 10 de 10 nas quatro últimas, depois do conserto do script. Duas edições saíram fora do padrão: a de 15/08 rodou à mão às 11h46, porque o cron ainda estava em dias úteis quando o sábado começou, e a de 16/08 declarou janela curta de 18h39 por causa disso.
Veredito das fontes novas, que era o item marcado para este fechamento. O GitHub trending em modo delta está aprovado: falhou por truncagem em três dias, foi consertado no script, e de 13/08 em diante entregou repositórios estruturados todo dia sem repetição. A camada agnóstica do arXiv é funcional em dia útil e inútil em fim de semana, por desenho do arXiv: emitiu ponto de série em quatro dos sete dias, caiu com erro de limite de taxa em um, e em dois devolveu o mesmo lote de quinta sem announcement novo, sem emitir ponto, exatamente como a regra manda.
O buraco que a semana de observação achou, e ele é estrutural. O arXiv anuncia de domingo a quinta, então sexta à noite, sábado e domingo o radar não tem caminho confiável para paper. E o snapshot semanal tem o mesmo buraco: prometeu 10 a 16/08 e cobriu 10 a 13/08, igual à estreia, que prometeu sete dias e cobriu quatro. Com dois pontos isso deixa de ser azar de coleta e vira propriedade do instrumento: a janela de indexação do arXiv corta os últimos dias de qualquer janela que termine hoje.
Buraco de cobertura do coletor, quatro pontos e um custo editorial medido. O coletor varre o índice de notícias da Anthropic e não varre as pastas de pesquisa e de alinhamento. Custo: os dois maiores fatos da empresa em 11/08, o Índice de Raciocínio Conceitual em 14/08, e o estudo multiagente que chegou pelo Reddit dois dias depois de publicado e virou o item 2 da edição de sábado. Sai de candidato e vira pendência com dono.
Medição desta edição, e os dois números contrariam quem escreve. A versão canônica desta edição fechou em cerca de 7.600 palavras, contra 4.986 na semana passada, ou seja, cresceu 53% justamente na semana em que a régua de tamanho estava em julgamento. E o roteiro do boletim fechou em cerca de 4.600 palavras de narração, algo perto de 31 minutos a 150 palavras por minuto, contra ~2.030 palavras e ~13 minutos na semana passada: mais que dobrou. A explicação existe para os dois e explicação não é defesa.
O que isso faz com a decisão de régua, e é preciso dizer em voz alta. Tirar o teto de duração em nome da paridade é defensável para o diário, que tem cinco a oito itens. Aplicado a um semanal deste tamanho, o mesmo princípio produz um boletim de meia hora, e um boletim de meia hora não é uma síntese: é a semana de novo. A régua de duração fica removida como decidido, porque a decisão foi tomada sobre o número da rodada passada. A régua de densidade não foi afrouxada, justamente porque estes números apareceram nesta rodada, e afrouxá-la agora seria o movimento que este radar se proíbe de fazer com a taxonomia. A paridade continua valendo entre página e áudio; o que precisa encolher são os dois juntos.
Ações derivadas: corrigir o prompt do cron, que manda escrever a seção de paridade e no mesmo texto diz que ela deixa de existir · taxonomia v2.10.0 vigente em 17/08 com contagem paralela por sete dias, reversível por decisão do Pedro antes de segunda · acrescentar as pastas de pesquisa e de alinhamento da Anthropic ao coletor · decidir o caminho de paper no fim de semana, porque hoje ele é inexistente por acidente e acidente não é decisão · aplicativo OAuth do Reddit, cinco minutos, sem data desde 18/07.
O que fica pra segunda, e são duas lacunas de tamanhos muito diferentes. A primeira é a que a regra pede que se declare, e virou pequena: da última diária, às 06h25, até este fechamento, às 09h, são 2 horas e 35 minutos sem varredura de ninguém, contra os cerca de 2,5 dias da semana passada. A segunda é grande e não é de horário: nenhuma fonte deste radar cobriu papers submetidos ao arXiv de 14 a 16/08, porque as camadas diárias devolveram o lote de quinta três dias seguidos e o snapshot semanal para no mesmo dia. São três dias de pesquisa que ninguém varreu. O fim de semana do radar tem cobertura de notícia e não tem cobertura de pesquisa.
Regravação de 16/08, formato novo. O boletim desta edição saiu de manhã com 31 minutos, metade deles narrando método, e foi reprovado. O roteiro foi regravado no mesmo dia no esqueleto novo do semanal: recap de notícia de ~9 minutos, método fora do áudio, e esta página reorganizada com o conteúdo na frente. Os números de tamanho do parágrafo acima descrevem a primeira versão e ficam como registro.