NOVIDADE DE IA · 23/09/2026
Claude Opus 5.5 trabalhou 18 horas sozinho: o que muda para agentes de IA
Um dev deixou o Claude Opus 5.5 rodando a madrugada inteira em seis repositórios. Ele ficou mais de 18 horas no ar e entregou. "IA que trabalha enquanto você dorme" deixou de ser slide de pitch — mas só funciona com tarefa bem definida, testes, limite de gasto e trava nas ações perigosas.

A frase veio de um cliente de acesso antecipado e está no anúncio oficial da Anthropic: "Entreguei ao Claude Opus 5.5 uma tarefa grande de engenharia em seis dos nossos repositórios e deixei rodando a noite toda, sem supervisão. Ele ficou na tarefa por mais de 18 horas, definindo como nossos serviços conversam entre si e como cada um deveria aplicar isso."
Ele completou: comparado ao Opus 5, o modelo bateu marcos mais rápido, exigiu pouco retrabalho e escreveu comentários de código curtos e úteis. "Estou com dificuldade de achar algo negativo para dizer."
Relato de cliente não é benchmark. Mas ele aponta a mudança mais importante deste lançamento para quem opera IA no dia a dia: fôlego. O gargalo dos agentes não era mais inteligência por resposta — era manter o rumo por horas sem se perder, sem entrar em loop e sem estourar o orçamento. Neste artigo: os casos publicados, por que ficou viável em custo, as travas de segurança que a Anthropic colocou para rodar sem ninguém olhando e um checklist para montar o seu.
Os casos que a Anthropic publicou
| Caso publicado | Antes | Com Opus 5.5 |
|---|---|---|
| Tarefa de engenharia em 6 repositórios, madrugada, sem supervisão | Modelos anteriores se perdiam depois de algumas horas | 18h+ no ar, marcos mais rápidos, pouco retrabalho |
| Auditoria e correção de base de 200 mil linhas | Opus 5: 20h+ e 2,5x os tokens | menos de 3 horas |
| Rebase de 40 PRs empilhados | Trabalho de vários dias | Uma sessão coordenou outras 12; 40/40 no CI no dia seguinte |
| Tarefa complexa de código (Chat, Cowork e Claude Code) | 38 prompts em 4 dias | 11 prompts em 3 horas |
| HAProxy de C para Rust (teste interno) | Fable 5.1: 12 horas | 9,5 horas, 51% mais barato |
Relatos de clientes de acesso antecipado e testes internos publicados pela Anthropic em 22/09/2026.
O padrão se repete em relatos de ferramentas diferentes. A Lovable diz que o modelo termina em um terço a metade menos passos, porque junta contexto uma vez e faz edições menos numerosas e mais completas. A Kiro reporta, num benchmark público de tarefas de linha de comando, cerca de 40% menos chamadas e metade dos tokens em relação ao Opus 5.
Menos passos importa mais do que parece: em agente longo, cada passo extra é uma chance de erro que se acumula até o fim da sessão.
Por que agentes longos quebravam (e o que mudou)
Quem já deixou um agente rodando por horas conhece o roteiro: no começo ele vai bem; depois de algumas horas começa a repetir tentativas, esquece decisões anteriores, "conserta" o que já estava certo e termina com uma pilha de mudanças que alguém precisa desfazer de manhã.
Três coisas mudaram no Opus 5.5, segundo a Anthropic e os relatos:
- Foco em tarefas longas: o modelo mantém o plano por mais tempo e bate marcos intermediários mais rápido — foi o ponto central dos relatos de 18 horas e dos 40 PRs.
- Eficiência de tokens: menos chamadas e menos passos por tarefa significam contexto mais limpo e menos dinheiro queimado em retentativas.
- Menos tendência a sair da linha: numa avaliação nova sobre cruzar limites de contenção, o Opus 5.5 tentou contornar barreiras cerca de 85% menos vezes que o Opus 5 ou o Claude Mythos 5.1 — e todas as tentativas foram de baixa gravidade e autorrelatadas pelo próprio modelo.
Esse último ponto é o que separa "demo impressionante" de "posso deixar rodando na minha infraestrutura". A Anthropic diz isso explicitamente: para quem roda o Claude sem supervisão em bases de código e sistemas, esse comportamento importa tanto quanto a capacidade bruta.
Por que agora ficou viável em custo
Uma sessão de 18 horas é, antes de tudo, uma conta. Agente relê o mesmo contexto dezenas ou centenas de vezes, e isso aparece como leitura de cache — que a Anthropic diz ser a maior parte do custo em trabalho agêntico e de código.
No Opus 5.5 a leitura de cache custa $0,20 por milhão de tokens, 60% menos que no Opus 5 e 5x menos que no GPT-6 Astra ($1). Entrada e saída caíram 20% em relação ao Opus 5, e a geração ficou mais de 30% mais rápida — o que também encurta a sessão.
| Mesma sessão ilustrativa* | Opus 5.5 | Opus 5 | GPT-6 Astra |
|---|---|---|---|
| 30M tokens lidos do cache | $6,00 | $15,00 | $30,00 |
| 3M tokens de entrada nova | $12,00 | $15,00 | $30,00 |
| 1,5M tokens de saída | $30,00 | $37,50 | $75,00 |
| Total | $48 | $67,50 | $135 (+ sobretaxa se passar de 272K por requisição) |
*Exemplo com os mesmos volumes de token para os três modelos, só para mostrar o peso do cache. Na vida real cada modelo gasta quantidades diferentes; veja o artigo sobre custo por tarefa.
O exemplo é só ilustrativo, mas mostra onde está o dinheiro: em agente longo, quem manda na conta é o cache e a saída, não o preço de entrada que aparece na manchete. Fizemos a conta completa por tarefa, com o efeito do esforço, em custo real por tarefa.
As travas para rodar sem ninguém olhando
A Anthropic posicionou o Opus 5.5 como agente de código seguro para empresas e listou as camadas:
- Classificador de ações: checa cada ação antes de ela ser executada.
- Sandbox open source: o time de segurança pode auditar o ambiente onde o agente roda.
- Revisão de código: pega vulnerabilidades antes do merge.
- Resistência a prompt injection: igual ou melhor que o Opus 5 em todos os cenários testados (código, ferramentas, computer use e navegação). No benchmark da Gray Swan, empata com o Fable 5.1 na menor taxa de sucesso de prompt injection entre todos os modelos testados.
Prompt injection é o risco número um de agente que lê coisas de fora — issue de GitHub, e-mail, página web, PDF de cliente. Um texto malicioso escondido num desses lugares pode tentar dar ordens ao agente. Taxa menor não é taxa zero: a trava de verdade continua sendo o que o agente tem permissão de fazer.
Como montar o seu agente noturno (checklist)
- Tarefa fechada: "migrar os 14 serviços para o novo client de autenticação", não "melhorar o código". Escreva o objetivo, o escopo e o que não pode ser tocado.
- Critério de pronto verificável: testes passando, lint limpo, build verde, relatório gerado. Se você não consegue dizer como verificar, o agente também não consegue.
- Testes automáticos antes de começar: sem suíte de testes, 18 horas de agente viram 18 horas de mudanças que ninguém sabe se funcionam.
- Limite de gasto: use orçamento por tarefa (a API do Opus 5.5 suporta task budgets) e alerta de custo. Defina quanto a tarefa vale antes de começar.
- Esforço padrão: comece em
medium; suba só nas etapas que falharem. - Permissão mínima: branch separada, sem acesso a produção, sem segredos além do necessário, sem permissão de push na main.
- Conversa append-only: no Opus 5.5 os blocos de thinking ficam presos à conversa; mude instruções com mensagens de sistema no meio da conversa em vez de editar o histórico, e use compactação quando o contexto crescer (detalhes no guia de migração da API).
- Relatório de manhã: peça um resumo do que foi feito, do que ficou pendente e das decisões que precisam de humano. O caso dos 40 PRs funcionou justamente porque o agente deixou as decisões difíceis claras para responder em minutos.
Onde NÃO deixar o agente sozinho
- Deploy em produção sem revisão. Agente abre PR; humano aprova e publica.
- Dinheiro. Pagamento, estorno, emissão de nota, mudança de preço — sempre com gate humano.
- Dados de cliente. LGPD não tem exceção para "foi o agente". Use dados anonimizados ou ambiente de teste.
- Ações irreversíveis. Apagar dados, enviar e-mail em massa, mexer em DNS ou permissões.
- Tarefas de segurança ofensiva e biologia sensível. O Opus 5.5 redireciona a maior parte das tarefas de cibersegurança para o Opus 4.8 e tem salvaguardas de biologia; para esse trabalho existem programas de acesso verificado (veja segurança e pacing).
Na Rafique AI a regra é simples: agente que roda sozinho precisa de dono, limite e evidência. Dono para responder quando der errado, limite para o estrago máximo ser conhecido e evidência — logs, testes, relatório — para ninguém precisar confiar no "acho que deu certo".
Fontes
Qual tarefa você deixaria rodando esta noite?
A Rafique AI desenha o agente, monta sandbox, testes e limite de gasto, e só libera autonomia com dono e evidência. Vamos conversar sobre o seu fluxo.
Receba os próximos artigos
O que a gente testou de IA na prática — agentes, custos e ferramentas — direto no seu e-mail. Sem hype e sem spam.