NOVIDADE DE IA · 23/09/2026

Claude Opus 5.5 vs GPT-6 Astra: preço, benchmarks e quando usar cada um

A Anthropic lançou o Claude Opus 5.5 custando 2,5x menos por token que o GPT-6 Astra e na frente em código e trabalho de escritório na tabela oficial. Mas o Astra ainda ganha em ciência e automação entre apps — e preço por token não é custo por tarefa. O deep dive completo, sem hype.

Claude Opus 5.5 vs GPT-6 Astra — 2,5x mais barato e na frente em código
Carrossel Rafique AI — A Anthropic lançou o Claude Opus 5.5

Em 22 de setembro de 2026 a Anthropic lançou o Claude Opus 5.5, primeiro modelo da família Claude 5.5 — e mirou direto no GPT-6 Astra, que a OpenAI lançou em 3 de setembro. A manchete é de preço: $4 / $20 por milhão de tokens contra $10 / $50 do Astra. Isso é 2,5x menos na entrada e na saída.

A segunda manchete é de desempenho: na tabela publicada no anúncio oficial da Anthropic, o Opus 5.5 fica na frente em código no terminal, em trabalho de escritório real e no Humanity's Last Exam. O Astra continua ganhando em pesquisa científica e, por pouco, em automação entre aplicativos.

Este guia junta o que importa para quem precisa decidir: o que é o modelo, a tabela de preços completa (incluindo a pegadinha dos 272K tokens do Astra), onde cada um ganha, por que preço por token engana, os casos reais publicados e o que muda para quem usa via API. No fim, um veredito por tipo de tarefa.

O que é o Claude Opus 5.5

O que é o Opus 5.5 — resumo em 5 pontos
  • Família nova: é o primeiro modelo da família Claude 5.5. Sonnet 5.5 e Haiku 5.5 chegam "nas próximas semanas", segundo a Anthropic.
  • Nível Fable na maioria das tarefas: a Anthropic diz que ele entrega o nível do Claude Fable 5.1 (o topo da casa) na maior parte do trabalho — e que, no uso interno, a distância é menor do que os benchmarks sugerem.
  • Mais barato que o antecessor: custa cerca de 40% menos para rodar que o Opus 5 em cargas típicas. Entrada e saída caíram 20% ($5/$25 → $4/$20) e a leitura de cache caiu 60%.
  • Mais rápido: gera saída mais de 30% mais rápido que o Opus 5.
  • Janela grande: contexto de 1 milhão de tokens e até 128K de saída.
  • Pensa sempre: o thinking adaptativo fica ligado o tempo todo; o parâmetro effort controla a profundidade, e o padrão agora é medium.

Para assinantes do app Claude: os limites de 5 horas subiram nos planos Pro, Max e Team (e Enterprise por assento), e a Anthropic liberou um reset de rate limit que você guarda e usa quando quiser.

Preço: a manchete (e a letra miúda)

Preço por 1M tokens — Opus 5.5 x Astra
Por 1M tokens (API)Claude Opus 5.5GPT-6 AstraOpus 5 (referência)
Entrada$4$10$5
Saída$20$50$25
Leitura de cache$0,20$1,0060% mais caro que o 5.5
Escrita de cache$5 (5 min) · $8 (1 h)$12,50—
Batch50% off ($2 / $10)50% off (Batch/Flex)50% off
Contexto longo1M tokens, 128K de saída~1,05M; acima de 272K de entrada: 2x entrada e 1,5x saída na requisição inteira—

Fontes: documentação da Anthropic (Opus 5.5) e página do modelo GPT-6 Astra na OpenAI. Valores em dólar, sem impostos.

Dois detalhes mudam a conta mais do que a diferença de entrada e saída:

  • Cache: a leitura de cache do Opus 5.5 custa $0,20 contra $1,00 do Astra — 5x menos. A própria Anthropic lembra que leitura de cache é a maior parte do custo em trabalho agêntico e de código, porque o agente relê o mesmo contexto a cada passo.
  • Os 272K do Astra: se a entrada de uma requisição passa de 272 mil tokens, a OpenAI cobra 2x na entrada (e no cache) e 1,5x na saída da requisição inteira. Sessões longas de agente ou de computer use atravessam esse limite rápido.

Ainda existe o fast mode do Opus 5.5 (prévia de pesquisa, só na API da Claude): $8 / $40 por milhão de tokens por até 2,5x mais velocidade. Vale para latência crítica, não como padrão.

Benchmarks: onde cada um ganha

Slide 1Slide 2

Slides 3 e 4 do carrossel: onde o Opus 5.5 ganha e onde o GPT-6 Astra ganha.

BenchmarkO que medeOpus 5.5GPT-6 AstraQuem ganha
Terminal-Bench 4.0código no terminal, tarefas longas66,4%57,9%Opus*
GDPval-AA v2.1trabalho real em 44 profissões (Elo)18461542Opus
Humanity's Last Examraciocínio multidisciplinar, com ferramentas67,7%57,2%Opus
FrontierCode v1.1mudança de código que seria aceita (merge)54,4%53,3%Opus (margem pequena)
AutomationBenchfluxos de negócio entre muitos apps40,0%41,4%Astra (margem pequena)
Terminal-Bench-Science 0.1pesquisa científica agêntica58,7%64,6%Astra

Tabela publicada pela Anthropic; números do Astra conforme reportados pela OpenAI. *Opus em esforço xhigh e Astra em high (melhor nota de cada). Na medição independente da Artificial Analysis, os dois empatam no Terminal-Bench (59,6%).

Três ressalvas honestas antes de usar essa tabela para decidir:

  • Esforço diferente no Terminal-Bench: a nota do Opus é em xhigh e a do Astra em high — a melhor de cada um. Na medição independente da Artificial Analysis, os dois empatam em 59,6%.
  • Salvaguardas ligadas: o Opus 5.5 foi avaliado com as salvaguardas de produção ativas. Quando elas intervieram, tarefas de cibersegurança foram resolvidas pelo Opus 4.8 e as de biologia e desenvolvimento de LLMs de fronteira pelo Opus 5. A Anthropic admite que isso provavelmente reduz a nota do 5.5.
  • AutomationBench sem fallback: o teste foi rodado pela Zapier sem modelos de fallback, então toda intervenção de salvaguarda contou como falha. A diferença de 1,4 ponto para o Astra está dentro do ruído.

Fora dessa tabela, o Astra segue forte em matemática e raciocínio abstrato: a OpenAI reporta resultados perto da saturação em FrontierMath e ARC-AGI (detalhes no nosso guia do GPT-6 Astra), e a Anthropic não publicou números comparáveis do Opus 5.5.

Preço por token não é custo por tarefa

O detalhe que quase ninguém conta: custo por tarefa

O Opus 5.5 pensa bastante. No esforço máximo, a Artificial Analysis mediu o modelo usando cerca de 119 mil tokens de saída por tarefa — umas 4x mais que o Astra. Com esse volume, a vantagem de 2,5x no preço de saída some.

Só que o esforço máximo não é o padrão. No esforço medium, a Anthropic diz que o Opus 5.5:

  • supera a melhor nota do Astra no FrontierCode por ~20% do custo por tarefa;
  • empata com o Astra no Terminal-Bench 4.0 por ~40% do custo;
  • no GDPval-AA, bate o Astra em esforço máximo por cerca de um quinto do custo.

Tradução prática: deixe no medium e só suba o esforço quando a tarefa falhar. Fizemos a conta completa, com cache e exemplos numéricos, no artigo sobre custo real por tarefa.

Fora dos benchmarks: o que clientes relataram

Na prática, fora dos benchmarks
  • Auditoria de 200 mil linhas em menos de 3 horas. Um cliente de acesso antecipado auditou e corrigiu uma base desse tamanho; com o Opus 5 foram mais de 20 horas e 2,5x mais tokens.
  • 18 horas sozinho. Um dev deixou o modelo rodando a noite toda numa tarefa de engenharia que atravessava seis repositórios. Segundo ele, o modelo bateu marcos mais rápido que o Opus 5 e exigiu pouco retrabalho.
  • De 38 prompts em 4 dias para 11 prompts em 3 horas numa tarefa complexa de código, com saídas mais prontas para produção.
  • 40 PRs empilhados rebaseados numa sessão que coordenou outras doze; todos passaram no CI no dia seguinte.
  • HAProxy de C para Rust: no teste interno da Anthropic, o Opus 5.5 terminou em 9,5 horas contra 12 do Fable 5.1 e custou 51% menos. As duas versões passaram em quase todos os testes de regressão do próprio HAProxy.

São relatos publicados pela própria Anthropic no lançamento — sinal forte, não prova independente. O que eles mostram de novo é fôlego: tarefas longas sem se perder. Aprofundamos isso em agentes de 18 horas.

Usa via API? O que muda antes de trocar a string

Usa via API? Atenção

Trocar claude-opus-5 por claude-opus-5-5 não é só mudar o ID. A documentação lista quatro mudanças que quebram requisições e uma que muda o formato da resposta sem dar erro:

  1. Thinking não pode mais ser desligado.
  2. tool_choice forçado (any ou uma ferramenta específica) retorna erro 400.
  3. Blocos de thinking ficam presos ao modelo e à conversa.
  4. O computer use antigo computer_20251124 não é aceito na API da Claude e no Google Cloud; use computer_toolset_20260801.
  5. A silenciosa: o texto entre chamadas de ferramenta chega em blocos de thinking vazios por padrão — se o seu app mostra "progresso", ele fica mudo.

E o esforço padrão caiu de high (Opus 5) para medium. Passo a passo com antes/depois no guia de migração da API.

Veredito: quando usar cada um

Veredito — Opus 5.5 x GPT-6 Astra
Se a sua tarefa é…Comece porPor quê
Agente de código longo (refactor, migração, auditoria)Opus 5.5Lidera Terminal-Bench/FrontierCode e custa bem menos por tarefa no esforço padrão
Trabalho de escritório em volume (relatórios, análises, documentos)Opus 5.5GDPval-AA 1846 x 1542 e cache 5x mais barato
Pesquisa científica agênticaGPT-6 AstraTerminal-Bench-Science 64,6% x 58,7%
Automação entre muitos apps SaaSEmpate técnico — teste os doisAutomationBench 41,4% x 40,0%, diferença dentro do ruído
Matemática pesada e raciocínio abstratoGPT-6 AstraOpenAI publicou resultados fortes; a Anthropic não publicou números comparáveis do Opus 5.5
Biologia ou cibersegurança ofensivaNenhum sem programa de acessoAmbos operam com salvaguardas e acesso verificado nessas áreas

Modelo não é estratégia. A tabela dos laboratórios mede tarefas deles; a sua empresa tem as suas. O método que usamos na Rafique AI:

  1. Escolha 10 a 20 tarefas reais do seu fluxo (não prompts de demonstração).
  2. Rode nos dois modelos no esforço padrão, com o mesmo contexto e as mesmas ferramentas.
  3. Meça custo por tarefa concluída, incluindo retentativas e tempo de revisão humana — não preço por token.
  4. Suba o esforço só onde falhou e meça de novo.
  5. Decida por tipo de tarefa, não por marca. Muitas operações vão acabar com os dois modelos em rotas diferentes.

Leia também: segurança e pacing — por que o Opus 5.5 saiu com salvaguardas de nível Fable e o que isso muda para quem trabalha com biologia e cibersegurança.

Quer escolher (e rodar) o modelo certo com método?

A Rafique AI testa modelos na sua tarefa real, mede custo por entrega e só coloca agente em produção com dono, limite e evidência.

Claude Opus 5.5 vs GPT-6 Astra: preço, benchmarks e veredito | Rafique AI