NOVIDADE DE IA · 29/09/2026

GPT-6.1 Sol: benchmarks, preço da API e limites da comparação

O GPT-6.1 Sol promete quase o desempenho do Astra por uma fração do custo, segundo a OpenAI. Veja os preços da API, os resultados divulgados nos benchmarks e o que ainda precisa ser considerado antes de tirar conclusões.

GPT-6.1 Sol: benchmarks, preço da API e limites da comparação

O que é o GPT-6.1 Sol

O GPT-6.1 Sol é um novo modelo apresentado pela OpenAI em 29/09/2026. No anúncio oficial, a empresa posiciona o Sol como uma alternativa de alto desempenho para tarefas de programação e agentes, com custo significativamente menor do que modelos usados como referência na comparação.

A afirmação central é que o Sol alcança quase o desempenho do Astra por cerca de um quinto do preço, de acordo com avaliações divulgadas pela própria OpenAI. Isso não significa que os modelos sejam equivalentes em todos os usos: o resultado depende da tarefa, do prompt, da configuração da avaliação e do critério usado para medir desempenho.

Outro ponto importante: o GPT-6.1 Sol ainda não está disponível no Chat. As informações apresentadas aqui se referem ao lançamento oficial e ao uso pela API.

Resumo rápido dos números divulgados

ItemInformação divulgadaContexto
Entrada na APIUS$ 2 por milhão de tokensPreço informado no anúncio do modelo
Saída na APIUS$ 10 por milhão de tokensA saída custa mais do que a entrada
Tokens em cacheUS$ 0,10Preço informado para tokens em cache
DeepSWE 1.1Iguala o AstraResultado divulgado pela OpenAI
Terminal-Bench ScienceUS$ 5,47 por tarefaComparado a US$ 23,21 do Opus 5.5

Valores e resultados conforme o anúncio oficial da OpenAI de 29/09/2026. Preços e disponibilidade podem mudar.

Preço da API: como interpretar

O preço informado para o GPT-6.1 Sol é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Para tokens em cache, o valor divulgado é de US$ 0,10.

Na prática, o custo de uma chamada depende de quanto contexto o agente envia, quanto texto o modelo produz e de quanto desse contexto pode ser reutilizado em cache. Por isso, não basta olhar apenas para o preço de entrada: fluxos que geram respostas longas podem concentrar uma parte maior do custo na saída.

Exemplo: se uma aplicação envia muito contexto repetido, a possibilidade de usar cache pode ser relevante. Já um agente que executa várias etapas e produz bastante código precisa acompanhar também o volume de tokens de saída.

  • Entrada: instruções, arquivos, histórico e resultados de ferramentas enviados ao modelo.
  • Saída: resposta, código, plano ou ações geradas pelo modelo.
  • Cache: tokens reaproveitados conforme a condição de cache informada no lançamento.

Benchmark DeepSWE 1.1: o resultado divulgado

No benchmark DeepSWE 1.1, a OpenAI afirma que o GPT-6.1 Sol iguala o Astra. O post de lançamento também resume esse resultado como desempenho próximo ao Astra por cerca de um quinto do custo.

Essa é uma informação relevante para quem avalia agentes de programação: um modelo não precisa ser o mais caro para ser competitivo em uma tarefa específica. Ainda assim, o resultado deve ser lido como um recorte. Um benchmark mede um conjunto definido de tarefas e não substitui testes no seu próprio repositório, com suas linguagens, dependências, regras e critérios de revisão.

Leitura prática: o Sol pode ser uma opção para testar em fluxos de engenharia de software nos quais o custo por execução é importante, mas o benchmark não garante o mesmo resultado em qualquer projeto.

Terminal-Bench Science: comparação de custo por tarefa

No Terminal-Bench Science, o custo divulgado para o GPT-6.1 Sol é de US$ 5,47 por tarefa, contra US$ 23,21 do Opus 5.5. Esses valores aparecem como custo por tarefa dentro da avaliação apresentada pela OpenAI.

A diferença de custo pode chamar atenção de equipes que usam agentes para executar tarefas em terminal, especialmente quando há muitas tentativas, etapas ou chamadas de modelo. Mas “custo por tarefa” não deve ser confundido com um preço fixo para qualquer uso: o valor final depende do consumo de tokens e do fluxo de execução adotado.

Antes de trocar um modelo em produção, vale medir pelo menos:

  • taxa de tarefas concluídas sem intervenção;
  • quantidade de correções necessárias;
  • tempo até a solução;
  • tokens consumidos por tarefa;
  • custo total do fluxo, incluindo tentativas adicionais.

O que os benchmarks não respondem

Os resultados são interessantes, mas têm limites claros. As avaliações foram feitas pela própria OpenAI, e o post informa que foram usados prompts de precisão deliberadamente difíceis. Isso ajuda a testar o limite dos modelos, mas também significa que o resultado não representa automaticamente todos os cenários de uso.

Também é preciso separar três perguntas diferentes:

  1. O modelo consegue resolver a tarefa? Esse é o aspecto de capacidade.
  2. Quanto custa resolver? Esse é o aspecto de eficiência econômica.
  3. Ele se comporta bem no meu ambiente? Esse é o aspecto de adequação ao produto, ao código e ao processo.

Um modelo pode ter bom desempenho em um benchmark e ainda exigir mais supervisão em um projeto específico. Da mesma forma, um modelo mais barato pode deixar de ser vantajoso se precisar de muitas tentativas extras para concluir uma tarefa.

Como avaliar o Sol no seu próprio fluxo

Se você tem acesso à API e quer investigar o modelo, faça um teste controlado em vez de comparar apenas impressões. Use tarefas reais ou representativas, mantenha os critérios iguais e registre os resultados.

  1. Escolha um conjunto de tarefas: inclua bugs, implementação, refatoração, testes e tarefas de terminal que façam sentido para sua equipe.
  2. Defina o que é sucesso: por exemplo, testes passando, revisão aprovada ou tarefa concluída sem intervenção.
  3. Congele o contexto: use as mesmas instruções, arquivos disponíveis e permissões para cada modelo.
  4. Registre consumo e tempo: anote tokens de entrada, tokens de saída, custo e duração.
  5. Conte as intervenções: registre quando uma pessoa precisou corrigir o plano, fornecer contexto ou executar uma etapa.
  6. Compare o resultado final: custo baixo só é vantagem se vier acompanhado de qualidade suficiente para o seu caso.

Checklist antes de decidir:

  • O custo por tarefa cabe no orçamento?
  • O modelo entende o contexto do repositório?
  • As respostas exigem muitas correções?
  • O ganho de preço compensa eventuais tentativas extras?
  • O modelo está disponível no canal que sua equipe usa?

Fonte oficial e disponibilidade

Os dados deste resumo vêm da página oficial de lançamento da OpenAI: Introducing GPT-6.1 Sol, publicada em 29/09/2026.

O ponto mais importante para não criar uma expectativa errada é a disponibilidade: o GPT-6.1 Sol ainda não está no Chat. Portanto, o anúncio não significa que qualquer pessoa já possa selecioná-lo no ChatGPT. Neste momento, a referência apresentada é o uso pela API, conforme as informações divulgadas no lançamento.

Em resumo: o Sol aparece como uma alternativa de custo agressivo para tarefas de programação e agentes, com resultados fortes nos benchmarks citados. A decisão de uso deve combinar os números oficiais com um teste próprio, porque desempenho, custo e disponibilidade são partes diferentes da mesma avaliação.

Quer o resumo dos benchmarks?

Receba o resumo dos números divulgados pela OpenAI e o link oficial do lançamento do GPT-6.1 Sol.

GPT-6.1 Sol: preço e benchmarks | Rafique AI