NOVIDADE DE IA · 30/09/2026

GPT-6.1 Sol: preços, benchmarks e limites do novo modelo

O GPT-6.1 Sol chega com 1,05 milhão de tokens de contexto e preço de US$ 2/10 por milhão de tokens. Veja como ele se compara ao GPT-6 Astra, ao Opus 5.5 e em quais tarefas vale testar — sem ignorar os limites.

O que é o GPT-6.1 Sol

O GPT-6.1 Sol foi apresentado pela OpenAI no DevDay de 29/09/2026. A proposta divulgada é direta: entregar desempenho próximo ou equivalente ao GPT-6 Astra em código, com um custo de API menor.

O modelo tem 1,05 milhão de tokens de contexto, o que o coloca como uma opção voltada a tarefas longas, repositórios extensos, agentes de código e uso de computador. Mas contexto grande não significa que toda tarefa ficará automaticamente melhor: os resultados variam conforme o benchmark e o tipo de trabalho.

Resumo: o Sol parece mais interessante para agentes de código e automações com uso de computador. Para ciência de ponta, os números divulgados ainda favorecem o Astra.

Tabela completa de preços e contexto

Na API, o GPT-6.1 Sol custa US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. A comparação abaixo usa os valores divulgados no post.

ModeloEntradaSaídaContexto / observação
GPT-6.1 SolUS$ 2 por milhão de tokensUS$ 10 por milhão de tokens1,05 milhão de tokens; acima de 272 mil tokens, o preço dobra
GPT-6 AstraUS$ 10 por milhão de tokensUS$ 50 por milhão de tokensReferência de comparação
Opus 5.5US$ 5 por milhão de tokensUS$ 25 por milhão de tokensReferência de comparação

Valores divulgados no post em 29/09/2026. O preço informado para o Sol dobra acima de 272 mil tokens; confirme as regras atuais na documentação da API antes de projetar custos.

O número de contexto e o preço por milhão não devem ser analisados separadamente. Um modelo pode aceitar mais conteúdo, mas o custo real depende de quanto entra no contexto, quanto ele gera e de quantas vezes o agente repete esse ciclo.

Benchmarks: onde o Sol ganha e onde perde

Os números abaixo foram divulgados pela OpenAI, com referência a Vellum e DataCamp. Eles ajudam a entender o perfil do modelo, mas não substituem um teste com o seu próprio código, ferramentas e fluxo de trabalho.

BenchmarkGPT-6.1 SolGPT-6 AstraSonnet 5.5Leitura rápida
DeepSWE75,2%74,8%71,0%O Sol fica ligeiramente acima do Astra neste teste
OSWorld 2.071,4%73,5%Não informadoO Astra fica à frente
ExploitBench21,5%31,5%Não informadoO Astra abre vantagem

Percentuais divulgados pela OpenAI em 29/09/2026, conforme as referências citadas no post. “Não informado” significa que o post não trouxe esse valor.

Como interpretar os resultados

O DeepSWE é o principal argumento a favor do Sol para trabalho de engenharia de software: 75,2% contra 74,8% do Astra e 71,0% do Sonnet 5.5, segundo os números divulgados.

Já no OSWorld 2.0, associado a tarefas de uso de computador, o Sol marcou 71,4%, abaixo dos 73,5% do Astra. Isso não elimina o caso de uso para agentes, mas mostra que o modelo não lidera em todos os cenários.

O alerta mais importante aparece no ExploitBench: 21,5% para o Sol contra 31,5% para o Astra. Portanto, a afirmação de que o Sol “empata” com o Astra deve ser lida com contexto: ela se sustenta no recorte de código citado, não como uma equivalência geral em qualquer tarefa.

O limite de preço acima de 272 mil tokens

O GPT-6.1 Sol oferece uma janela de contexto de 1,05 milhão de tokens, mas o post informa uma mudança de preço acima de 272 mil tokens: o preço dobra.

Isso cria uma diferença entre capacidade máxima e faixa econômica de uso. Um agente pode conseguir trabalhar com um contexto muito grande, mas talvez seja mais eficiente resumir sessões, selecionar arquivos relevantes ou dividir a tarefa antes de ultrapassar o limite informado.

Checklist antes de usar contexto longo:

  • Meça quantos tokens entram de fato em cada chamada.
  • Separe entrada e saída no cálculo de custo.
  • Observe se o agente está repetindo arquivos e histórico desnecessariamente.
  • Verifique quando o contexto passa de 272 mil tokens.
  • Confirme na documentação da API como a cobrança é aplicada ao seu endpoint.

Onde o GPT-6.1 Sol está disponível

O Sol não está disponível no chat comum do ChatGPT, de acordo com o post. O acesso citado está restrito a Work, Codex e API.

Na prática, isso direciona o modelo para equipes e desenvolvedores que querem integrá-lo a um fluxo de trabalho, e não para quem procura apenas uma opção no seletor do ChatGPT. Antes de migrar uma aplicação, verifique autenticação, limites, disponibilidade e compatibilidade com as ferramentas usadas pelo seu agente.

Também vale separar três perguntas:

  • Posso acessar? O post cita Work, Codex e API.
  • O modelo funciona no meu fluxo? Isso depende das ferramentas, permissões e formato das tarefas.
  • Ele é o mais barato no meu caso? Compare tokens de entrada, saída e o efeito do limite de 272 mil tokens.

Para quem vale testar primeiro

O Sol parece especialmente adequado para um teste controlado em agentes de código, manutenção de repositórios e fluxos que usam computador ou ferramentas. O preço divulgado também pode tornar a experimentação mais acessível do que usar o Astra, desde que o contexto permaneça dentro da faixa econômica esperada.

Para ciência de ponta, o próprio recorte divulgado recomenda cautela: o Astra continua à frente nos números apresentados para OSWorld 2.0 e ExploitBench. Isso não é uma avaliação completa de pesquisa científica, mas é suficiente para não tratar o Sol como vencedor universal.

Comece pelo seu gargalo:

  • Quer reduzir custo em tarefas de código? Teste o Sol contra o modelo atual.
  • Precisa de uso de computador? Compare as tarefas reais, não apenas o nome do benchmark.
  • Trabalha com contexto muito longo? Monitore o ponto de 272 mil tokens.
  • Precisa de desempenho máximo em tarefas sensíveis? Mantenha o Astra no teste comparativo.

Como fazer um teste justo em 5 passos

  1. Escolha tarefas reais: separe exemplos de código, uso de computador e tarefas que exigem contexto longo.
  2. Congele o prompt e as ferramentas: use as mesmas instruções, arquivos, permissões e condições para os modelos comparados.
  3. Registre entrada e saída: anote os tokens usados em cada chamada e se o contexto passou de 272 mil tokens.
  4. Avalie o resultado: confira testes, correções necessárias, precisão, tempo e custo — não apenas se a resposta parece boa.
  5. Repita antes de decidir: um único exemplo não representa a rotina inteira. Use uma amostra variada do seu trabalho.

Uma planilha simples já ajuda: tarefa, modelo, tokens de entrada, tokens de saída, custo, resultado e intervenção humana. O objetivo é descobrir se o ganho de preço permanece quando o modelo enfrenta as tarefas que realmente importam para você.

Regra prática: teste o Sol como candidato a agente de código econômico, não como substituto automático do Astra em todos os usos.

Veredito: barato, forte em código, mas não universal

Com os números divulgados, o GPT-6.1 Sol combina três atrativos: US$ 2/10 por milhão de tokens, contexto de 1,05 milhão de tokens e desempenho de 75,2% no DeepSWE. Isso explica por que ele merece um teste em agentes de código e automações com uso de computador.

Os limites também são claros: o preço dobra acima de 272 mil tokens, o modelo não aparece no chat comum do ChatGPT e o Astra fica à frente no OSWorld 2.0 e no ExploitBench. A melhor decisão, portanto, é baseada no fluxo: Sol para testar eficiência em código; Astra quando a tarefa exige o desempenho superior indicado pelos benchmarks divulgados.

Os números citados neste material foram divulgados pela OpenAI em 29/09/2026, com referências a Vellum e DataCamp. A repercussão mencionada no post foi de mais de 990 pontos no Hacker News em 30/09/2026.

Quer a comparação em uma tabela?

Comente SOL e receba no direct a tabela completa de preços, contexto e benchmarks do GPT-6.1 Sol, GPT-6 Astra e Opus 5.5.

GPT-6.1 Sol: preços e benchmarks | rafiqueAI