NOVIDADE DE IA · 30/09/2026
GPT-6.1 Sol: preços, benchmarks e limites do novo modelo
O GPT-6.1 Sol chega com 1,05 milhão de tokens de contexto e preço de US$ 2/10 por milhão de tokens. Veja como ele se compara ao GPT-6 Astra, ao Opus 5.5 e em quais tarefas vale testar — sem ignorar os limites.
O que é o GPT-6.1 Sol
O GPT-6.1 Sol foi apresentado pela OpenAI no DevDay de 29/09/2026. A proposta divulgada é direta: entregar desempenho próximo ou equivalente ao GPT-6 Astra em código, com um custo de API menor.
O modelo tem 1,05 milhão de tokens de contexto, o que o coloca como uma opção voltada a tarefas longas, repositórios extensos, agentes de código e uso de computador. Mas contexto grande não significa que toda tarefa ficará automaticamente melhor: os resultados variam conforme o benchmark e o tipo de trabalho.
Resumo: o Sol parece mais interessante para agentes de código e automações com uso de computador. Para ciência de ponta, os números divulgados ainda favorecem o Astra.
Tabela completa de preços e contexto
Na API, o GPT-6.1 Sol custa US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. A comparação abaixo usa os valores divulgados no post.
| Modelo | Entrada | Saída | Contexto / observação |
|---|---|---|---|
| GPT-6.1 Sol | US$ 2 por milhão de tokens | US$ 10 por milhão de tokens | 1,05 milhão de tokens; acima de 272 mil tokens, o preço dobra |
| GPT-6 Astra | US$ 10 por milhão de tokens | US$ 50 por milhão de tokens | Referência de comparação |
| Opus 5.5 | US$ 5 por milhão de tokens | US$ 25 por milhão de tokens | Referência de comparação |
Valores divulgados no post em 29/09/2026. O preço informado para o Sol dobra acima de 272 mil tokens; confirme as regras atuais na documentação da API antes de projetar custos.
O número de contexto e o preço por milhão não devem ser analisados separadamente. Um modelo pode aceitar mais conteúdo, mas o custo real depende de quanto entra no contexto, quanto ele gera e de quantas vezes o agente repete esse ciclo.
Benchmarks: onde o Sol ganha e onde perde
Os números abaixo foram divulgados pela OpenAI, com referência a Vellum e DataCamp. Eles ajudam a entender o perfil do modelo, mas não substituem um teste com o seu próprio código, ferramentas e fluxo de trabalho.
| Benchmark | GPT-6.1 Sol | GPT-6 Astra | Sonnet 5.5 | Leitura rápida |
|---|---|---|---|---|
| DeepSWE | 75,2% | 74,8% | 71,0% | O Sol fica ligeiramente acima do Astra neste teste |
| OSWorld 2.0 | 71,4% | 73,5% | Não informado | O Astra fica à frente |
| ExploitBench | 21,5% | 31,5% | Não informado | O Astra abre vantagem |
Percentuais divulgados pela OpenAI em 29/09/2026, conforme as referências citadas no post. “Não informado” significa que o post não trouxe esse valor.
Como interpretar os resultados
O DeepSWE é o principal argumento a favor do Sol para trabalho de engenharia de software: 75,2% contra 74,8% do Astra e 71,0% do Sonnet 5.5, segundo os números divulgados.
Já no OSWorld 2.0, associado a tarefas de uso de computador, o Sol marcou 71,4%, abaixo dos 73,5% do Astra. Isso não elimina o caso de uso para agentes, mas mostra que o modelo não lidera em todos os cenários.
O alerta mais importante aparece no ExploitBench: 21,5% para o Sol contra 31,5% para o Astra. Portanto, a afirmação de que o Sol “empata” com o Astra deve ser lida com contexto: ela se sustenta no recorte de código citado, não como uma equivalência geral em qualquer tarefa.
O limite de preço acima de 272 mil tokens
O GPT-6.1 Sol oferece uma janela de contexto de 1,05 milhão de tokens, mas o post informa uma mudança de preço acima de 272 mil tokens: o preço dobra.
Isso cria uma diferença entre capacidade máxima e faixa econômica de uso. Um agente pode conseguir trabalhar com um contexto muito grande, mas talvez seja mais eficiente resumir sessões, selecionar arquivos relevantes ou dividir a tarefa antes de ultrapassar o limite informado.
Checklist antes de usar contexto longo:
- Meça quantos tokens entram de fato em cada chamada.
- Separe entrada e saída no cálculo de custo.
- Observe se o agente está repetindo arquivos e histórico desnecessariamente.
- Verifique quando o contexto passa de 272 mil tokens.
- Confirme na documentação da API como a cobrança é aplicada ao seu endpoint.
Onde o GPT-6.1 Sol está disponível
O Sol não está disponível no chat comum do ChatGPT, de acordo com o post. O acesso citado está restrito a Work, Codex e API.
Na prática, isso direciona o modelo para equipes e desenvolvedores que querem integrá-lo a um fluxo de trabalho, e não para quem procura apenas uma opção no seletor do ChatGPT. Antes de migrar uma aplicação, verifique autenticação, limites, disponibilidade e compatibilidade com as ferramentas usadas pelo seu agente.
Também vale separar três perguntas:
- Posso acessar? O post cita Work, Codex e API.
- O modelo funciona no meu fluxo? Isso depende das ferramentas, permissões e formato das tarefas.
- Ele é o mais barato no meu caso? Compare tokens de entrada, saída e o efeito do limite de 272 mil tokens.
Para quem vale testar primeiro
O Sol parece especialmente adequado para um teste controlado em agentes de código, manutenção de repositórios e fluxos que usam computador ou ferramentas. O preço divulgado também pode tornar a experimentação mais acessível do que usar o Astra, desde que o contexto permaneça dentro da faixa econômica esperada.
Para ciência de ponta, o próprio recorte divulgado recomenda cautela: o Astra continua à frente nos números apresentados para OSWorld 2.0 e ExploitBench. Isso não é uma avaliação completa de pesquisa científica, mas é suficiente para não tratar o Sol como vencedor universal.
Comece pelo seu gargalo:
- Quer reduzir custo em tarefas de código? Teste o Sol contra o modelo atual.
- Precisa de uso de computador? Compare as tarefas reais, não apenas o nome do benchmark.
- Trabalha com contexto muito longo? Monitore o ponto de 272 mil tokens.
- Precisa de desempenho máximo em tarefas sensíveis? Mantenha o Astra no teste comparativo.
Como fazer um teste justo em 5 passos
- Escolha tarefas reais: separe exemplos de código, uso de computador e tarefas que exigem contexto longo.
- Congele o prompt e as ferramentas: use as mesmas instruções, arquivos, permissões e condições para os modelos comparados.
- Registre entrada e saída: anote os tokens usados em cada chamada e se o contexto passou de 272 mil tokens.
- Avalie o resultado: confira testes, correções necessárias, precisão, tempo e custo — não apenas se a resposta parece boa.
- Repita antes de decidir: um único exemplo não representa a rotina inteira. Use uma amostra variada do seu trabalho.
Uma planilha simples já ajuda: tarefa, modelo, tokens de entrada, tokens de saída, custo, resultado e intervenção humana. O objetivo é descobrir se o ganho de preço permanece quando o modelo enfrenta as tarefas que realmente importam para você.
Regra prática: teste o Sol como candidato a agente de código econômico, não como substituto automático do Astra em todos os usos.
Veredito: barato, forte em código, mas não universal
Com os números divulgados, o GPT-6.1 Sol combina três atrativos: US$ 2/10 por milhão de tokens, contexto de 1,05 milhão de tokens e desempenho de 75,2% no DeepSWE. Isso explica por que ele merece um teste em agentes de código e automações com uso de computador.
Os limites também são claros: o preço dobra acima de 272 mil tokens, o modelo não aparece no chat comum do ChatGPT e o Astra fica à frente no OSWorld 2.0 e no ExploitBench. A melhor decisão, portanto, é baseada no fluxo: Sol para testar eficiência em código; Astra quando a tarefa exige o desempenho superior indicado pelos benchmarks divulgados.
Os números citados neste material foram divulgados pela OpenAI em 29/09/2026, com referências a Vellum e DataCamp. A repercussão mencionada no post foi de mais de 990 pontos no Hacker News em 30/09/2026.
Quer a comparação em uma tabela?
Comente SOL e receba no direct a tabela completa de preços, contexto e benchmarks do GPT-6.1 Sol, GPT-6 Astra e Opus 5.5.
Receba os próximos artigos
O que a gente testou de IA na prática — agentes, custos e ferramentas — direto no seu e-mail. Sem hype e sem spam.