GPT-5 para codificação: benchmarks e preços
Descrição: O GPT-5 finalmente vem com ganhos reais em codificação. Aqui está o que os benchmarks realmente significam, quanto custam, os truques e cinco dicas para obter melhores resultados.
Se você perdeu a transmissão ao vivo (e os gráficos "criativos"), aqui está o resumo: o GPT-5 foi lançado, é rápido e, o que é crucial, é melhor em código real do que os modelos anteriores. Há um sinal legítimo nos números, além de algumas faceplants da semana de lançamento que vale a pena conhecer. (Business Insider)
O que os números realmente dizem (e por que são importantes)
- Correção de bug de repositório real (verificado pelo SWE-bench): 74,9%. Este benchmark fornece a um modelo um problema real de repositório + GitHub e o conta como uma vitória somente se seu patch passar nos testes. GPT-5 define a nova pontuação máxima aqui. Tradução: não é apenas preenchimento automático; ele pode conseguir correções que compilam e passam. (OpenAI, [swebench.com][3])
- Edição de código (Aider Polyglot): 88%. Este mede se o modelo pode produzir de forma confiável diffs/edições de arquivo inteiro corretas em problemas difíceis de Exercismo em vários idiomas. Pontuações altas aqui geralmente significam menos manchas malformadas e menos babás em seu editor. (OpenAI, [aider.chat][4])
- Eficiência vs. o3 em tarefas difíceis: OpenAI relata que o GPT-5 atinge esses resultados com ~22% menos tokens de saída e ~45% menos chamadas de ferramenta (em configurações comparáveis de alto raciocínio). Isso é importante tanto para a latência quanto para sua conta de nuvem. ([OpenAI][5])
Nota de nerd: SWE-bench Verified é uma fatia de problemas reais de 500 tarefas filtrada por humanos; A OpenAI diz que 23 tarefas foram omitidas em sua execução devido a peculiaridades de infra-estrutura – portanto, não compare porcentagens brutas sem ler as notas de rodapé. ([swebench.com][6], [OpenAI][5])
Como isso aparece em seu editor
OpenAI diz que GPT-5 agora é o modelo padrão no ChatGPT para usuários conectados, com um "Pensamento GPT-5" mais robusto para solicitações mais difíceis. Há também um roteador em tempo real que decide quando pensar mais em vez de responder rapidamente - útil em teoria, mas você também pode forçar o pensamento profundo pedindo literalmente para �?pensar bem sobre isso*.�?([OpenAI][7])
Para desenvolvedores, a variante da API é ajustada para codificação agente (uso de ferramentas, planos de várias etapas) e foi testada com ferramentas de codificação populares (Cursor, Windsurf, Copilot, etc.). É aqui que a afirmação “menos chamadas de ferramentas, melhores resultados” deve brilhar. ([OpenAI][5])
Preços em inglês simples
- API GPT-5: US$ 1,25 por 1 milhão de tokens de entrada; US$ 10 por 1 milhão de tokens de saída; entrada em cache US$ 0,125 por 1 milhão.
- GPT-5 mini/nano existe se você precisar de um produto mais barato e mais rápido para trabalhos mais simples. (E sim, o GPT-5 está sendo implementado no ChatGPT – gratuito e pago – com limites escalonados.) ([OpenAI][8])
Verificação da realidade: nem tudo são rosas 🌹
- A demonstração de lançamento teve alguns...?crimes nos gráficos (a OpenAI reconheceu e corrigiu-os). Se você se sentiu iluminado pelo comprimento das barras, não estava sozinho. (Business Insider)
- Na natureza, o roteamento pode falhar e o GPT-5 ainda irá atrapalhar o básico de vez em quando (ortografia, geografia - caramba). É poderoso, não perfeito. ([卫报][9])
Cinco dicas rápidas para realmente obter um código melhor do GPT-5
- Diga as palavras mágicas: adicione �?pense bem sobre isso*�?(ou escolha GPT-5 Thinking) para refatoradores de arquivos cruzados, bugs complicados ou andaimes de campo verde. ([OpenAI][7])
- Alimente-o com o contexto certo: mapa de repositório, arquivos-chave, testes com falha e rastreamentos de erros. Esses benchmarks recompensam configurações realistas por um motivo. ([swebench.com][3])
- Solicite diferenças + autoverificações: solicite /formato de patch e um plano de execução de teste pós-patch. Isso reflete como ele vence no banco Aider & SWE. (OpenAI, [aider.chat][4])text
git diff - Deixe-o usar ferramentas, mas audite os resultados: o modelo é melhor no encadeamento de etapas com menos chamadas. Ainda assim, revise o plano como faria com um desenvolvedor júnior. ([OpenAI][5])
- Cuidado com seus tokens: respostas longas e “pensativas” são caras; use-as onde valem a pena (arquitetura, depuração), não para renomear variáveis. ([OpenAI][5])
Então, o GPT-5 é “bom em programação”?
Resposta curta: Sim, o melhor da categoria em benchmarks de código do mundo real no momento, com ganhos práticos em estabilidade e uso de ferramentas. Ele não substituirá testes, revisão de código ou seu gosto em design de API, mas fornecerá mais correções na primeira tentativa e desperdiçará menos ciclos fazendo isso. E com o ChatGPT se aproximando de 700 milhões de usuários semanais, espere que seus colegas de equipe (e concorrentes) comecem a testá-lo em breve. (OpenAI)
Fontes e leituras adicionais
- OpenAI: Apresentando o GPT-5 (benchmarks, roteamento, disponibilidade). (OpenAI)
- OpenAI: GPT-5 para desenvolvedores (detalhes do banco SWE, eficiência vs. o3). ([OpenAI][5])
- Preços da API OpenAI (taxas de token oficiais). ([OpenAI][8])
- SWE-bench (o que “Verificado�?significa). ([swebench.com][3])
- Aider Polyglot (o que o teste de edição de código mede). ([aider.chat][4])
[3]: https://www.swebench.com/SWE-bench/?utm_source=chatgpt.com "Visão geral - documentação do SWE-bench" [4]: https://aider.chat/docs/leaderboards/?utm_source=chatgpt.com "Aider LLM Leaderboards" [5]: https://openai.com/index/introducing-gpt-5-for-developers/?utm_source=chatgpt.com "Apresentando GPT�? para desenvolvedores | OpenAI" [6]: https://www.swebench.com/?utm_source=chatgpt.com "Placares de banco SWE" [7]: https://openai.com/index/introducing-gpt-5/?utm_source=chatgpt.com "Apresentando GPT-5 - OpenAI" [8]: https://openai.com/api/pricing/ "Preços | OpenAI" [9]: https://www.theguardian.com/australia-news/2025/aug/08/openai-chatgpt-5-struggled-with-spelling-and-geography?utm_source=chatgpt.com "OpenAI revela ChatGPT-5 e sua inteligência de 'nível de doutorado' lutava com ortografia e geografia básicas"