用于编码的 GPT-5:基准和定价
描述: GPT-5 终于在编码方面带来了真正的收获。以下是基准的实际含义、成本、要点以及获得更好结果的五个技巧。
如果您错过了直播(以及“创意图表”),那么它的缺点是:GPT-5 已经推出,速度很快,而且最重要的是,它比早期模型在真实代码方面更好**。数字中有合法信号,还有一些值得了解的发布周面孔。([Business Insider][1])
这些数字实际上说明了什么(以及它们为何重要)
- 真实存储库错误修复(SWE-bench 已验证):74.9%。 该基准测试为模型提供了真正的 GitHub 存储库 + 问题,并且仅当其补丁通过测试时才将其视为胜利。 GPT-5 在这里设定了新的最高分。翻译:这不仅仅是自动完成;它是自动完成的。它可以修复编译并通过的问题。 ([OpenAI][2]、[swebench.com][3])
- 代码编辑(Aider Polyglot):88%。 这一指标衡量模型是否能够在多种语言的棘手 Exercism 问题上可靠地生成正确的 差异/整个文件编辑。这里的高分通常意味着更少的畸形补丁和更少的编辑器照顾。 ([OpenAI][2]、[aider.chat][4])
- 在艰巨任务上与 o3 的效率: OpenAI 报告 GPT-5 达到了这些结果,输出令牌减少了约 22%,工具调用减少了 ~45%(在相当的高推理设置下)。这对于延迟和云账单都很重要。 ([OpenAI][5])
书呆子注:SWE-bench Verified 是一个 500 项任务 人工过滤的真实问题片段; OpenAI 表示,由于基础设施的怪异,在运行过程中遗漏了 23 项任务,因此请勿在未阅读脚注的情况下比较原始百分比。 ([swebench.com][6]、[OpenAI][5])
这如何显示在你的编辑器中
OpenAI 表示,GPT-5 现在是 ChatGPT** 中针对登录用户的默认模型,具有更强大的“GPT-5 思考”开关,以提供更难的提示。还有一个实时路由器**,可以决定何时思考更长的时间与快速回答——理论上很有用,但您也可以通过字面上要求它“认真思考这个问题”来强制进行深入思考。”([OpenAI][7])
对于开发人员来说,API 变体针对代理编码(工具使用、多步骤计划)进行了调整,并使用流行的编码工具(Cursor、Windsurf、Copilot 等)进行了测试。这就是“更少的工具调用,更好的结果”这一主张应该大放异彩的地方。([OpenAI][5])
用简单的英语定价
- GPT-5 API: 每 100 万个输入代币 1.25 美元; 每 100 万个输出代币 10 美元;缓存输入每 1M $0.125。
- 如果您需要更便宜、更快的速度来完成更简单的工作,GPT-5 mini / nano 就存在。 (是的,GPT-5 正在 ChatGPT 上推出——免费和付费——有分级限制。)([OpenAI][8])
现实检验:这并不都是玫瑰🌹
- 发布演示存在一些……图表错误(OpenAI 承认并修复了这些问题)。如果您因杆的长度而感到气喘吁吁,那么您并不孤单。 ([商业内幕][1])
- 在野外,路由可能会失败,而 GPT-5 仍然会时不时地搞砸基础知识(拼写、地理——哎呀)。它很强大,但并不完美。 ([卫报][9])
真正从 GPT-5 中获得更好代码的五个快速技巧
- **说出神奇的话:添加…认真思考这个…(或选择 GPT-5 思考)以解决跨文件重构、棘手的错误或新手脚手架。 ([OpenAI][7])
- 为其提供正确的上下文: 存储库映射、关键文件、失败的测试和错误跟踪。这些基准奖励现实的设置是有原因的。 ([swebench.com][3])
- **要求差异+自我检查:**请求/补丁格式和补丁后测试运行计划。这反映了它如何在 Aider & SWE 替补席上获胜。 ([OpenAI][2]、[aider.chat][4])text
git diff - **让它使用工具,但审核结果:**该模型更擅长以更少的调用链接步骤 - 仍然像初级开发人员一样审查计划。 ([OpenAI][5])
- **注意你的代币:**长的“思考”答案是昂贵的;在有回报的地方使用它们(架构、调试),而不是重命名变量。([OpenAI][5])
那么 GPT-5 是否“擅长编程”?
简短的回答:是的,目前在实际代码基准测试中是一流的,在稳定性和工具使用方面具有实际收益。它不会取代测试、代码审查或您对 API 设计的品味,但它将在第一次尝试中提供更多修复,并浪费更少的周期。随着 ChatGPT 每周用户数接近 7 亿,预计您的队友(和竞争对手)很快就会试用它。 ([OpenAI][2])
来源和进一步阅读
- OpenAI:介绍 GPT-5(基准、路由、可用性)。 ([OpenAI][2])
- OpenAI:面向开发人员的 GPT-5(SWE 基准详细信息、效率与 o3)。 ([OpenAI][5])
- OpenAI API 定价(官方代币费率)。 ([OpenAI][8])
- SWE-bench(“已验证”的含义)。([swebench.com][3])
- Aider Polyglot(代码编辑测试衡量的内容)。 ([aider.chat][4])
[1]: https://www.businessinsider.com/openai-made-mistakes-with-charts-in-its-gpt-5-demo-2025-8?utm_source=chatgpt.com “在人们指出 GPT-5 直播中出现问题后,OpenAI 修复了‘无意的图表犯罪’” [2]: https://openai.com/index/introducing-gpt-5/ 《GPT-5简介 | 开放人工智能” [3]:https://www.swebench.com/SWE-bench/?utm_source=chatgpt.com“概述 - SWE 基准文档”[4]:https://aider.chat/docs/leaderboards/?utm_source=chatgpt.com“Aider LLM 排行榜” [5]: https://openai.com/index/introducing-gpt-5-for-developers/?utm_source=chatgpt.com “为开发者介绍 GPT? | 开放人工智能” [6]: https://www.swebench.com/?utm_source=chatgpt.com“SWE-bench 排行榜”[7]: https://openai.com/index/introducing-gpt-5/?utm_source=chatgpt.com“GPT-5 简介 - OpenAI” [8]:https://openai.com/api/pricing/》定价 | 开放人工智能” [9]: https://www.theguardian.com/australia-news/2025/aug/08/openai-chatgpt-5-struggled-with-spelling-and-geography?utm_source=chatgpt.com “OpenAI 推出 ChatGPT-5,其大肆宣传的‘博士级’智能在基本拼写和地理方面遇到困难”