GPT-5 for Coding 2025:基准、定价和 5 个专业提示

GPT-5 改变了编程方式。真实世界基准、定价细目、常见陷阱以及 5 个利用 AI 工具提高编码效率的专家提示。

PublishedAugust 9, 2025
Reading time1 min read
Word count211 words
Topics9 linked tags

用于编码的 GPT-5:基准和定价

描述: GPT-5 终于在编码方面带来了真正的收获。以下是基准的实际含义、成本、要点以及获得更好结果的五个技巧。


如果您错过了直播(以及“创意图表”),那么它的缺点是:GPT-5 已经推出,速度很快,而且最重要的是,它比早期模型在真实代码方面更好**。数字中有合法信号,还有一些值得了解的发布周面孔。([Business Insider][1])

这些数字实际上说明了什么(以及它们为何重要)

  • 真实存储库错误修复(SWE-bench 已验证):74.9%。 该基准测试为模型提供了真正的 GitHub 存储库 + 问题,并且仅当其补丁通过测试时才将其视为胜利。 GPT-5 在这里设定了新的最高分。翻译:这不仅仅是自动完成;它是自动完成的。它可以修复编译并通过的问题。 ([OpenAI][2]、[swebench.com][3])
  • 代码编辑(Aider Polyglot):88%。 这一指标衡量模型是否能够在多种语言的棘手 Exercism 问题上可靠地生成正确的 差异/整个文件编辑。这里的高分通常意味着更少的畸形补丁和更少的编辑器照顾。 ([OpenAI][2]、[aider.chat][4])
  • 在艰巨任务上与 o3 的效率: OpenAI 报告 GPT-5 达到了这些结果,输出令牌减少了约 22%,工具调用减少了 ~45%(在相当的高推理设置下)。这对于延迟和云账单都很重要。 ([OpenAI][5])

书呆子注:SWE-bench Verified 是一个 500 项任务 人工过滤的真实问题片段; OpenAI 表示,由于基础设施的怪异,在运行过程中遗漏了 23 项任务,因此请勿在未阅读脚注的情况下比较原始百分比。 ([swebench.com][6]、[OpenAI][5])

这如何显示在你的编辑器中

OpenAI 表示,GPT-5 现在是 ChatGPT** 中针对登录用户的默认模型,具有更强大的“GPT-5 思考”开关,以提供更难的提示。还有一个实时路由器**,可以决定何时思考更长的时间与快速回答——理论上很有用,但您也可以通过字面上要求它“认真思考这个问题”来强制进行深入思考。”([OpenAI][7])

对于开发人员来说,API 变体针对代理编码(工具使用、多步骤计划)进行了调整,并使用流行的编码工具(Cursor、Windsurf、Copilot 等)进行了测试。这就是“更少的工具调用,更好的结果”这一主张应该大放异彩的地方。([OpenAI][5])

用简单的英语定价

  • GPT-5 API: 每 100 万个输入代币 1.25 美元每 100 万个输出代币 10 美元;缓存输入每 1M $0.125
  • 如果您需要更便宜、更快的速度来完成更简单的工作,GPT-5 mini / nano 就存在。 (是的,GPT-5 正在 ChatGPT 上推出——免费和付费——有分级限制。)([OpenAI][8])

现实检验:这并不都是玫瑰🌹

  • 发布演示存在一些……图表错误(OpenAI 承认并修复了这些问题)。如果您因杆的长度而感到气喘吁吁,那么您并不孤单。 ([商业内幕][1])
  • 在野外,路由可能会失败,而 GPT-5 仍然会时不时地搞砸基础知识(拼写、地理——哎呀)。它很强大,但并不完美。 ([卫报][9])

真正从 GPT-5 中获得更好代码的五个快速技巧

  1. **说出神奇的话:添加…认真思考这个…(或选择 GPT-5 思考)以解决跨文件重构、棘手的错误或新手脚手架。 ([OpenAI][7])
  2. 为其提供正确的上下文: 存储库映射、关键文件、失败的测试和错误跟踪。这些基准奖励现实的设置是有原因的。 ([swebench.com][3])
  3. **要求差异+自我检查:**请求
    text
    git diff
    /补丁格式和补丁后测试运行计划。这反映了它如何在 Aider & SWE 替补席上获胜。 ([OpenAI][2]、[aider.chat][4])
  4. **让它使用工具,但审核结果:**该模型更擅长以更少的调用链接步骤 - 仍然像初级开发人员一样审查计划。 ([OpenAI][5])
  5. **注意你的代币:**长的“思考”答案是昂贵的;在有回报的地方使用它们(架构、调试),而不是重命名变量。([OpenAI][5])

那么 GPT-5 是否“擅长编程”?

简短的回答:是的,目前在实际代码基准测试中是一流的,在稳定性和工具使用方面具有实际收益。它不会取代测试、代码审查或您对 API 设计的品味,但它在第一次尝试中提供更多修复,并浪费更少的周期。随着 ChatGPT 每周用户数接近 7 亿,预计您的队友(和竞争对手)很快就会试用它。 ([OpenAI][2])


来源和进一步阅读

  • OpenAI:介绍 GPT-5(基准、路由、可用性)。 ([OpenAI][2])
  • OpenAI:面向开发人员的 GPT-5(SWE 基准详细信息、效率与 o3)。 ([OpenAI][5])
  • OpenAI API 定价(官方代币费率)。 ([OpenAI][8])
  • SWE-bench(“已验证”的含义)。([swebench.com][3])
  • Aider Polyglot(代码编辑测试衡量的内容)。 ([aider.chat][4])

[1]: https://www.businessinsider.com/openai-made-mistakes-with-charts-in-its-gpt-5-demo-2025-8?utm_source=chatgpt.com “在人们指出 GPT-5 直播中出现问题后,OpenAI 修复了‘无意的图表犯罪’” [2]: https://openai.com/index/introducing-gpt-5/ 《GPT-5简介 | 开放人工智能” [3]:https://www.swebench.com/SWE-bench/?utm_source=chatgpt.com“概述 - SWE 基准文档”[4]:https://aider.chat/docs/leaderboards/?utm_source=chatgpt.com“Aider LLM 排行榜” [5]: https://openai.com/index/introducing-gpt-5-for-developers/?utm_source=chatgpt.com “为开发者介绍 GPT? | 开放人工智能” [6]: https://www.swebench.com/?utm_source=chatgpt.com“SWE-bench 排行榜”[7]: https://openai.com/index/introducing-gpt-5/?utm_source=chatgpt.com“GPT-5 简介 - OpenAI” [8]:https://openai.com/api/pricing/》定价 | 开放人工智能” [9]: https://www.theguardian.com/australia-news/2025/aug/08/openai-chatgpt-5-struggled-with-spelling-and-geography?utm_source=chatgpt.com “OpenAI 推出 ChatGPT-5,其大肆宣传的‘博士级’智能在基本拼写和地理方面遇到困难”

Primary AI track

Continue through AI Model Comparisons

Open the full hub

Benchmarks, pricing, open-source tradeoffs, and coding capability analysis for builders choosing AI models.

Action checklist

Implementation steps

Step 1

提供回购上下文

共享关键文件、错误和测试,以便模型可以有效地进行推理。

Step 2

请求差异

要求进行补丁式更改和自检计划。

Step 3

验证输出

在接受更改之前运行测试或 linting。

FAQ

Common questions

GPT-5 基准测试证明了什么?

它们大规模地表明了现实世界的代码编辑和错误修复的准确性。

如何保持较低的 GPT-5 成本?

提供有重点的上下文,避免对简单任务进行冗长的推理。

Continue in the archive

Related guides and topic hubs

These links turn a single article into a stronger learning path and help the archive behave more like a topic cluster.

Next step

Choose where to go from here

Good archive pages should always suggest the next best action, not just another loose list of links.

Share This Article

Found this article helpful? Share it with your network to help others discover it too.

Keep reading

Related technical articles

Browse the full archive