如果两个模型分数来自不同的任务、数据集或代理支架,那么它们就不是一个排行榜。这种人工智能基准测试方法通过使隐藏变量可见来保持比较的有用性。
我们的目标不是制造一个赢家。目标是回答买家或工程师的真正问题:在这种成本和这种监督级别下,哪种系统对于此工作流程来说足够可靠?
每个分数需要的五个层
在记录数字之前,捕获五层:
- 任务 — 系统必须做什么:修复存储库、编辑文件、解决算法、回答科学问题或操作终端?
- 数据集 — 使用了哪个版本、日期范围、语言组合和污染控制?
- 系统 — 它是原始模型、API 配置、IDE 助手还是带工具的编码代理?
- 指标 — 结果是解决百分比、精确匹配、通过率、获胜率、延迟、成本还是人类偏好分数?
- 证据 — 读者可以检查模型卡、排行榜行、纸张或复制笔记本吗?
如果缺少任何这些字段,请将数字标记为不完整,而不是将其呈现为干净的模型比较。
单独的源类
第一个编辑决定是来源分类。即使讨论的是同一模型,也要将行分开。
| 源类 | 它能告诉你什么 | 它不能证明什么 |
|---|---|---|
| 供应商发布报告 | 供应商选择的任务、配置和最佳情况结果 | 相同的结果将转移到您的工作流程中 |
| 第三方排行榜 | 已发布的线束下更独立的视图 | 每行使用相同的工具或推理预算 |
| 社区评价 | 有关新兴模式和实际摩擦的快速信号 | 稳定的科学重现性 |
| 内部繁殖 | 模型在您的具体环境中的表现如何 | 任务样本之外的一般表现 |
LLM 基准比较 在其表中使用这种分离。供应商指标保留在供应商行中; Aider 和 SWE-bench 与他们自己的公共评估环境保持联系。
记录脚手架,而不仅仅是模型
代理编码分数通常包括检索、文件选择、shell 执行、测试运行、重试、补丁修复和批准策略。这些层不是噪音。它们是团队实际采用的产品的一部分。
对于每个代理基准,记录:
- 型号名称和版本;
- 上下文窗口和推理模式;
- 系统可用的工具;
- 检索或存储库索引规则;
- 最大次数、重试次数和代币预算;
- 沙箱和网络权限;
- 测试命令和通过/失败策略;
- 人类是否可以干预。
这就是为什么AI代理工具比较属于模型分数旁边:界面改变了结果。
使用任务匹配的基准系列
不要将不相关的分数平均到发明的综合分数中。使用与预期工作相似的基准系列。
| 决定 | 主要证据 | 次要证据 |
|---|---|---|
| 修复生产存储库 | SWE-bench 或内部问题集 | 测试通过率、审核时间、回滚率 |
| 进行干净的多语言编辑 | 助手式编辑评估 | 差异大小、校正循环、每次接受更改的成本 |
| 解决新的算法问题 | LiveCodeBench 风格的测试 | 编译率、解决时间、污染检查 |
| 运营终端代理 | 终端工作台式任务 | 权限提示、恢复率、人工接管率 |
| 选择推理模型 | 与领域匹配的数学/科学基准 | 校准、引用质量、错误严重性 |
AI 模型目录 是此决策图的规范入口点。它应该引导读者进行特定于任务的比较,而不是通用的“最佳模型”声明。
发布证据分类账
证据分类账使刷新可审计。最小记录如下所示:
textscore: 58.6% benchmark: SWE-Bench Pro source_type: vendor-reported source_url: https://example.com/model-card model: Example Model 1.0 scaffold: vendor agent, test execution enabled checked_at: 2026-08-20 reproducible: no public harness decision_use: directional signal only
decision_use刷新节奏和变更控制
对破坏模型版本进行 7 天检查,对源和链接完整性进行 14 天检查,对整个比较页面进行 28 天审查。刷新应同时更新源日期、分数表、注意事项和结论。
不要在不更新乐谱周围的散文的情况下更新乐谱。即使图表看起来仍然熟悉,新的排行榜行也可以更改推荐。当使用比较来选择代理工作流程而不是原始 API 模型时,请将 Claw Code 使用指南 放在附近。
底线
一个有用的基准比较是一个小型研究工具。它命名任务,保留源类,记录脚手架,显示日期,并解释分数无法证明的内容。这比复制排行榜标题要慢,但它产生的决策可以在下一个模型发布中继续存在。