AI Agents Production 2025:我如何避免 3400 美元的错误

从演示到部署:构建生产 AI 代理的真实课程。了解熔断机制、代币管理和成本优化,以避免 API 灾难。

PublishedSeptember 4, 2025
Reading time1 min read
Word count191 words
Topics8 linked tags

AI 代理制作指南:避免 3400 美元

2025 年 1 月 21 日

上个月,我因一位失控的客户服务代理而消耗了 3,400 美元的 API 成本。如今,同一系统每天可以处理 1,000 多个查询,费用不到 50 美元。这是我通过艰难的方式学到的东西。

现实检验

每个人都在构建人工智能代理。很少有人谈论当他们遇到真正的用户时会发生什么。在跨三个生产系统部署代理之后,我收集了一些值得分享的战斗伤痕。

这个承诺很诱人:能够思考、行动和适应的自治系统。现实呢? 大多数代理都很昂贵,而循环却充满了宏伟的幻想。

3,400 美元的错误

我们的第一个代理使用了 LangChain 和 GPT-4。简单的架构:

  1. 分析用户查询
  2. 获取相关文档
  3. 生成响应
  4. 验证准确性
  5. 如果需要的话进行细化

看起来防弹。直到用户询问“所有可能的产品变体”。

代理进入递归循环,生成变化、验证它们、发现问题并生成更多变化。 47 分钟。 230 万个代币。 3,400 美元。

经验教训:特工需要断路器,而不仅仅是护栏。

什么实际有效

经过三个月的迭代,我们的生产架构如下:

1. 代币预算管理

python
class AgentExecutor: def __init__(self, max_tokens=50000, max_iterations=5): self.token_budget = max_tokens self.iteration_limit = max_iterations

每个代理都有一个硬令牌限制。时期。没有例外。

2. 分层模型策略

  • 分类器:Claude Haiku(0.25 美元/100 万代币)- 路线查询
  • 简单查询:GPT-3.5 Turbo - 处理 70% 的请求
  • 复杂任务:GPT-4 - 仅在必要时
  • 验证:Gemini Flash - 具有成本效益的双重检查

这在不降低质量的情况下将成本降低了 85%

3. 有效的状态持久化

忘记复杂的状态机。我们使用简单的 JSON 检查点:

json
{ "stage": "data_retrieval", "tokens_used": 12500, "iterations": 2, "context": {...}, "can_resume": true }

如果出现故障,我们会从检查点恢复,而不是从头开始。

重要的指标

虚荣指标救不了你。而是跟踪这些:

  • 每次成功解决问题的成本:我们的成本从 8.50 美元下降到 0.12 美元
  • 超时率:应低于 2%
  • 人工交接率:我们为 18%(之前为 65%)
  • P95响应时间:4.2秒(用户最多容忍5秒)

三个不明显的见解

1. 决定论胜过智力

智能代理是不可预测的。愚蠢的代理商拥有良好的轨道是有利可图的。我们用决策树 + LLM 组合取代了“推理”代理。效果更好,成本降低 90%。

2. 流媒体节省的不仅仅是钱

用户在沉默 3 秒后放弃。流媒体回复将放弃率降低了 60%。心理影响比技术优雅更重要。

3. 故障模式是特征

我们的代理现在可以更快地说“我需要人工帮助”。用户满意度提高。违反直觉但却是事实:用户更喜欢快速升级而不是长时间的失败尝试。

可扩展的框架

这是我们当前的堆栈:

  • 编排:Temporal(不是LangChain)
  • 矢量数据库:Qdrant(自托管)
  • 监控:OpenTelemetry + Grafana
  • 断路器:自定义Python中间件
  • 测试:专有的黄金数据集(1,000 个真实查询)

接下来是什么?

代理淘金热确实存在,但大多数团队都在针对演示而不是生产进行优化。获胜者将是那些了解代理是工具,而不是魔法的人。

我的预测:2025 年将是“无聊”代理商的一年——专业化、可预测且有利可图。 AGI 梦想可以等待;企业需要当今有效的解决方案。

要点

�?从狭窄的用例开始 �?添加约束,而不是功能 �?衡量一切 �?始终,始终有一个终止开关


目前正在构建:代理成本预测模型。关注现实世界人工智能工程的最新动态。

Primary AI track

Continue through AI Coding Agent Stack

Open the full hub

A practical path for understanding coding agent runtime design, tool systems, MCP integration, permissions, sessions, and extensibility.

Action checklist

Implementation steps

Step 1

设置令牌限制

为每个代理执行定义最大令牌和迭代。

Step 2

按复杂程度划分的路线

使用较便宜的型号来完成简单的任务,并为硬箱保留优质型号。

Step 3

监视和杀死循环

跟踪每个任务的成本并在达到阈值时强制执行终止开关。

FAQ

Common questions

为什么人工智能代理会增加成本?

它们可以循环或过度迭代,而没有硬令牌和迭代限制。

最快的安全修复是什么?

为每个请求添加断路器和严格的代币预算。

Continue in the archive

Related guides and topic hubs

These links turn a single article into a stronger learning path and help the archive behave more like a topic cluster.

Next step

Choose where to go from here

Good archive pages should always suggest the next best action, not just another loose list of links.

Share This Article

Found this article helpful? Share it with your network to help others discover it too.

Keep reading

Related technical articles

Browse the full archive