AI 代理制作指南:避免 3400 美元
2025 年 1 月 21 日
上个月,我因一位失控的客户服务代理而消耗了 3,400 美元的 API 成本。如今,同一系统每天可以处理 1,000 多个查询,费用不到 50 美元。这是我通过艰难的方式学到的东西。
现实检验
每个人都在构建人工智能代理。很少有人谈论当他们遇到真正的用户时会发生什么。在跨三个生产系统部署代理之后,我收集了一些值得分享的战斗伤痕。
这个承诺很诱人:能够思考、行动和适应的自治系统。现实呢? 大多数代理都很昂贵,而循环却充满了宏伟的幻想。
3,400 美元的错误
我们的第一个代理使用了 LangChain 和 GPT-4。简单的架构:
- 分析用户查询
- 获取相关文档
- 生成响应
- 验证准确性
- 如果需要的话进行细化
看起来防弹。直到用户询问“所有可能的产品变体”。
代理进入递归循环,生成变化、验证它们、发现问题并生成更多变化。 47 分钟。 230 万个代币。 3,400 美元。
经验教训:特工需要断路器,而不仅仅是护栏。
什么实际有效
经过三个月的迭代,我们的生产架构如下:
1. 代币预算管理
pythonclass AgentExecutor: def __init__(self, max_tokens=50000, max_iterations=5): self.token_budget = max_tokens self.iteration_limit = max_iterations
每个代理都有一个硬令牌限制。时期。没有例外。
2. 分层模型策略
- 分类器:Claude Haiku(0.25 美元/100 万代币)- 路线查询
- 简单查询:GPT-3.5 Turbo - 处理 70% 的请求
- 复杂任务:GPT-4 - 仅在必要时
- 验证:Gemini Flash - 具有成本效益的双重检查
这在不降低质量的情况下将成本降低了 85%。
3. 有效的状态持久化
忘记复杂的状态机。我们使用简单的 JSON 检查点:
json{ "stage": "data_retrieval", "tokens_used": 12500, "iterations": 2, "context": {...}, "can_resume": true }
如果出现故障,我们会从检查点恢复,而不是从头开始。
重要的指标
虚荣指标救不了你。而是跟踪这些:
- 每次成功解决问题的成本:我们的成本从 8.50 美元下降到 0.12 美元
- 超时率:应低于 2%
- 人工交接率:我们为 18%(之前为 65%)
- P95响应时间:4.2秒(用户最多容忍5秒)
三个不明显的见解
1. 决定论胜过智力
智能代理是不可预测的。愚蠢的代理商拥有良好的轨道是有利可图的。我们用决策树 + LLM 组合取代了“推理”代理。效果更好,成本降低 90%。
2. 流媒体节省的不仅仅是钱
用户在沉默 3 秒后放弃。流媒体回复将放弃率降低了 60%。心理影响比技术优雅更重要。
3. 故障模式是特征
我们的代理现在可以更快地说“我需要人工帮助”。用户满意度提高。违反直觉但却是事实:用户更喜欢快速升级而不是长时间的失败尝试。
可扩展的框架
这是我们当前的堆栈:
- 编排:Temporal(不是LangChain)
- 矢量数据库:Qdrant(自托管)
- 监控:OpenTelemetry + Grafana
- 断路器:自定义Python中间件
- 测试:专有的黄金数据集(1,000 个真实查询)
接下来是什么?
代理淘金热确实存在,但大多数团队都在针对演示而不是生产进行优化。获胜者将是那些了解代理是工具,而不是魔法的人。
我的预测:2025 年将是“无聊”代理商的一年——专业化、可预测且有利可图。 AGI 梦想可以等待;企业需要当今有效的解决方案。
要点
�?从狭窄的用例开始 �?添加约束,而不是功能 �?衡量一切 �?始终,始终有一个终止开关
目前正在构建:代理成本预测模型。关注现实世界人工智能工程的最新动态。