测试 - Docs by LangChain

智能体应用允许大语言模型(LLM)自行决定下一步操作来解决问题。这种灵活性很强大，但模型的黑盒特性使得很难预测对智能体某一部分的调整会如何影响整体。要构建生产就绪的智能体，全面的测试至关重要。测试智能体有几种方法：

由于智能体应用将多个组件链接在一起，且必须处理大语言模型(LLM)非确定性带来的不稳定性，因此倾向于更多地依赖集成测试。

使用 LangSmith 大规模运行评估、跟踪结果变化趋势，并比较实验。参阅评估 LLM 应用开始使用。

单元测试

使用模拟聊天模型和内存持久化测试智能体逻辑，无需 API 调用。

使用真实 LLM API 测试你的智能体。组织测试、管理密钥、处理不稳定性并控制成本。

使用确定性匹配或 LLM 裁判评估器评估智能体轨迹。

将这些文档连接到 Claude、VSCode 等工具，通过 MCP 获取实时答案。

⌘I