Skip to main content
集成测试验证你的智能体与模型 API 和外部服务正确协同工作。与使用模拟和伪造的单元测试不同,集成测试进行实际的网络调用,以确认各组件协同工作、凭证有效、以及延迟可接受。 由于 LLM 响应是非确定性的,集成测试需要与传统软件测试不同的策略。本指南涵盖如何组织、编写和运行智能体的集成测试。如需为 LangChain 本身贡献代码的通用测试基础设施,请参阅贡献代码

分离单元测试和集成测试

集成测试较慢且需要 API 凭证,所以要将它们与单元测试分开。这让你可以在每次更改时运行快速的单元测试,而将集成测试保留给 CI 或部署前检查。 使用文件命名约定来分离集成测试。将集成测试文件命名为 *.int.test.ts,并配置 vitest 在默认运行中排除它们:
vitest.config.ts
package.json 中添加脚本:
显式运行集成测试:

管理 API 密钥

集成测试需要真实的 API 凭证。从环境变量中加载它们,以使密钥不进入源代码控制。 添加 dotenv/config 作为 vitest 的 setup 文件,以便从 .env 自动加载环境变量:
vitest.config.ts
.env
当密钥缺失时跳过测试:
.env 添加到你的 .gitignore 以避免提交凭证。在 CI 中,通过你的提供商的密钥管理注入密钥(例如 GitHub Actions secrets)。

断言结构而非内容

LLM 响应在每次运行之间有所不同。不要断言确切的输出字符串,而是验证响应的结构属性:消息类型、工具调用名称、参数形状和消息数量。
此示例使用了自定义测试匹配器。请参阅下面的章节了解设置和完整的匹配器参考。
如需更严格的轨迹断言,使用 AgentEvals 评估器,它支持 unorderedsuperset 等模糊匹配模式。

使用自定义测试匹配器

langchain 提供了自定义 vitest 匹配器,使结构断言更可读,并在失败时产生清晰的错误消息。在 setup 文件中注册一次,它们就可以在每个 expect() 调用中使用。

设置

添加一个 vitest setup 文件,用 LangChain 匹配器扩展 expect
vitest.setup.ts
在你的 vitest 配置中引用它:
vitest.config.ts
TypeScript 类型自动包含,因此不需要额外配置即可获得自动补全。

检查消息类型

每个消息类都有对应的匹配器:toBeHumanMessage()toBeAIMessage()toBeSystemMessage()toBeToolMessage()。不带参数调用只检查类型,或传入字符串来同时匹配内容:
传入对象来匹配特定字段:

断言工具调用

三个匹配器覆盖了对 AIMessage 的工具调用断言:

断言工具消息

toHaveToolMessages() 接受完整的消息数组,并按顺序检查其中的 ToolMessage 实例:

断言中断和结构化响应

toHaveBeenInterrupted() 检查 LangGraph 中断结果中的 __interrupt__ 字段。传入值来匹配中断负载:
toHaveStructuredResponse() 检查结果上的 structuredResponse 字段。传入对象来匹配特定字段:

匹配器参考

降低成本和延迟

调用 LLM API 的集成测试会产生实际成本。一些实践有助于保持测试套件快速且经济:
  • 使用较小的模型gemini-3.1-flash-lite-preview 或同等模型,用于只需验证工具调用和响应结构的测试。
  • 设置 maxTokens:限制响应长度以避免冗长、昂贵的补全。
  • 限制测试范围:每个测试测试一个行为。当单轮测试足够时,避免链接多个 LLM 调用的端到端场景。
  • 选择性运行:使用上面的测试分离,只在 CI 或部署前运行集成测试,而不是在每次文件保存时运行。

下一步

了解如何使用确定性匹配或 LLM 评委评估器来评估智能体轨迹,请参阅评估