EU AI Act 对 agent 系统的技术要求:LangSmith 与 LangChain OSS 如何逐条满足
欧盟 AI 法案(EU AI Act)8 月 2 日关键条款生效在即,其要求覆盖所有 AI 系统——包括做推理、检索上下文、调用工具、多步决策的 agent。LangChain 官方博客把法案对 agent 的技术要求拆成几大块,逐条对照 LangSmith 与 LangChain OSS 的能力,并附文章条款交叉对照表。
可观测性与追踪:完整执行捕获
监管者需要 AI 系统行为的记录。对做多步决策的 agent,最佳实践是追踪完整线程,包括输入、推理、工具调用和输出。
- 第 9 条要求贯穿开发周期的动态风险管理系统;
- 第 12 条要求系统全生命周期自动事件日志,足以识别风险、支撑上市后监控和部署方运营监督;
- 第 13 条要求可追溯、可解释的决策。
LangSmith 的做法:端到端追踪捕获每一次 LLM 调用、工具调用和推理步骤,带结构化元数据(输入、输出、时间戳、agent 上下文);Studio 可视化完整执行图,含状态转换和工具调用;Insights Agent 自动识别并聚类反复出现的模式,浮现人工审查容易漏掉的失败模式;自定义仪表盘跟踪风险分并通过 PagerDuty 或 webhook 触发告警。
存储方面,托管云基础 trace 保留 14 天,扩展 trace 保留 400 天,可随时升级并批量导出长期归档。针对欧盟数据驻留,LangSmith EU 将所有 trace 数据留在管辖区内存放;自托管和 BYOC 选项让整个栈跑在客户自己的集群或云区域。
评估器:持续质量与安全评分
法案要求持续测量,用生产流量的评估。
- 第 10 条要求数据治理和偏见审查;
- 第 13 条要求系统透明到部署方足以解释输出并恰当使用;
- 第 15 条要求声明的准确度、对抗韧性和对常见攻击面的防护。
LangSmith 在线评估器按你定义的过滤器持续给生产 trace 的可配置样本打分,每个分数带完整 trace 上下文形成证据链,指标超阈值时通过 PagerDuty 或 webhook 告警。预置评估器覆盖:偏见与公平(种族、性别、年龄、宗教、国籍、残障、性取向等特征)、对个人和群体的毒性、敏感图像与露骨内容、幻觉与答案相关性、PII 泄漏、提示注入与越狱、API 泄漏与代码注入(覆盖工具调用 agent 的常见攻击面)、正确性/精确匹配/计划遵循/任务完成、工具选择与计划遵循(评估 agent 决策质量)。每个评估器都可定制,也能为特定用例新建。
人工监督:打断、审查、升级
人工监督是法案核心原则之一:AI 系统做出的重要决策应保持可由人质疑和纠正。
- 第 14 条要求人能理解、介入、覆盖和打断系统。
对 agentic 系统,这分量更重:做多步决策的 agent 可能在人类发现之前就把错误叠加放大,有些情况下监督机制需要嵌进执行图本身。LangGraph 的 interrupt 原语把人在环上(HITL)变成 agent 图的一等公民——在任何节点暂停执行、检查状态、修改、恢复;LangSmith Deployment 的持久运行时提供自动检查点、恰好一次执行、暂停运行从精确断点恢复。标注队列把生产 trace 路由给人审阅者做结构化反馈;评估器超阈值或打断事件触发 webhook,通过 PagerDuty 或首选事件响应系统联系正确的人。
从哪开始
文章给团队的起点建议:可观测性和追踪是地基——每条工具调用、检索步骤、推理节点的完整追踪提供了审计线索和运行评估的基础;对生产流量的评估(偏见、幻觉、毒性、准确度、对抗输入)满足上市后监控要求;人在环上是架构要求,LangGraph 的 interrupt 和标注队列让介入机制可审计;数据驻留靠部署选择解决——EU SaaS、BYOC、完全自托管。
最后文章给出一个关键提醒:这些和团队把 agent 跑进生产时已经该做的最佳实践是同一套。
来源:How LangSmith and LangChain OSS Help You Meet EU AI Act Requirements - LangChain Blog