智能体一旦接入多种外部工具,事实核查的逻辑就彻底变了。当大语言模型通过Anthropic主导的MCP(Model Context Protocol)协议同时调用电子病历、学术文献与数据库时,行业最头疼的问题不再是模型胡编乱造,而是内容完全属实、出处却张冠李戴。这种跨源混淆往往能轻易绕过主流评测系统,在医疗和金融等严肃场景埋下合规隐患。

Multiverse Computing团队针对这一痛点发表论文,提出首个专门面向MCP架构的来源感知核查层ProvenanceGuard。这套方案试图在不重新训练底层模型的前提下,剥离传统的证据池化机制,对智能体生成的每一条断言逐一验明正身。该方案在测试中对违规断言拿下了99.3%的高拦截召回率,但这套看似坚固的防线背后,也暴露出高难度场景下归属精度跳水以及严重依赖拒答退避的工程代价。

证据池化失灵:MCP多工具调用引爆跨源混淆

在传统的单文档检索增强生成(RAG)时代,行业通行的核查工具如RAGAS Faithfulness、MiniCheck、AlignScore与SummaC,底层逻辑几乎一致:将所有检索出的片段揉碎拼成一个证据池,只要模型生成的内容能在池子里找到语义支撑,系统就会判定该回答真实可信。

通用药典指南的禁忌条款,被错误归属并贴入患者的个体既往病历(示意图)
通用药典指南的禁忌条款,被错误归属并贴入患者的个体既往病历(示意图)

但在MCP成为多工具智能体标准协议后,这种做法露出了致命漏洞。智能体在一个会话中可能并行调取不同接口,生成一段形如根据患者病历,该药物存在30天禁忌周期的回答。30天禁忌周期的医学事实可能是真实的,甚至就躺在检索返回的一篇通用临床指南中,但该患者的独立病历里根本没有这行记录。在传统证据池的审视下,这句断言会被判定为完全属实,但在临床诊断中,将行业通用指南冒充为个体既往史,足以构成严重误诊风险。

证据池化与来源感知核查链路对比 传统模式:证据池化(Pool) 多源输入打散合并为单一上下文 只验证内容是否被池子蕴含 盲区:事实为真但出处错配直接放行 ProvenanceGuard:来源透传 保留MCP每个工具调用的独立标识 拆解断言并严格比对声明出处与真实源 阻断:跨源偷换出处即刻触发拦截

为阻断这种跨源混淆,ProvenanceGuard构建了一套五步非池化后验流水线。它直接读取智能体运行留存的MCP轨迹与工具标识,先将长回答拆解为原子断言,通过MiniLM模型检索定位最相关的候选来源,再由DeBERTa模型核验断言是否真正被该来源支持,随后比对断言实际声称的出处与支撑源是否吻合,最后输出包含单条断言来源归属在内的放行或拦截决策。

拦截召回99.3%:但在相似病历面前归属率大跌

从纯粹的安全拦截指标看,ProvenanceGuard交出了一份亮眼的数据。在包含40个医疗Agent轨迹、361条断言的留出测试集上,针对人类专家裁定不应通过的139条断言,该系统成功拦截了138条,漏检仅有1条,拦截召回率达到0.993。

面对双胞胎般的相似病历,系统对来源归属的判定准确率暴跌
面对双胞胎般的相似病历,系统对来源归属的判定准确率暴跌

其拦截F1值达到0.802,整体拦截准确率为0.812,明显超越了AlignScore的0.662和SummaC-ZS的0.436。在针对260条包含明确来源属性的断言测试中,系统实现了0.858的来源判定准确率。即使面对50组人工受控的来源归属对调测试,系统也保持了完全拦截的战绩。

宁可错杀也不漏过,但当来源高度相似时,出处裁决机制便开始动摇。

然而,这套严苛体系的优势主要体现在来源所有权核验这一增量环节上。如果只比拼对内容支持度的单纯判定,ProvenanceGuard相较于MiniCheck等专用小模型并未拉开质的代际差距,MiniCheck的拦截F1值为0.783,两者的置信区间在0.664到0.900之间高度重叠。

更为严峻的挑战发生在多源压力测试中。当测试环境扩展至59个复杂问题、254个案例及2587行候选信息时,虽然系统的拦截F1仍维持在0.846,但来源判定准确率迅速跌落至0.503,同时考量来源与逻辑支撑的关系准确率更是骤降至0.229。

关键场景表现:安全拦截率与来源归属准确率的落差 常规集拦截召回率 99.3% 139条违规断言拦截138条 多源压力综合归属率 22.9% 多候选干扰下出处关系断崖 跨患者同科室归属率 12.7% 极度相似数据源辨析严重失准

在最具业务破坏性的同主题跨病历切片下,当系统需要从同一科室、不同患者的相似记录中厘清依据时,来源与关系的综合判定准确率仅剩12.7%。这表明现有模型在粗粒度排查上有力,但在细颗粒度的上下文分辨上,依然难以分清双胞胎般的数据源。


修复神话的底色:八成以上拦截靠拒答退避

针对被系统拦截的回答,研究团队引入了类似RARR的知识对齐修复机制,并在281条真实医疗轨迹全量测试中达成了拦截后100%通过复检的成绩。但如果穿透这一表面数据,就会发现其极高的安全性实际上是由巨大的可用性牺牲换来的。

热像下矩阵大面积处于冰蓝冷态,超八成修复仅是拒答退避
热像下矩阵大面积处于冰蓝冷态,超八成修复仅是拒答退避

在首轮被拦截的173个回答中,最终有144个是通过触发保守兜底降级文本过关的,占比达到83.2%。也就是说,系统在绝大多数情况下并没有真正重构事实或修正来源标注,而是直接选择了声明无法回答以规避风险。在50例来源置换受控实验中,同样有11例依靠兜底退避完成所谓的修复。

评估阶段与对应测试集初始拦截数量终态修复通过率兜底退避比例核心工程表现
全量医疗轨迹测试(281例)173例被拦截100%通过83.2%(144例退避)依赖拒答过关,实体改写极少
人工出处对调探针(50例)50例全部拦截100%通过22.0%(11例退避)强行置换易察觉,重写成功率较高
多源重构压力测试(59例)59例被拦截100%通过3.4%(仅2例退避)结构化重构下重写链路运转良好

对于追求绝对免责的极端风控场景,这类宁可拒答不可错答的策略无可厚非;但在实际业务落地中,超过八成的退避比例极易导致智能体失去业务价值。如果用户频繁遭遇系统拒答,技术的实用性便会大打折扣。

除修复机制本身的工程局限外,ProvenanceGuard目前还面临可复现性上的阻碍。截至2026年9月下旬,项目在GitHub上的官方仓库(aalvsz/provenanceguard)仍声明测试集与复现代码尚未公开,技术落地目前更多依赖架构借鉴。例如NVIDIA NVFlow在其金融Agent开发中,借鉴了类似的来源感知核查设计,用于比对SEC报表摘录。

  • 提醒.记录MCP工具调用标识并不等于掌握了真实知识出处,系统目前仅追踪到接口层级,无法验证数据的时间戳新鲜度、截断损耗或内容哈希。

智能体架构从单一检索演进到多工具协同后,事实本身的真假已经不再是可信的唯一尺度。Multiverse Computing的探索撕开了证据池化方案的遮羞布,但当行业试图在MCP上建立严肃的溯源体系时,如何在分辨相似源的精准度与过高的拒答率之间找到平衡,依然是下一阶段必须跨过的现实门槛。