美军内部近期复盘了一起由大语言模型幻觉引发的情报险情。某战区情报评估流程中,分析人员使用商业模型汇总多源碎片信息,系统凭空捏造了一份带有完整密级标注与虚构信源代码的敌情动态,并险些作为战备行动依据送达指挥链路。

这件事暴露的技术短板远非算法精度不足那么简单。防务领域引入生成式系统,最大的风险从来不是机器吐出乱码,而是算法用严丝合缝的公文规范将虚假信息洗版为权威文本,彻底击穿了参谋体系既有的核验防线。

虚构简报如何渗入作战链路

根据美军内部调查梳理的细节,涉事单位当时面对海量的开源数据、无线电监测记录与无人机图传文字摘要。值班人员为了在规定时限内交付态势报告,调用了处于测试阶段的分析辅助模型。

模型在输入信源存在断点的情况下,自行补全了虚构的对手部队集结时间和调动代码。这套生成结果完全契合五角大楼标准情报公文的行文习惯,术语准确,信源编号看似严谨,初审人员甚至未能察觉任何破绽。

直到战区联合参谋层面对照原始侦察数据库进行信源回溯时,才发现核心判断对应的原始记录根本不存在。整份研判随即被紧急撤回,指挥层随后叫停了该辅助工具直接接入涉密简报系统的权限。

格式严谨正在瘫痪人类审核

机器生成物最狡猾的地方,在于它用规范的语言结构消解了人类的警惕心理。

历史上有过多次自动化系统引发的军事警报。冷战时期的早期预警雷达曾把阳光反射误认为发射轨迹,但当时的军官能够根据常理识别出传感器异常并按下暂停键。如今的生成式AI走向了反面,它交付给人类的不是异常信号,而是一份比初级参谋写得还要标准的合成公文。

评估维度传统人工情报流转引入未经校准的大模型现阶段强制改进标准
事实来源逐条对应传感器与特工记录统计概率补全断裂信息强制保留不可篡改的单字信源回溯
输出表征格式参差,容易暴露信源矛盾格式高度标准化,文辞完全合规标出各段落推理置信度区间
审核员心智挑剔行文逻辑与证据链条容易被完美的格式代偿事实核查审查重点从文字润色转向原始凭证比对
致命盲区效率低下,积压海量原始数据将臆测包装成既成事实公文工具只能提供检索,禁止自行推断结论

当机器生成的内容在排版、用词、文书结构上完全挑不出毛病时,人工审核就从实质性的交叉比对,退化成了形式上的盖章放行。

一线参谋与采办部门的现实两难

这起险情最直接的影响落在了两类人身上。

首先是战区一线的初级分析人员。面对每天数十万条的碎片情报,在不借助自动化工具的前提下,人类无法在战术窗口期内完成综合简报。然而一旦工具生成虚假结论,承担军事法庭问责的只能是签字确认的人类军官。这种责任与工具效率之间的错位,正在迫使基层参谋对外部采购的智能化套件产生信任危机。

其次是负责防务软件采办的评估官员。五角大楼此前推崇的将商业通用基础模型快速搬上战场的策略,眼下遭遇了实质性阻碍。接下来,缺乏确定性溯源能力、无法做到段落与底层原始数据硬对齐的产品,将很难拿到涉密网络的部署许可。各防务承包商靠通用底座套壳赚取高额预算的窗口期正在关闭,取而代之的是更加严苛、更偏保守的检索增强验证工具。