美军内部近期复盘了一起由大语言模型幻觉引发的情报险情。某战区情报评估流程中,分析人员使用商业模型汇总多源碎片信息,系统凭空捏造了一份带有完整密级标注与虚构信源代码的敌情动态,并险些作为战备行动依据送达指挥链路。
这件事暴露的技术短板远非算法精度不足那么简单。防务领域引入生成式系统,最大的风险从来不是机器吐出乱码,而是算法用严丝合缝的公文规范将虚假信息洗版为权威文本,彻底击穿了参谋体系既有的核验防线。
虚构简报如何渗入作战链路
根据美军内部调查梳理的细节,涉事单位当时面对海量的开源数据、无线电监测记录与无人机图传文字摘要。值班人员为了在规定时限内交付态势报告,调用了处于测试阶段的分析辅助模型。
模型在输入信源存在断点的情况下,自行补全了虚构的对手部队集结时间和调动代码。这套生成结果完全契合五角大楼标准情报公文的行文习惯,术语准确,信源编号看似严谨,初审人员甚至未能察觉任何破绽。
直到战区联合参谋层面对照原始侦察数据库进行信源回溯时,才发现核心判断对应的原始记录根本不存在。整份研判随即被紧急撤回,指挥层随后叫停了该辅助工具直接接入涉密简报系统的权限。
格式严谨正在瘫痪人类审核
机器生成物最狡猾的地方,在于它用规范的语言结构消解了人类的警惕心理。
历史上有过多次自动化系统引发的军事警报。冷战时期的早期预警雷达曾把阳光反射误认为发射轨迹,但当时的军官能够根据常理识别出传感器异常并按下暂停键。如今的生成式AI走向了反面,它交付给人类的不是异常信号,而是一份比初级参谋写得还要标准的合成公文。
| 评估维度 | 传统人工情报流转 | 引入未经校准的大模型 | 现阶段强制改进标准 |
|---|---|---|---|
| 事实来源 | 逐条对应传感器与特工记录 | 统计概率补全断裂信息 | 强制保留不可篡改的单字信源回溯 |
| 输出表征 | 格式参差,容易暴露信源矛盾 | 格式高度标准化,文辞完全合规 | 标出各段落推理置信度区间 |
| 审核员心智 | 挑剔行文逻辑与证据链条 | 容易被完美的格式代偿事实核查 | 审查重点从文字润色转向原始凭证比对 |
| 致命盲区 | 效率低下,积压海量原始数据 | 将臆测包装成既成事实公文 | 工具只能提供检索,禁止自行推断结论 |
当机器生成的内容在排版、用词、文书结构上完全挑不出毛病时,人工审核就从实质性的交叉比对,退化成了形式上的盖章放行。
一线参谋与采办部门的现实两难
这起险情最直接的影响落在了两类人身上。
首先是战区一线的初级分析人员。面对每天数十万条的碎片情报,在不借助自动化工具的前提下,人类无法在战术窗口期内完成综合简报。然而一旦工具生成虚假结论,承担军事法庭问责的只能是签字确认的人类军官。这种责任与工具效率之间的错位,正在迫使基层参谋对外部采购的智能化套件产生信任危机。
其次是负责防务软件采办的评估官员。五角大楼此前推崇的将商业通用基础模型快速搬上战场的策略,眼下遭遇了实质性阻碍。接下来,缺乏确定性溯源能力、无法做到段落与底层原始数据硬对齐的产品,将很难拿到涉密网络的部署许可。各防务承包商靠通用底座套壳赚取高额预算的窗口期正在关闭,取而代之的是更加严苛、更偏保守的检索增强验证工具。
