开源开发者 transitive-bullshit 最近在 Hacker News 上发布了一个免注册、完全免费且结果默认私密的 Web 工具:Doom or Bloom。用户只需回答几个问题,系统就会在二维坐标系上标出你的 AI 世界观位置,并顺手将你与 Eliezer Yudkowsky、Geoffrey Hinton、Dario Amodei、Ilya Sutskever 等 28 位知名技术人物摆在同一张图谱里。乍看之下,这像是一个蹭行业热度的政治罗盘游戏,但拆开代码会发现,它试图用工程手段去拆解当下 AI 社区最令人疲惫的二元对立。
双层解耦的工程内核:当大模型只负责听,代码负责算
很多打着 AI 旗号的性格测试,本质上只是把整段对话扔给模型,再让模型随意生成一个带有幻觉的评分。Doom or Bloom 的实现方式截然不同,它在架构上对模型解释与业务逻辑做了显式分层。
系统由大语言模型专门处理结构化语义抽取,而状态流转、停止条件判定、路由规则以及坐标落点,全部由底层的 TypeScript 代码显式运行。访谈启动后,程序会动态评估当前推断的不确定性与证据缺失程度,针对性抛出追问。整个过程通常只需要 3 到 5 个问题就能收敛并得出结论;如果受访者在一开始就给出了因果逻辑完整的长回答,系统甚至会提前终止访谈。
最终呈现的可视化界面由两条核心轴组成:横轴是预期影响(Doom 到 Bloom),纵轴是变革规模(渐进改良到文明重构)。尤为克制的是,系统并非给出绝对的点坐标,而是用一层阴影椭圆来标明解释中的不确定性范围。这种设计承认了认知的模糊空间,避免了传统量表那种机械打分的生硬感。
8 个维度背后的认知落差:单一数字包裹不住的技术现实
很长一段时间里,技术圈讨论安全与发展都习惯退化成站队游戏。人们反复逼问同行一个粗糙的指标:你的末日概率 p(doom) 到底是多少。这种提问方式省事,却把所有复杂的因果假设全部压扁了。
Doom or Bloom 在底层其实建模了 8 个核心维度:能力演进、转变速度、收益预期、潜在危害、技术可控性、制度有效性、人类主体性以及政策行动倾向。与此同时,系统还会同步衡量受访者的因果清晰度与修正意愿。
极端的两极对立往往源于提问方式的贫瘪,而非信念本身的不可调和。
真实的认知谱系从来不是一条简单的悲喜分界线。一个研究者完全可以相信 AI 能带来前所未有的物质繁荣,同时清醒地认为系统失控的几率高得吓人。这种复合立场如果塞进一维问卷,只会被粗暴地贴上摇摆标签。
这种复杂性在权威调查中早有印证。AI Impacts 曾对 2,778 名 AI 研究员进行过一次大规模调查,受访者对于 AI 导致人类灭绝或永久失权的概率预估,中位数为 5%(平均值为 16.2%);而对无法控制高级 AI 导致严重灾难的预估,中位数为 10%(平均值为 19.4%)。这些数据表明,即使身处一线的专家,主流心态也既非狂热的盲目乐观,亦非绝望的投降主义,而是一种伴随高度戒备的推进状态。
- 结论.将复杂的信念拆解为机制、机构和危害等具体维度,能让人看清分歧究竟发生在哪个关节,而不是单纯互扣帽子。
镜像测试还是科学预测:缺乏时间锚点的预言困境
虽然 Doom or Bloom 在交互与代码设计上表现老练,但我们依然需要看清它的边界。
项目预设的 28 位公众人物画像,完全是基于公开言论由模型模拟生成的,作者在代码库中明确声明它们仅作为回归测试用例,并不代表当事人的真实作答或本人背书。目前该项目的 GitHub 仓库状态相当冷静,保留着 0 个 issue 与 0 个 pull request,甚至没有开放 Discussions 讨论区。它更像开发者交付的一个自洽作品,而非一个开放协作的公共标准。
从预测科学的角度审视,这类工具存在一个根本硬伤,那就是虚假精度与时间维度的缺失。Metaculus 或预测研究机构(FRI)之所以能校验预判,是因为科学预测必须绑定明确的清算时点。如果在问题中拿掉了具体的时间窗口,末日还是繁荣的讨论就会沦为空对空的哲学思辨。在十年尺度上判断技术会带来失业,与在一个世纪的跨度上讨论人类文明的形态重塑,面对的根本不是同一种物理约束。
- 提醒.定性语言一旦转化为坐标轴上的具体数值,极容易带来虚假的科学精确感,切不可把信念镜像误当作因果预测。
荀子曾言,凡人之患,蔽于一曲,而暗于大理。Doom or Bloom 的价值不是充当预言家,而是作为一面元认知的镜子。它把原本在社交网络上被撕裂的情绪表达,重新拉回到结构化的自省逻辑中。测出自己落在哪一个象限并不关键,能在几轮自适应追问中察觉自己未曾深思的前提假设,才算没有白花这几分钟时间。
