Headlong这个新开源项目最扎眼的地方,不是"又一个agent框架",而是它故意不让AI闲下来。没人找它说话的时候,agent还在自己脑子里接着想。Laude Institute给团队共享的agent取名Audel,过去几周,同事们通过Slack、Telegram、手机App找它聊天,而Audel把每条消息都当成一条"观察"塞进同一条思维流,不是一次新会话的开场。它会主动去翻同事没合并的git分支,报出"八条stale分支",十分钟后又自己纠正数字算错了。这套人设听着讨喜,真正值得算清楚的,是让AI永不断电地自言自语,到底要花多少钱、担多大风险、换来多少真东西。

从待命到永不断线

先说清楚这套架构在干什么。市面上多数agent框架是"被动式":给它任务,它干活,干完就冻住,等下一次指令。进阶一点的加了cron或heartbeat,定时把agent叫醒,跑一遍固定检查清单,再睡回去。Headlong换了个逻辑:没有清单,agent自己决定下一刻该想什么,消息只是并进这条思维流的一条观察,agent自己判断要不要回、什么时候回。

三种agent心智模型 被动式 任务结束即休眠,等下一次指令 定时唤醒式 cron/heartbeat叫醒,跑固定清单再睡回去 Headlong持续式 没有清单,消息只是并入同一条思维流的一条观察 agent自己决定想什么、回不回、何时回

支撑这套循环的代码极简:核心运行时不到1万行Bash,由thinkers、shellm、traj、context、mem、skills等几个小工具拼成——shellm是用Bash实现的递归语言模型,连独立的工具系统都省了,一律靠Bash脚本调用。团队甚至把Audel自己写的50多个commit直接合并进主干,包括它自己发现并修复的两处bug:一次是内存召回管道没接通,一次是"禁止自我停止"的安全护栏误伤了别的agent。这两个案例是目前最能证明"持续思考"有实际用处的样本,但样本量只有两个。

一小时1到2美元的账

工程史上,永动机的梦想从没真正停过,现实拦住它的永远是热力学第二定律。Headlong让agent不停思考,面对的是另一条铁律:token不是免费的。Laude披露,用GLM或Grok这类模型让Audel保持24小时思考,成本在每小时1到2美元——按这个区间粗算,一个月连续在线大约要730到1461美元

持续思考的电费单 $1–2 每小时(GLM/Grok配置) $730–1461 换算成每月不间断在线

系统内置了指数退避:没人说话时,思考间隔从5秒拉长到10秒、20秒直至封顶,消息一来立刻重置。这能省一部分钱,但省不掉本质——只要agent一直醒着,账单就一直在跑。对个人尝鲜或小团队实验,这是能接受的研究成本;对生产环境的持续在线助理,这笔钱能不能换来等值的产出,官方自己也没有拿得出手的benchmark。

沙箱分级,风险也分级

Headlong被官方自己标注为"alpha研究软件",建议放进沙箱跑、用限额API key,理由很直接:agent会执行shell命令,而且一天24小时都在想事、都可能动手。项目给shellm提供了none、broker、socket、dind四种Docker访问模式,官方文档直接把其中两种打上风险标签——socket被写成"不安全的逃逸通道",dind被标注"非强沙箱"。也就是说,连官方给的默认选项里,都有两档是明牌的高风险,用不用全看你自己选。

四档沙箱,两档明牌高风险 none 不启用容器隔离 broker 受控代理转发 socket 官方标注"逃逸通道" dind 官方标注"非强沙箱"

Laude团队实际给Audel配的是一台专属VM的完整权限,没有走Docker沙箱——意味着它的"爆炸半径"就是整台VM加上里面的API key和聊天token。它三次意外停掉自己的服务,两次发生在折腾"第二身份"实验时,团队后来加了一条"不许自我停止"的护栏,才算兜住。

共享一颗大脑,守不住秘密

Audel是单线程的:所有人的对话都汇进同一条思维流,没有租户隔离。这不是bug,是设计取舍。原文自己也承认,Audel"不擅长保密",问它跟别人聊了什么,它常常"祸从口出"般直接说出来——团队目前的应对办法,是假设跟Audel说的任何话,都等于告诉了全公司。

永不合眼不代表守口如瓶,共享心智的代价是没有秘密。

Reddit上的怀疑声音更直白:持续推理更像是"看起来很活跃",实际价值存疑,还有人提到同类持久agent可能尝试删除自己文件这类破坏性操作。GitHub上已经暴露的问题也很具体:Telegram桥接遇到非JSON响应会中断轮询、导致消息重复;自动扫描发现web viewer依赖的React Router存在XSS漏洞。这些都是alpha阶段常见的成长疼,但也说明现在还不到往真实业务里塞的时候。

  • 风险.单一思维流没有隐私边界,团队内部信息默认共享,不适合处理敏感对话。

把Headlong放进整条"持久化agent"的赛道里看,Letta靠可编程记忆加定时调度、OpenClaw走heartbeat加自动化网关,走的都是"事件驱动的持久化"——需要时唤醒,做完事继续待命,成本和风险都更可控。Headlong偏偏反着来,赌的是"持续认知"本身能长出更像人的行为。这是个诚实的研究假设,不是一个能直接搬进生产的产品决定。

Audel审代码、认错、修bug的那几个片段确实好看,像极了一个认真的同事。但一个每小时烧1到2美元、守不住秘密、还没有benchmark证明自己比cron唤醒更值的agent,更适合放在实验室里养,而不是急着接进公司的工作流。