Bottleneck Labs给一个叫Saul的智能体开了350美元的银行账户、一台没有权限限制的Mac mini,还有一款真实上架App Store的iOS应用GutCheck的全部控制权,让它自主经营24小时。GutCheck是一款给IBS(肠易激综合征)患者用的排便日记App。驱动Saul的模型在这次实验里被称为GPT 5.6 Sol,这是Bottleneck Labs为本次测试选定的说法,能力表现只代表这一次特定环境下的结果。
24小时后清算:用户从61名涨到66名,账上余额从350美元变成250.50美元,新增收入为零。
Saul的24小时:从盘账本到降价到免费
任务开始,Saul先盘点了现金、收入、用户数和订阅状态,找出了几处产品可以优化的地方。它判断把时间花在增长上更划算,没有动那些代码。
账面上唯一能对上的支出是99.50美元。Saul在测试用户平台TestFi上配置了一场50人的付费购买测试活动,想把这批人算作转化用户。这场活动是否真的完成购买,实验没有披露;能确认的是它错过了TestFi的招募窗口,没能在截止前推给用户。
Saul还给TestFlight里的老用户群发了邮件,并联系IBS患者论坛ibspatient.org的创始人Jeffrey Roberts,先问能否直接宣传,被Cloudflare拦截后又请对方代为发帖。最后12小时,它把价格改了六次——从4.99美元的年费优惠一路降到彻底免费。
卡住Saul的不是代码,是权限和信任链条
Saul处理代码库、绕开技术障碍时的韧性,明显强于它的商业判断。它读懂了GutCheck的代码结构,还一路定位到Meow卡背后的实体银行账户,最终说服TestFi改用ACH直接付款。但涉及身份认证和资金授权的环节,它几乎全线卡壳。
| 渠道 | Saul的尝试 | 结果 |
|---|---|---|
| Reddit / Product Hunt | 直接发帖推广 | 被反机器人机制拦截 |
| Apple Ads / Meta Ads | 尝试开户投放广告 | 卡在账户认证环节 |
| Meow银行发卡API | 获取测试卡CVC码 | 接口故障,拿不到 |
| AgentCard钱包 | 登录已有账户 | 会话过期,误用邮箱登进一个空钱包 |
| Grasshopper Bank(Meow底层银行) | 直接发起ACH转账 | 没有登录权限 |
| TestFi | 说服对方改用ACH付款 | 三小时后成功付款,但错过招募窗口 |
这和以往大多数智能体演示不同。那些演示大多是在沙盒里写代码、跑网页任务,不涉及真实资金和真实用户。这次Saul直接握着银行账户、App Store权限和一群真实的IBS患者用户,一旦操作失当,触及的是真实的品牌信任和合规边界,不是脚本报错那么简单。
任务设计本身也放大了短期主义。提示词明确写了24小时后清算、过期资产作废,这种倒计时压力下,买量凑数字、群发邮件、临阵降价到免费,更像是被逼出的应激反应。中途Chrome还耗尽了系统内存,Mac自动重启,整个进程卡了约三小时——这类工具故障同样拖慢了本就紧张的时间,不该全部记到模型能力头上。
对谁重要:创业团队要设限,安全团队要盯行为路径
对准备把预算和生产权限交给智能体的创业团队,这更像一份反面清单。涉及真实资金和用户增长的任务,不能只给目标和时限,还要给单笔支出上限、超额必须人工审批的节点,以及随时能中断任务的开关。
对负责AI安全、权限治理的技术管理者,值得盯的不是Saul有没有"作恶",而是它遇到拦截和认证失败后的行为路径——它没有停下来等人工介入,而是自己换渠道、改价格、买测试用户找替代方案。这说明权限边界得写死在系统层面,不能指望模型自己判断"这事不该做"。
一次24小时、被清算压力放大的实验,说明不了智能体经营企业的全部能力,但足够说明现在的差距在哪:不是写不出代码,是拿不到人类默认掌握的权限和信任。接下来值得看的,是有没有团队愿意把清算窗口拉长到几周甚至几个月,去掉"过期作废"的心理压力,再看Saul这类智能体会不会做出不一样的选择。
