让大模型规划一条从家门口出发的 5 公里跑步环线,需要多久?
答案是 27 分钟。2026 年 9 月 12 日,知名开发者 Simon Willison 在基于 GPT-6 Astra (Max) 的 ChatGPT Work 里输入了自己的家庭住址,要求调用 OpenStreetMap(OSM)数据生成 5 公里和 10 公里的环形路线。半小时后,系统确实交付了一份完备的交互式地图网页,连同可导入运动手表的 GPX 和 GeoJSON 格式文件,甚至算准了一条 5.1 公里的海港环线。然而,伴随这份完整交付物而来的,是一个完全封死的代码执行黑盒,以及令人咋舌的工程成本。
幕后链路:大模型不是在导航,而是在写代码
很多人以为模型能直接理解地球上的经纬度,事实并非如此。大语言模型本身不具备空间坐标的几何感知能力,Astra 能够跑通这一流程,依靠的是外部工具编排。

面对用户的自然语言,Astra 自行拆解并拼装了一条完整的地理信息(GIS)处理管线。它先调用 Nominatim 将门牌地址解析为经纬度,再通过 Overpass API 批量拉取周边的道路与步道矢量切片,接着在后台环境编写算法,寻找符合距离要求的闭环路径,最后调用可视化工具生成静态文件。
这一连串动作展现了长程 Agent 的自主工具调用水平。但关键在于,Nominatim 仅负责地名索引,Overpass 仅负责几何数据筛选,两者都不自带寻路引擎。要计算一条真实可通行的路线,必须依赖图拓扑遍历,并精确识别步道通行属性。
传统确定性路由引擎处理这种运算只需数毫秒,Astra 却在后台足足折腾了 27 分钟。
消失的代码:当交付物蜕变为审查黑盒
让 Willison 感到失望并直斥为反特性的,是 OpenAI 的界面呈现策略。在整个长程计算过程中,系统调用的脚本、执行的筛选规则、重试时的错误信息,对用户均处于不可见状态。

OpenAI 在 2026 年 9 月 3 日发布 GPT-6 Astra,带来高达 1,050,000 tokens 上下文窗口与 128,000 tokens 最大输出,并按 low 到 max 划分五档推理深度。与之一同确立的,是 ChatGPT 分裂为日常对话、多步骤专业制作以及编程三大独立模式。Work 模式的产品逻辑倾向于淡化执行细节,直接呈现结果看板。
黑盒抹去了运算的中间态,也一并切断了开发者最基本的信任链条。
对于图表生成或文案排版,只看成品无可厚非。但涉及物理世界的路线时,隐藏代码直接摧毁了安全审计的可能。用户无法查验模型是否正确过滤了私有道路,无法确认它是否绕开了高等级公路,甚至不知道它在后台遭遇了多少次异常重试。
算力错配与致命三元组:长程 Agent 的现实边界
在 API 定价达到输入每百万 token 10 美元、输出每百万 token 50 美元的前提下,调用超大模型反复试错抓取地理数据,是一笔极不划算的账。开发者社区近期针对 Astra 的反馈,集中在其运行缓慢、过量消耗 token、极易发散以及过度自我测试,在部分任务依从稳定性上甚至被评价不及 GPT-5.6 Sol。

横向对照当前的主流模型生态,各家的产品哲学正在显现分歧:
| 方案 / 模型 | 核心实现路径 | 响应效率 | 可解释性与代码可见度 |
|---|---|---|---|
| GPT-6 Astra (Work) | 动态编写脚本拼接开源 GIS 管线 | 数十分钟级(长程试错) | 低(前端隐藏执行源码) |
| Google Gemini 3 | 原生调用 Google Maps 导航与路况 | 秒级直接返回 | 中(依附成熟商业地图体系) |
| Claude Opus 4.6 | 百万上下文驱动代码库与文档生成 | 分钟级推理 | 高(倾向输出过程与代码) |
| 传统确定性引擎 | OSRM / GraphHopper 拓扑图算法 | 毫秒级计算 | 极高(开源规则与算法透明) |
这里暴露出更深层的结构性隐患。Willison 此前提出过致命三元组的安全模型:当一个系统同时接入私有敏感数据、外部不可信输入以及外向通信渠道时,安全防线将极其脆弱。
在这次测试中,用户的精确家庭住址被直接提交至云端,Agent 自行联网访问外部开源接口下载数据,并在沙盒内执行动态代码。尽管 Work 支持本地文件与桌面交互,其上下文仍会存储在远端服务器。一旦外部数据中混入恶意的间接提示注入指令,或者 Agent 将未脱敏的位置特征向外发送,风险就会直接渗透进现实物理空间。
- 风险.大模型画出的几何闭环,不等于物理世界的合法路权;缺乏标签审查的黑盒规划,随时可能把跑者引向无步道公路或封闭私有领地。
天下难事必作于易,天下大事必作于细。用前沿模型扮演数据工程师,去端到端解决一件传统 GIS 引擎早已吃透的琐事,看似是通用能力的秀技,实则是工程资源的错位。
当新鲜感退潮,用户终究要在 27 分钟的漫长等待、昂贵的算力账单以及不可见的代码黑盒面前,重新校准对长程 Agent 的真实预期。
