让大模型规划一条从家门口出发的 5 公里跑步环线,需要多久?

答案是 27 分钟。2026 年 9 月 12 日,知名开发者 Simon Willison 在基于 GPT-6 Astra (Max) 的 ChatGPT Work 里输入了自己的家庭住址,要求调用 OpenStreetMap(OSM)数据生成 5 公里和 10 公里的环形路线。半小时后,系统确实交付了一份完备的交互式地图网页,连同可导入运动手表的 GPX 和 GeoJSON 格式文件,甚至算准了一条 5.1 公里的海港环线。然而,伴随这份完整交付物而来的,是一个完全封死的代码执行黑盒,以及令人咋舌的工程成本。

Astra 自主组装的 GIS 数据处理管线 自然语言指令 住址与距离约束 Nominatim 地理编码坐标解析 Overpass API 提取路网几何数据 本地拓扑计算 代码与逻辑完全隐藏 综合交付物 HTML / GPX 文件

幕后链路:大模型不是在导航,而是在写代码

很多人以为模型能直接理解地球上的经纬度,事实并非如此。大语言模型本身不具备空间坐标的几何感知能力,Astra 能够跑通这一流程,依靠的是外部工具编排。

手表端接收到完整闭环轨迹,背后却是耗时半小时的脚本运算
手表端接收到完整闭环轨迹,背后却是耗时半小时的脚本运算

面对用户的自然语言,Astra 自行拆解并拼装了一条完整的地理信息(GIS)处理管线。它先调用 Nominatim 将门牌地址解析为经纬度,再通过 Overpass API 批量拉取周边的道路与步道矢量切片,接着在后台环境编写算法,寻找符合距离要求的闭环路径,最后调用可视化工具生成静态文件。

这一连串动作展现了长程 Agent 的自主工具调用水平。但关键在于,Nominatim 仅负责地名索引,Overpass 仅负责几何数据筛选,两者都不自带寻路引擎。要计算一条真实可通行的路线,必须依赖图拓扑遍历,并精确识别步道通行属性。

传统确定性路由引擎处理这种运算只需数毫秒,Astra 却在后台足足折腾了 27 分钟。

消失的代码:当交付物蜕变为审查黑盒

让 Willison 感到失望并直斥为反特性的,是 OpenAI 的界面呈现策略。在整个长程计算过程中,系统调用的脚本、执行的筛选规则、重试时的错误信息,对用户均处于不可见状态

不可审计的黑盒规划,随时可能把跑者引向封闭的私有领地
不可审计的黑盒规划,随时可能把跑者引向封闭的私有领地

OpenAI 在 2026 年 9 月 3 日发布 GPT-6 Astra,带来高达 1,050,000 tokens 上下文窗口与 128,000 tokens 最大输出,并按 low 到 max 划分五档推理深度。与之一同确立的,是 ChatGPT 分裂为日常对话、多步骤专业制作以及编程三大独立模式。Work 模式的产品逻辑倾向于淡化执行细节,直接呈现结果看板。

黑盒抹去了运算的中间态,也一并切断了开发者最基本的信任链条。

对于图表生成或文案排版,只看成品无可厚非。但涉及物理世界的路线时,隐藏代码直接摧毁了安全审计的可能。用户无法查验模型是否正确过滤了私有道路,无法确认它是否绕开了高等级公路,甚至不知道它在后台遭遇了多少次异常重试。

GPT-6 Astra 路线生成的工程量级 27 分钟 长程任务后台耗时 105 万 上下文容量 (tokens) $50 每百万输出 token 成本 0 行 前端可见执行代码

算力错配与致命三元组:长程 Agent 的现实边界

在 API 定价达到输入每百万 token 10 美元、输出每百万 token 50 美元的前提下,调用超大模型反复试错抓取地理数据,是一笔极不划算的账。开发者社区近期针对 Astra 的反馈,集中在其运行缓慢、过量消耗 token、极易发散以及过度自我测试,在部分任务依从稳定性上甚至被评价不及 GPT-5.6 Sol。

一条 5 公里跑步路线,换来的是长达 27 分钟与极不成比例的算力账单(示意图)
一条 5 公里跑步路线,换来的是长达 27 分钟与极不成比例的算力账单(示意图)

横向对照当前的主流模型生态,各家的产品哲学正在显现分歧:

方案 / 模型核心实现路径响应效率可解释性与代码可见度
GPT-6 Astra (Work)动态编写脚本拼接开源 GIS 管线数十分钟级(长程试错)低(前端隐藏执行源码)
Google Gemini 3原生调用 Google Maps 导航与路况秒级直接返回中(依附成熟商业地图体系)
Claude Opus 4.6百万上下文驱动代码库与文档生成分钟级推理高(倾向输出过程与代码)
传统确定性引擎OSRM / GraphHopper 拓扑图算法毫秒级计算极高(开源规则与算法透明)

这里暴露出更深层的结构性隐患。Willison 此前提出过致命三元组的安全模型:当一个系统同时接入私有敏感数据外部不可信输入以及外向通信渠道时,安全防线将极其脆弱。

在这次测试中,用户的精确家庭住址被直接提交至云端,Agent 自行联网访问外部开源接口下载数据,并在沙盒内执行动态代码。尽管 Work 支持本地文件与桌面交互,其上下文仍会存储在远端服务器。一旦外部数据中混入恶意的间接提示注入指令,或者 Agent 将未脱敏的位置特征向外发送,风险就会直接渗透进现实物理空间。

  • 风险.大模型画出的几何闭环,不等于物理世界的合法路权;缺乏标签审查的黑盒规划,随时可能把跑者引向无步道公路或封闭私有领地。

天下难事必作于易,天下大事必作于细。用前沿模型扮演数据工程师,去端到端解决一件传统 GIS 引擎早已吃透的琐事,看似是通用能力的秀技,实则是工程资源的错位。

当新鲜感退潮,用户终究要在 27 分钟的漫长等待、昂贵的算力账单以及不可见的代码黑盒面前,重新校准对长程 Agent 的真实预期。