一块标价 27 美元的智能手表,成了测试 AI 编程能力的实验场。项目作者围绕 PineTime,让模型参与设备上的功能开发;表面上主角是 Claude,实际过程却牵涉到不同模型、硬件调试和反复人工修正。

这件事的价值不在于证明某个模型“会写嵌入式代码”。它更接近一次成本核算:模型能快速产出代码,但在屏幕刷新、数据传输、资源占用和真实设备反馈之间,仍然需要人来把错误逐个找出来。

Claude 的名字很醒目,真正决定结果的是整条开发链

PineTime 这类设备的限制很具体。它的处理器、内存、屏幕刷新能力都远不如手机或电脑,代码通过传输工具写入设备后,反馈也不会像网页开发那样即时。模型给出的程序即便语法正确,也可能在真机上出现卡顿、显示异常、连接失败或耗电过快。

项目被描述为“用 Claude 在 27 美元智能手表上开发”,并不等于所有代码都由 Claude 独立完成。现有线索没有交代完整的模型版本、API 调用记录、提示词、代码仓库和测试环境,也不足以确认 Kimi、DeepSeek 分别承担了哪些任务。

这一区别很重要。AI 编程项目里常见的“模型归因”,容易把对话入口、代码生成、错误修复和最终测试混成一件事。读者看到的可能是 Claude 的界面,真正执行代码的却是另一套模型或人工修改。没有调用日志和提交记录,就不能把成果准确归给某一个模型。

环节云端软件项目PineTime 这类嵌入式项目
反馈速度浏览器或测试环境通常很快返回结果需要烧录、传输,再观察真机表现
主要问题接口、业务逻辑、依赖冲突内存、刷新率、驱动、功耗和连接稳定性
模型出错后的代价多数能在开发环境中回滚可能要重新写入设备,甚至排查硬件状态
人工工作的重点审查代码和测试结果解释真机现象、定位边界条件、反复验证

“工欲善其事,必先利其器。”在这里,工具不只是模型,也包括调试器、刷写工具、串口日志和一块随时可以重置的开发板。模型越便宜,开发者往往越需要自己补齐这套工具链。

低价模型能推进原型,却没有消除调试账单

这类项目最容易被忽略的成本,是人工纠错。

便宜模型可以快速生成界面代码、调用示例和基础逻辑。遇到错误时,它也能继续提出修复方案。但它看不到手表屏幕上的实际残影,不一定能判断刷新延迟来自驱动、传输过程还是代码结构,更不能替开发者决定某个功能是否值得牺牲电量和响应速度。

Claude、Kimi、DeepSeek之间当然存在能力、价格、上下文长度和调用方式的差异,但单凭这一个项目,无法得出“谁在嵌入式开发中全面胜出”的结论。更现实的比较方式,是看模型在整条链路上的表现:

  • 能否理解设备 SDK 和具体芯片,而不只是生成通用代码;
  • 能否根据串口日志、编译报错和真机现象持续修正;
  • 能否减少人工往返,而不是每次换一种猜测;
  • 能否在有限上下文里记住此前已经验证过的约束。

这也解释了为什么“低价模型能写出代码”不等于“低成本完成项目”。如果一个模型每次修复都需要开发者重新描述硬件现象,节省下来的 API 费用,很可能会转化为调试时间。

对个人开发者而言,这种模式仍然有吸引力。手表本身只要几十美元级别,失败一次的物料损失有限,模型可以承担大量试错。适合拿来做界面原型、传感器读取和简单交互,不适合直接把未经验证的代码放进需要长期运行的产品。

对物联网团队,判断标准会更苛刻。团队要算的不是一次生成用了多少钱,而是:

  • 谁负责复核模型生成的驱动和电源管理代码;
  • 真机测试需要多少轮;
  • 模型更换后,现有提示词、日志格式和工具链能否继续使用;
  • 设备出问题时,是否还能追溯具体代码和模型版本。

一块 27 美元的手表,可能只代表硬件采购价。它没有包含开发电脑、调试工具、云端模型调用、人工测试和返工时间。把这些成本删掉,才会得到一个看起来很漂亮的“低成本开发”故事。

这类实验下一步要看什么

最值得观察的不是项目能否完成一次演示,而是它能否被别人稳定复现。至少需要公开以下信息:

  • PineTime 使用的固件、SDK 和模型版本;
  • Kimi、DeepSeek 或 Claude 的具体调用路径;
  • 生成代码与人工修改之间的边界;
  • 刷写、传输和屏幕刷新延迟的测量方法;
  • 连续运行时的功耗、崩溃和连接稳定性。

缺少这些记录,项目仍然有启发性,却更像一次开发现场展示,不能直接当成模型能力评测。

对准备尝试的开发者,最现实的做法是把模型放在“加速原型”的位置:让它生成样板代码、解释报错、整理日志,再由人完成硬件验证。等到项目涉及电池寿命、蓝牙连接、批量生产或安全更新,模型的低价就不应成为主要决策依据。

这件事真正说明的,是 AI 编程的竞争已经从“谁能生成一段代码”,转向“谁能少让人返工一次”。在资源紧张的嵌入式设备上,这个差别会被放大。谁能把真机反馈接入开发流程,谁才更接近可用的编程代理;只会在聊天窗口里给出答案,距离交付还隔着一张调试桌。