会议记录赛道正在经历一场隐秘的叙事崩塌。过去一年里,以 Granola 为代表的桌面客户端靠着无 Bot 录音体验迅速蹿红,让用户以为自己终于摆脱了那个突兀挤进会议室的转录机器人。然而,免去显性机器人并不等于数据真正留在了你的电脑里。Google 最近低调释出的 Google AI Edge Foresight,直接把一把尺子插进了这个行业:它完全运行在 Apple Silicon 芯片上,无需连网,不收订阅费,在设备本地跑通了从多模态检索到问答生成的整套会议纪要工作流。

撕破「免 Bot」的隐私遮羞布

许多人把免 Bot 录音与本地隐私画上了等号,这其实是软件厂商精心维持的认知落差。

完全断网运行的端侧录音对抗云端高额账单
完全断网运行的端侧录音对抗云端高额账单

无论 Granola、刚被 Superhuman 收购的 Fathom,还是从语音输入切入会议纪要的 Wispr Flow,它们在产品界面上虽然隐去了机器人头像,背后的音频流与文本转录依然被源源不断地推送到云端服务商。Granola 的音频处理依赖 AWS 以及 Deepgram、Assembly 等第三方接口,其免费个人版仅保留 30 天记录,商业版收费 $14/人/月,企业版高达 $35/人/月,而且在服务条款中默认允许使用用户的匿名数据训练模型,除非用户手动申请 opt-out。

Wispr Flow 的做法如出一辙,其语音识别强制走云端通道,Pro 方案每月需 $15,若想解除会议记录限制,必须购买每月 $23 至 $33 的 Growth 方案。即便是日程管理工具 Calendly 刚推出的 Notetaker,也是借助 Recall.ai 录音并调用 OpenAI 接口在云端跑摘要,哪怕用户已经付费购买了每月 $10 的 Standard 或 $16 的 Teams 方案,依然无法使用该功能,必须进一步掏钱升级到 Plus 方案。

会议 AI 路线对照:云端包装层 vs 端侧物理隔离 主流 SaaS 方案(Granola / Wispr) 录音形态:本地无 Bot 抓取系统音频 数据流向:强制上传 AWS / 第三方 API 训练条款:默认抓取匿名数据训练模型 付费门槛:每人每月 $14 至 $35 持续租税 本质:以桌面外壳包装的云端租用服务 Google AI Edge Foresight 录音形态:专为 Apple Silicon 本地优化 数据流向:零网络外传,纯本地物理隔离 训练条款:数据纯本地留存,无回传训练 付费门槛:完全免费,无订阅机制 本质:利用本地硬件算力的闭环生产力实验

相比之下,Google AI Edge Foresight 走向了另一个极端。它没有任何订阅费用,转录、索引和生成交互完全被锁在 Mac 的内存与神经引擎内部。对于律师、财务顾问或医疗从业者等对数据合规极度苛刻的人群来说,这种物理层面的断网运行,提供了云端 SaaS 很难给出的确定性。

740M 参数跑通的端侧 RAG

能在没有网络的环境下做会议记录,核心在于 Google 把轻量模型塞进了 Mac 本地。

740M轻量多模态模型在本地芯片闭环运行检索(剖面示意)
740M轻量多模态模型在本地芯片闭环运行检索(剖面示意)

Foresight 延续了 Google 团队在 2026 年 4 月推出的 iOS 离线听写工具的技术路线,并将其拓展为一个本地多模态 RAG 系统。它在底层部署了一个参数量仅为 740M 的端侧多模态嵌入模型 EmbeddingGemma 2,上下文窗口支持最高 8,192 token。

这个小体积模型的跨模态检索指标表现得相当紧凑:在多语言 MTEB 测试中达到 61.36,代码检索 MTEB Code 为 78.68,音频检索 69.54,视频检索则达到 50.67。

Foresight 端侧闭环检索与生成流程 多源输入 实时会议音频 本地 PDF / Docs Markdown 文档 EmbeddingGemma 2 参数规模:740M 上下文:8,192 Token 跨模态向量切片映射 本地 Gemma 4 端侧神经引擎驱动 实时语义比对问答 分屏速记协同渲染 物理隔离 零网络依赖 无云端开销 即时私密交付

在实际界面中,Foresight 采用了类似 Granola 的分屏结构:左侧是人工速记便签,右侧由本地 Gemma 4 实时转录并生成摘要。用户可以直接导入 PDF、Google Docs、Microsoft Office 格式以及 Markdown 笔记,在本地建立起一个微型知识库。

当开会提到历史文档中的某项条款时,本地模型在不联网的情况下便能瞬间关联出对应内容并完成答疑。


免费玩具还是 SaaS 杀手?

古人讲工欲善其事,必先利其器。然而器利不利,不仅看功能多寡,更看底层的工程质地。

游标卡尺测量微型芯片与精密砝码,对比端侧算力与昂贵云端订阅
游标卡尺测量微型芯片与精密砝码,对比端侧算力与昂贵云端订阅

当 Google 用开源体系里的 Gemma 模型把一套端到端的会议工具免费端出来时,市场上那些靠转录接口加提示词包装的创业项目,生存根基必然受到震荡。

工具名称录音形态处理位置订阅月费(美元/人)训练条款
Google AI Edge Foresight系统内录本地芯片$0(免费)无数据外传
Granola免 Bot 界面云端 AWS / API$14 - $35默认收集训练(可手动关闭)
Wispr Flow听写与会议录制云端服务器$15 - $33云端处理与留存
Fathom免 Bot 测试中云端存储与计算$16 - $25云端留存与分析
Calendly Notetaker外部录制对接云端 Recall.ai需 Plus 升级方案调用 OpenAI 接口处理

但这并不意味着 Foresight 已经能够立刻淘汰现有的商业方案。

根据 GitHub 社区此前对 Gemma 4 端侧运行情况的反馈,这类本地小模型在部分移动与边缘硬件上曾出现 GPU 加速下的重复 Token、推理崩溃与长文本截断等状况,甚至偶发本地运行的模型产生幻觉自称位于远程服务器。

更关键的缺口在专业指标上。Foresight 至今尚未公布真实会议场景下的词错误率(WER)测试,也缺少重叠语音处理与说话人分离(Diarization)的明确评测数据。真实会议不是安静的录音室,多人抢话、环境杂音和长达两小时的上下文推导,恰恰是轻量端侧模型最容易丢盔弃甲的地方。

动辄几十美元的会议 SaaS,本质上在兜售算力代理与工程调优的溢价。

Google 目前将 Foresight 置于 Google AI Edge 开发者生态之下,它更像是一次展示 Gemma 系列端侧实力的技术橱窗,而非承诺提供企业级 SLA 支持的商业软件。

  • 提醒.如果你的工作依赖精确到人的法律责任认定或跨数小时的复杂会议纪要,现阶段缺少说话人分离验证的端侧模型仍显吃力;但若核心诉求是本地资料的保密与日常交流索引,无云端泄露风险的端侧工具已经具备实用价值。

当 740M 参数的模型已经能在笔记本里跑通向量索引,所有依赖转录与摘要加价的垂直中间层都该清醒了:把云端 API 包装成昂贵订阅的好日子,正在被端侧算力的下沉快速终结。