Google DeepMind新任主管Koray Kavukcuoglu在2026年9月24日公开释放信号,声称下一代旗舰大模型Gemini 4已进入精炼阶段,团队正争取在远早于年底的时间点推出。然而,将研发节点的工程现实与当下的竞争版图对照来看,这句“几乎就绪”更像是一场急于稳住市场预期的防守型表态,而非新王登基的冲锋号角。

在竞争对手早已完成产品代际切换的背景下,Google正承受着前所未有的窗口期挤压。但大模型从底座训练到安全对齐有着不可逾越的客观周期,急于对外描摹蓝图,恰恰印证了底层战局的被动。

7月才启动预训练,Gemini 4并未真正就绪

把时间线拉回两个月前便能看清端倪。Google直到2026年7月21日才正式启动针对Gemini 4的训练,并将其定性为迄今最具雄心的预训练任务。截至9月下旬,该模型才刚刚推进到早期后训练阶段,核心精力仍在处理基础的可靠性与可用行为调优。对于超大规模的旗舰底座而言,后续的多模态融合、长程指令遵循对齐以及红队安全测试,通常需要数月时间反复打磨。

Kavukcuoglu口中所谓远早于年底的节点,仅仅是研发团队内部的主观愿望,绝非板上钉钉的商用发布日程。截至9月24日,Google官方没有披露Gemini 4的任何基准跑分、具体参数量、上下文窗口长度,更未提及具体的发布日期与定价。值得澄清的是,市场上同期讨论的开源序列Gemma 4属于独立的轻量模型体系,并不隶属于Gemini 4这一旗舰阵列。在底座尚未完成严苛验证前,过早向外界释放几乎就绪的信号,难免带有公关修辞的水分。

Gemini 4 研发推进与发布窗口推演 7月21日 启动预训练任务 9月下旬 早期后训练阶段 宣称“几乎就绪” 年底至明年初 行业预期交付窗口

换帅后的实用主义,接棒者直面两强夹击

这场发言同时也是DeepMind权力重组后的首次公开亮相。原掌舵人Demis Hassabis已退居二线转任DeepMind主席兼Alphabet首席科学家,实际操盘权则全面移交给Koray Kavukcuoglu。这位新任高级副总裁兼首席AI架构师,目前统领从前沿研究到Gemini模型工程及开发者生态的全链条。

架构师走上前台,折射出这支前沿团队正试图剥离纯粹的学术理想主义,转向以工程可用性为导向。Kavukcuoglu在访谈中刻意淡化了对单一通用人工智能基准的追逐,转而强调更低的调用消耗与智能体工作流执行能力。

旗舰底座的代际差距,无法单靠轻量模型的缝补来弥合。

这种转向背后是残酷的外部战局。OpenAI早已全面铺开GPT-5.6家族,用Sol主攻极限推理、Terra负责通用平衡、Luna覆盖低成本任务,构建起层次分明的商业壁垒。另一端,Anthropic在2026年9月1日正式推出Claude Fable 5.1,直接在长程智能体与复杂编程领域筑起高墙。反观Google的公开阵列,目前依旧只能依靠Gemini 3.5配合Gemini 3.8 Live撑住场面,核心旗舰的真空让团队面临巨大的卡位焦虑。

当前旗舰大模型市场博弈格局 OpenAI 矩阵 GPT-5.6 全系铺开 Sol / Terra / Luna 分层 Anthropic 阵地 Claude Fable 5.1 长程编程与Agent壁垒 Google 现状 Gemini 3.5 / 3.8 Live Gemini 4 仍在后训练

跑分脱敏与工程落地,基准提升难解开发者疲态

为了证明工程迭代能力,Google此前拿出了轻量级过渡选手Gemini 3.6 Flash的数据。官方指标显示其提升确有实绩,DeepSWE得分从前代的37%抬升至49%,MLE-Bench测试由49.7%攀升到63.9%,系统操作基准OSWorld-Verified录得83.0%(高于3.5 Flash的78.4%),综合评测GDPval-AA v2亦取得1,421分。

Gemini 3.6 Flash 与 3.5 Flash 核心基准对比 DeepSWE (软件工程) 49.0% vs 37.0% MLE-Bench (机器学习工程) 63.9% vs 49.7% OSWorld-Verified (系统操作) 83.0% vs 78.4%

但开发者社区的耐受度正在发生变化。频繁的早期预告让大量从业者产生信任消耗,比起官方挑选的基准数值,市场更在意复杂长程任务中的实际稳定性。近期非公开渠道流出的早期测试表现并未平息疑虑,模型在生成复杂矢量图等推理场景下耗时长达两至三分钟,整体质量未见明显代际优势。

  • 提醒.企业客户与开发者当下的技术选型已高度务实,在模型未进入公测并亮出真实调用价目表前,切忌根据预期排期调整技术架构。

对于当前的Google而言,这场仗的破局点已经不再是拿下一两个测试集的领先标签。背靠自研TPU集群所带来的算力成本优势能否真正沉淀为具有杀伤力的API定价,以及模型在多工具编排中的长程推理延迟能否显著收敛,才是Gemini 4能否在年底真正扳回局面的关键考题。