阿里巴巴在2026年9月14日推出了原生全模态模型Qwen3.8-Omni-Flash,官方给出的战报相当吸睛:29项评测平均提升超25%、音频每小时输入成本下降超98%、音视频输入成本下降超93%。在长音频理解与会议处理等场景里,多项指标跃升幅度甚至超过以往的大版本迭代。

这很容易给人一种错觉,仿佛国内开发者终于等到了一个全面超越Google Gemini、并且调用成本低到可以随便挥霍的端到端音视频通用模型。但如果剥开发布材料的层层修辞,翻看一下官方API文档和第三方的评测数据,就会发现它其实是一款特点极其鲜明、取舍也极其清晰的特化工具。

规格拆解:多模态进,纯文本出

首先要厘清的,是Qwen3.8-Omni-Flash到底能生成什么。

虽然名字带着Omni,并标榜端到端音视频制作与实时会话,但它的官方API输入规格支持文本、图像、音频与视频,输出规格仅限文本。它并不是类似GPT-4o原生语音模式那种直接吐出音频流的语音到语音(speech-to-speech)端到端生成模型。

Code
输入模态:文本 / 图像 / 音频 / 视频  ──►  [ Qwen3.8-Omni-Flash ]  ──►  输出模态:仅限文本 (Text-only)

要在实际业务中实现发布会演示里的短剧出海配音、视频自动剪辑或实时对话,必须依靠模型生成结构化的文本或代码,再外接配套工具链。这也是为什么阿里同步开源了Qwen-Live Harness与Qwen-MM-Plugins两个工程框架,用来把文本指令分发给外部渲染器、剪辑脚本和独立的TTS语音合成模块。

在上下文承载力上,该模型确实拉到了标准的100万tokens窗口。具体到API限制,非思考模式下最大输入为991,808 tokens,思考模式下最大输入为983,616 tokens,最大输出上限为131,072 tokens,且默认开启多级推理控制。在音频输入端,它还原生支持了立体声与四声道FOA(一阶高保真立体声)空间音频输入,并提供多通道解耦选项。

Qwen3.8-Omni-Flash 实际交互拓扑 多模态输入 • 文本 / 图像 / 视频 • 立体声 / 四声道FOA 100万 Token 上下文 Qwen3.8-Omni 核心 • 证据检索与空间定位 • 时序逻辑与任务规划 输出:仅限纯文本 外部插件工程链 • Qwen-Live Harness • Qwen-MM-Plugins 调用剪辑 / TTS完成交付

这意味着,它在架构上是一个极其敏锐的听觉与视觉感知中枢,擅长理解复杂的现场并写出执行指令,但它自己并不负责把声音和画面直接画出来。

评测谱系:偏科的耳朵与理性的工具

在各项榜单数据上,这款模型表现出非常明显的长短板分布。

在官方给出的数据里,最令人吃惊的一项是AliMeeting评测:多说话人日志错误率(DER)从前代Qwen3.5-Omni-Plus的88.11暴降至3.35,会话词错误率(cpWER)从89.61骤降至17.18。这种跳跃式的改善在纯粹的模型权重微调中极为罕见,业内更倾向于认为阿里在音轨预处理、四声道空间音频解耦或者前端说话人日志(Diarization)流水线上做了深度的工程改造。

第三方外部跟踪机构披露的对照数据则呈现出更有意思的割裂。在以声音、音效与复杂工具调用为主的测试中,Qwen3.8-Omni-Flash展现出了压倒性优势;但在纯视频的时序逻辑理解与更广泛的多模态Agent测试中,Google旗下的Gemini 3.8 Flash依然稳稳卡在前方。

评测基准考察维度Qwen3.8-Omni-FlashGemini 3.8 Flash优势方
WildClawBench-MM音视频Agent与工具调用71.058.9Qwen 领先
SpotSoundBench环境声音事件辨识67.239.7Qwen 领先
MMAU音频多任务综合理解81.876.9Qwen 领先
Video-MME-v2纯视频长时序推理65.071.0Gemini 领先
AgenticVBench复杂长程视频Agent规划36.845.0Gemini 领先
OmniGAIA通用多模态环境任务74.078.6Gemini 领先

简而言之,它长了一双极其精细的耳朵,在捕捉谁在说话、环境里发生了什么声音、以及如何根据声音线索调取插件上建起了壁垒;但在需要纯视觉进行深层次跨镜头时序因果推理的地方,它依然存在可见的代差。

关键评测基准表现对照(百分制) WildClawBench-MM 71.0 (Qwen) 58.9 (Gemini 3.8 Flash) SpotSound (环境音) 67.2 (Qwen) 39.7 (Gemini 3.8 Flash) Video-MME-v2 (视频) 65.0 (Qwen) 71.0 (Gemini 3.8 Flash)

算力账本与生态转向的潜台词

再来看那个降价超98%的官方口径。

这个夸张的百分比,参照系是上一代定价昂贵的Qwen3.5-Omni-Plus。如果直接翻开阿里云国际节点的标准价目表,真实的计费阶梯相当分明:

  • 文本输入单价为每百万tokens $0.15(提示词缓存命中时降至$0.016),文本输出单价为每百万tokens $0.47
  • 模态细分计费下,图像与视频输入成本跳升至每百万tokens $0.78
  • 音频输入成本最高,达到每百万tokens $3.81,同时多模态请求触发的输出费率会提升至每百万tokens $3.06

相比之下,字节跳动的Seed2.0 Lite在基础Token定价上直接压到了输入$0.09/M、输出$0.53/M的激进水位。如果你要处理海量的连续音视频流,Qwen3.8-Omni-Flash固然比旧版本便宜了太多,但音频每百万tokens近4美元的基础账单,依然要求业务方必须精打细算。

声称降价近百倍,是因为昨天的基数本就高悬,当下的算力从来没有免费午餐。

比成本更值得观察的,是阿里对待开源态度的微调。

通义千问过去之所以在开发者社区中积攒了极高口碑,核心在于其对权重开源的坚定执行。但截至发布初期,Qwen3.8-Omni-Flash仅作为托管API提供服务,开源社区(包括Reddit的LocalLLaMA等技术板块)对未同步释出本地开源权重表达了明显的失望与无法独立复现的质疑。

把最锋利的原生全模态能力留作云端托管资产,配合开源的Harness运行环境来捕获工作流,这是一套经典的云厂商锁客逻辑。

  • 建议.将它用于多说话人长会议纪要提炼、多音轨定位与多媒体资产结构化整理,它的听觉与性价比优势成立。
  • 风险.若业务强依赖端到端本地私有化部署,或者需要模型原生输出实时音频流,现阶段的托管API形态会带来不可忽视的架构与平台绑定风险。

昔日打天下靠解甲相赠,如今守江山靠筑起云墙。Qwen3.8-Omni-Flash绝非一个全面碾压竞品的全能神兵,它是一款把听觉感知磨到极锋利、在工具调用上极务实,但在开源承诺与生成模态上默默留了退路的生产力利器。