中东主权 AI 的军备竞赛正在经历一场微妙的分流。2026 年 10 月 6 日,阿联酋技术创新研究院(TII)发布 Falcon-Emirati-7B,把大模型的核心能力从通用书面语拽向了阿联酋本土方言。在此之前,海湾国家比拼的是谁的基座参数更大、谁能吞下更多现代标准阿拉伯语(MSA)文献;但现实的尴尬在于,本地居民日常砍价、开玩笑或吟诵纳巴蒂诗歌时,根本不用教科书上的书面语。一个通用模型即便能逐字翻译每个词,也完全摸不透句意底下的潜台词。
Falcon-Emirati-7B 的推出,标志着主权 AI 的重心从盲目堆砌通用语料,转入极度精细的次国家级口语巷战。在通用大模型已经能够流利处理标准语的今天,能否在 7B 这种轻量级尺寸下搞定高难度口语和文化隐喻,成了检验技术落地能力的新门槛。
混合架构破除显存瓶颈,三轨数据打破口语荒
方言适配向来是自然语言处理的硬骨头,阿联酋方言更是典型代表。它本质上是口头传播的语言,互联网上的原生公开书面文本少得可怜;更麻烦的是,纳巴蒂诗歌和民间谚语高度依赖文化默契,无法照字面硬解。行业里过去既没有成熟的微调配比范本,也没有充裕的标注预算。

TII 没有从零起步,而是将模型架构架设在 2026 年 1 月发布的 Falcon-H1 混合底座上。为了兼顾长文本理解与日常部署的推理开销,研发团队采用了 Mamba 状态空间模型与 Transformer 注意力机制并行的网络块,在投影层之前完成融合。这种结构利用 Mamba 的线性时间复杂度分担长序列压力,同时用注意力机制兜底阿拉伯语复杂形态的长程依赖。更早之前,TII 在通用阿拉伯语研发中就曾扩充过约 32,000 个专属 token 的分词词表,为小参数模型处理高形态语言打下了地基。
在关键的数据管线上,工程团队避开了任由生成模型自由发挥的通病,搭建起三轨互补的输入路径:第一轨抓取本土论坛与社交网站的原生方言,沉淀日常对话与转折语气;第二轨注入介绍阿联酋传统民俗与历史的书面标准语文献,让模型理解文化背景;第三轨依托专有的阿联酋方言词汇表与语法规则,以硬约束批量合成对话样本,填补口语数据在广度上的天然空白。
跑分断层拉开,多语言模型暴露方言真空
在由阿联酋母语者手动编写的 1,173 道选择题基准 Alyah 上,Falcon-Emirati-7B 拿到了 84.83% 的准确率。这一成绩不仅刷新了其底座 Falcon-H1-Arabic-7B-Instruct 此前的 82.18%,更直接拉开了与竞品的身位。在针对阿联酋文化场景的 ArabCulture-Dialogue 子集(涵盖 283 个混合情境)评测中,该模型跑出 85.57% 的高分,压制了沙特的 ALLaM-7B(83.39%)、本土对手 Jais-2-8B(73.79%)以及卡塔尔体量更大的 Fanar-2-27B(71.50%)。

选择题往往会掩盖真实生成的短板。为了测试实际对话表现,团队引入 Gemini 3.7 Flash 作为裁判,对 1,173 道题目的开放式作答进行打分。结果显示,真正的分水岭并非事实答对与否,而是模型能否用纯正的阿联酋方言给出回答。
在方言保真度这项指标上,Falcon-Emirati-7B 取得了 0.52 的得分,而其他对手几乎全军覆没:ALLaM 仅有 0.05,Gemma 3 27B 为 0.03,Jais-2-8B 只有 0.02,Fanar-2-27B 更是趋近于零。这种悬殊的差距暴露出大模型行业的一个盲区:即便参数规模达到 27B,模型在面对特定方言提问时,仍会惯性退回标准书面语的腔调;而 Fanar 甚至出现了高达 26.2% 的拒答率。
堆大参数换不来方言理解,通用语料喂得越饱,模型反而越容易患上方言失语症。
标尺自造与落地割裂,7B 模型的现实边界
尽管评测战报可圈可点,但业内对于这项成果的落地成色仍有审慎保留。最直接的问题在于开源交付的透明度:目前开源社区与 Hugging Face 仓库中尚未释出独立的权重文件,更多人倾向于将其视作阶段性的技术验证与工程概念展示,距离政务客服或企业软件开箱即用还有一段距离。

此外,评价体系的客观性同样存在争议。Alyah 基准由 TII 团队自主建立,虽然题目由母语者编写,但干扰选项包含模型辅助生成的成分,目前缺少独立第三方学术机构的大规模盲测复现。而在实际交互中,即便取得了 0.52 的保真度,也意味着多轮生成中依然有相当比例的回答会漂移回标准语或泛海湾口音。
- 风险.阿联酋内部各酋长国口音存在差异,且本土年轻人极高频夹杂英语(语码转换),单一 7B 模型在复杂现实对话中极易出现表达僵硬。
商业采购方与政府公共服务部门目前仍处于观望期。对于公共机构而言,他们迫切需要褪去政务服务中生硬的书面语官腔,换上亲切的本土表达;但没有经过高并发生产环境验证的模型,很难直接被交接给关键业务。海湾主权 AI 已经把战场推进到了方言与文化的深水区,但要让算法真正融入街头巷尾的烟火气,工程团队要迈过的槛,远不止一份选择题榜单。
