旧金山人工智能初创公司 Tavus 于 2026 年 10 月 1 日发布名为 Griffin 的交互模型及其实验性版本 Griffin-Lite,宣称其为首个能够同时理解并生成面部表情、语气停顿及手势的实时模型。伴随发布公布的两组数据迅速在业内引发讨论:在英伟达开展的直接音视频对话拟人度测试中,Griffin 拿到 3.83 分,逼近真实人类的 3.92 分;而在 Tavus 自行组织的 1 分钟视频通话测试里,48% 的受试者误将 AI 当作真人,远超以往系统最高 2% 的水平。
这两组数字展示了数字人从单向播报向全双工互动的跨越,但若将此视作视频领域的图灵测试已被攻克,则脱离了工程实现的真实约束。无论是英伟达的专项跑分,还是近半数受试者的误判,其背后都存在极为严苛的技术切口与统计局限。
跑分逼近人类背后:全双工架构对传统串联管道的代际替代
英伟达给予的 3.83 分来自其针对双向视频通话设计的 VideoFDB 评测基准,这一分数并不代表数字人的渲染画质或唇形精细度超越了全行业离线渲染工具,而是衡量模型在全双工实时交互中的拟人反应。
传统商业数字人多采用串行级联架构。系统收到用户输入后,需先经由语言模型生成文本,再调用语音合成引擎输出音频,最后由面部驱动模块渲染画面。这种流水线导致系统对用户的即时打断无能为力,也无法在倾听时给出自然的点头、视线微调或短促附和。在 VideoFDB 的生成轨道测试中,Gemini 2.5 搭配 Anam 这一强级联组合得分仅为 2.80 分,Gemini 2.5 搭配 Keyframe 仅获 2.39 分。Griffin-Lite 凭借端到端全双工架构拿下 3.83 分,核心在于填补了这层交互时延。
在感知轨道上,该测试基于 237 个真实通话片段并由大模型裁判打分,Griffin-Lite 取得 3.73 分,虽低于人类基准的 4.20 分,但明显高于 MiniCPM-o 4.5 的 3.40 分、Gemini 2.5 Flash Native 的 3.17 分以及 OpenAI gpt-realtime 的 2.75 分。其接管率对齐度在生成端达到 62.8%,感知端达 73.8%。
这说明 Griffin 的真正优势在于让机器学会了像人类一样察言观色和掌握对话节律。它在非语言行为层面的补全,使其在狭窄的交互指标上拉开了与传统架构的差距。
54人受试与60秒盲测:48%误信率的统计水分
与评测跑分同样受到关注的,是所谓 48% 的受试者误认其为真人。但如果穿透公关通稿,会发现该结论建立在一个统计学意义较弱的实验样本之上。
这项由 Tavus 主导设计的测试仅招募了 54 名受试者。在测试前,受试者并未被告知可能正在与机器对话;通话仅持续短短一分钟,事后共有 26 人认定对方是人类。
在日常人际交往中,前 60 秒的视频连线往往充斥着礼貌性寒暄、背景确认和网络信号适应。受试者在毫不知情的前提下,极易将画面的微小撕裂或偶发顿挫归咎于网络传输卡顿,而非对方是数字合成人。同时,该实验缺乏严格的真实人类通话对照组,也未接受独立学术同行的交叉评审。用 54 人的极短测试得出接近一半人类被欺骗的推论,在统计证据上明显不足。
极短时间内的社交惯性掩盖了破绽,但这绝不等于机器通过了长周期的图灵测试。
10秒声纹克隆叠加实时驱动:自适应欺骗的真正威胁
相比于营销层面的夸大,这项技术带来的真正安全变量在于欺诈维度的升级。
Tavus 自 2020 年成立以来累计融资约 6400 万美元,早期聚焦于营销场景下的定制化视频,如今切入实时交互。Griffin-Lite 仅需 约 10 秒音频 即可克隆目标说话者的声音,并同步输出 720p 实时视频。
- 风险.过往单向合成视频无法回应追问,而具备全双工感知的模型已能根据受害者的表情和怀疑语气,见机行事地动态调整微表情与说服话术。
传统的深度伪造无论面容多么逼真,其本质仍是预录或单向投喂,一旦通话对方提出随机动作要求或反常问题,伪造便容易露馅。但具备全双工感知能力的 Griffin 能够根据对方的肢体语言与语调,实时调整眼神方向和打断时机。美国联邦贸易委员会与人工智能伙伴关系等机构已对此类技术发出预警,指出低门槛的声纹克隆结合双工数字人,将对现有的家庭紧急求助核验和企业高管远程授权机制形成实质冲击。
Tavus 官方表示,更强大的完整版 Griffin 将暂缓公开发布,直至安全担忧与透明披露机制得以解决。但截至目前,该平台对防范滥用的设防主要停留在用户协议层面,禁止未经授权的人格克隆与政治欺骗。在底层代码层面,尚未见到经过外部红队审计的不可篡改水印或强一致性流式数字凭证。
当生成模型跨过即时拟真的及格线,视觉真实性的防线已无法依赖肉眼的直觉筛选。在全双工时代,如何建立从媒体流到底层签名的技术验证链,是整个行业在追逐评分之外必须补上的一课。
