Tavus发布实时视频交互模型Griffin:48%用户误判为真人,全双工架构突破视频图灵测试边界
2026/10/03 11:27阅读量 3
AI研究团队Tavus发布实时视频交互模型Griffin,在1分钟视频通话实验中,54名参与者中有26人(48%)误认为对方是真人,较上一代系统(2.4%)大幅提升。该模型采用全双工架构,能实时处理表情、动作与情绪,并在英伟达VideoFDB基准测试中得分接近人类水平。尽管表现显著,但实验样本小、时长短,且对话流畅度仍有短板,目前仅向可信测试者开放预览,安全与身份披露功能仍在开发中。
事件概述
AI研究团队Tavus发布了名为Griffin的实时视频交互模型(Human Interaction Model, HIM),并公布了一项“视频图灵测试”实验结果。在与Griffin-Lite进行一分钟视频通话后,54名参与者中有26人(占比48%)认为屏幕另一端是真人,而对照组中上一代系统仅有2.4%的误判率。Tavus宣称这是首个通过实时视频图灵测试的模型,但目前仅向部分可信测试者开放研究预览,尚未全面商用。
核心技术与性能
- 全双工实时交互架构:Griffin采用全双工方案,能够同时看、听、说。系统以小于1秒的间隔持续评估用户的表情、视线、语气和停顿,动态决定回应、暂停或打断时机,摆脱了传统级联系统“轮流答题”的节奏。
- 低延迟与高生成速度:
- 音频:采用流式生成,支持利用约10秒参考音频克隆声音。
- 视频:以320毫秒为单元实时输出720p/25fps画面。通过模型蒸馏和自回归训练,将多步生成压缩为少步生成,提升长时间输出的稳定性。
- 延迟:音频到视频的生成延迟平均为0.43秒,约为竞品的一半。
- 视觉细节增强:模型能从一张参考图像出发,实时生成包含人脸、手部动作、背景变化及光影效果的完整画面,实现眼神交流、点头等非语言信号的同步表达。
基准测试与实验数据
- VideoFDB榜单表现:在英伟达公开的VideoFDB基准中,Griffin-Lite在生成赛道总分3.83(人类参考3.92),感知赛道3.73(人类参考4.20),均领先其他AI系统。但需注意,部分对比对象输入条件不同(仅音频或音视频),排名不可直接平移至所有场景。
- 用户体验评价:
- 误判率:48%的参与者未察觉是AI,平均信心79%;怀疑者是AI的用户平均信心81%,且多数在20秒内产生怀疑。
- 评分短板:在七分制评价中,自然程度5.4,可信度5.6,再次交流意愿5.8,但对话流畅度仅为4.9,是各项指标中最低的,表明模型在应对复杂对话节奏时仍有明显不足。
