Tavus发布Griffin模型:AI数字人实现全双工视频交互,近半数测试者误认为真人

2026/10/04 13:27阅读量 3

美国AI视频公司Tavus于10月1日发布名为Griffin的「人类交互模型」,该模型采用端到端全双工架构,实现了实时音视频生成与对话理解。在一分钟视频通话测试中,48%的参与者未能分辨出对方为AI,较上一代系统2.4%的通过率提升显著。Griffin通过连续对话建模和自回归视频生成技术,解决了传统级联架构的延迟与信息丢失问题,标志着AI数字人从「像不像」向「懂不懂」的技术范式转变。

事件概述

2026年10月1日,美国AI视频公司Tavus发布了名为Griffin的模型,将其定义为全球首个「人类交互模型」(Human Interaction Model, HIM)。该模型旨在解决实时AI数字人在交互中的自然度问题,通过端到端的全双工技术,使AI能够像真人一样进行眼神交流、适时插话、保持沉默及表达情绪。

核心技术与性能

1. 架构革新:从级联到全双工
传统实时数字人多采用「级联」架构(语音识别→大语言模型→语音合成→形象驱动),存在高延迟和信息丢失问题。Griffin采用了全双工、视频到视频的架构:

  • 连续对话建模:每隔不到一秒重新评估对话状态,综合语义、表情、镜头内容决定输出(说话、点头、沉默等),不仅生成文本,还生成涵盖情绪、姿态、表情的控制信号。
  • 音视频生成引擎:
    • 音频:使用自研Tavec编解码器,以10毫秒为单位流式输出声音,支持声音克隆。
    • 视频:通过分布匹配蒸馏、自回归结构改造及Self-Forcing训练方法,将庞大模型压缩,实现320毫秒块状的720p实时生成。平均反应延迟为0.43秒,仅为次快方案的一半。

2. 交互能力突破
Griffin展示了多项类人交互特征:

  • 非语言沟通:能根据用户动作(如拧魔方)持续注视并适时指导;在用户思考时保持安静等待,而非机械插话。
  • 动态互动:具备「抢话」和打断能力,能在多人场景中自然切换对话对象,甚至对突发入镜做出反应。
  • 情感表达:能根据语境做出脸红、大笑等微表情,以及配合对话内容的肢体动作。

3. 评测数据

  • 图灵测试表现:在Tavus组织的一分钟视频通话测试中,54名参与者中有26人(约48%)认为对方是真人。作为对比,Tavus上一代系统在同样测试中仅2.4%的通过率。
  • 基准测试:在NVIDIA推出的VideoFDB基准中,Griffin-Lite在「生成」赛道得分3.83/5(接近人类参考值3.92),在「感知」赛道得分3.73/5,均排名第一或前列。

行业影响与挑战

1. 赛道逻辑转变
Griffin的出现将数字人行业的竞争焦点从「图形渲染逼真度」(像不像)转向「对话建模能力」(懂不懂)。这要求产品具备实时理解上下文和非语言线索的能力,可能削弱依赖传统四件套(ASR+LLM+TTS+驱动)产品的护城河。

2. 测试局限性与争议
尽管数据亮眼,但测试结果需谨慎解读:

  • 心理暗示偏差:测试前告知参与者对面是「另一位参与者」,可能导致默认判断为真人。
  • 样本量小:仅54人参与,统计误差范围较大(±13%),且话题轻松,未涉及深度复杂场景。
  • 警觉性差异:超过一半参与者未起疑心,但起疑者在20秒内即可察觉异常。

3. 安全与伦理考量
随着AI交互逼真度提升,深度伪造风险增加。Tavus承认该技术可能被滥用,目前Griffin-Lite仅对少数受信任测试者开放,公司正在开发「主动披露身份」功能并与AI安全组织合作,以应对潜在的安全威胁。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。