腾讯多模态路线调整:姚顺雨偏向梁文锋式思路,蔺旭东加入混元负责内容生成
原xAI多模态理解负责人蔺旭东加入腾讯混元,担任多模态内容生成算法负责人。结合混元多模态团队近期组织调整,腾讯多模态研发方向正从“内容生成”转向“理解上下文并行动”,姚顺雨主导下更接近梁文锋对AGI主线的判断。
事件概述
据媒体报道,原xAI多模态理解负责人蔺旭东已离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。此前,混元内部已陆续传出负责人离职、研究人员转岗及新成员加入的消息,多模态团队正在经历组织重组和路线调整。
蔺旭东的背景与角色
- 蔺旭东2018年毕业于清华大学,后赴哥伦比亚大学攻读博士,研究方向包括嵌入学习、视频分析和生成模型,曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目,该项目将视频、音频等多模态信息转换为文本。
- 博士毕业后进入DeepMind,参与Gemini多模态预训练和后训练工作;2025年加入xAI,负责多模态理解方向,并参与多模态内容理解与生成模型训练。
- 加入腾讯混元后,他将负责多模态内容生成算法。其核心能力被认为不是单纯的“生成性能提升”,而是解决多模态中“理解”这一根本问题——让模型稳定记忆和理解世界,而非仅仅输出画面。
混元组织调整时间线
- 2025年1月,腾讯杰出科学家胡瀚接替刘威,全面负责混元多模态大模型研发。
- 2025年下半年,胡瀚被调入大语言模型部旗下“Frontier”前沿技术研究组,任多模态理解方向负责人,汇报线转为向姚顺雨汇报;多模态生成等方向被划出。
- 2026年3月,腾讯撤销AI Lab,部分人员并入混元大语言模型部;原混元实际掌舵人蒋杰完成交接,不再兼管AI Lab和混元。
- 2026年7月初,前OpenAI研究员、姚顺雨清华本科校友田永龙加入腾讯,负责视觉语言模型方向。
- 随后,腾讯TEG撤销大语言模型部和多模态模型部,合并成立“基础模型部”,姚顺雨任负责人,向TEG总裁卢山汇报。
- 此后,胡瀚被曝离职创业;原多模态模型部负责人Linus改向姚顺雨汇报;混元多模态基础模型负责人钟钊于8月14日在朋友圈暗示,即将发布的版本将是他参与HunyuanVideo与HunyuanImage项目的最终版本。
腾讯原有多模态布局
此前腾讯混元多模态的核心产品包括:
- HunyuanVideo:文生视频模型,2024年12月首发,130亿参数;后迭代至1.5版本,支持5-10秒480p/720p视频生成。
- HunyuanImage:2024年5月推出的中文原生DiT图像模型,后升级至2.1/3.0版本,并推出带推理能力的Instruct版本。
- Hy 3D:单体3D模型生成工具,已迭代至3.1版本。
- HyWorld:3D世界生成模型,定位为“重建、生成、模拟3D世界”,路线与李飞飞“空间智能”理念接近。
路线转变:从“生成”到“理解”
姚顺雨在多模态问题上更认同梁文锋的观点,而非李飞飞。梁文锋曾表示:“我们只做AGI主线——GPT、CoT、Agent。3D、视频生成、世界模型,跟智能的主线没有太大关系。”DeepSeek的OCR技术即是将视觉作为服务语言模型的工具,而非独立智能方向。
姚顺雨加入腾讯后的首款旗舰产品Hy3,重点放在推理、智能体、长上下文和生产力任务上,目标并非“屠榜”,而是让模型在真实产品中少出错、能理解上下文。2026年6月,他在腾讯云AI产业应用大会上表示,AI下半场的竞争壁垒不在模型参数量,而在Context(上下文);团队为此制作了上下文测试基准CL-bench。
Hy3的首发平台WorkBuddy数据显示,接入Hy3后,办公场景任务解决率从72%升至90%,平均耗时缩短34%,主动选择Hy3的用户数增长6倍,日均文字处理量较预览版增长20倍。
结论
滕讯混元多模态正在经历一次系统性的方向重整:从强调内容生成(视频、图像、3D世界)转向强调上下文理解与Agent能力。蔺旭东的加入,被视为这一路线转变中的关键落子。不过,这并不代表李飞飞的空间智能路线被否定,而是姚顺雨为腾讯选择了更贴近梁文锋的AGI判断。
