字节Seed大调整:组织逻辑从“模态”转向“任务”,RL与Agent能力集中化
2026/09/02 18:49阅读量 7
8月19日,字节跳动Seed基础模型团队进行重大组织架构调整,新设Pretrain Data、Horizon RL及两个产品后训练部门。此次调整旨在合并相似工作,将预训练数据与强化学习(RL)能力集中,并依据C端对话与B端办公场景拆分产品团队。这标志着大模型竞争焦点从单一模态能力转向以Reasoning、Agent为核心的综合智能上限提升及具体业务场景落地。
事件概述
据晚点Late Post报道,2024年8月19日,字节跳动Seed基础模型团队宣布新一轮组织架构调整。此次变动涉及四个新设立的一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳负责,均向吴永辉汇报。这一调整不仅明确了各分支的带队人选,更折射出Seed在大模型竞争进入深水区后,对组织逻辑的重构意图。
核心信息
1. 模型能力侧:数据与RL集中化
-
Pretrain Data(预训练数据):
- 构成:由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而成。
- 分支与负责人:下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支。
- 目标:统一为Omni全模态模型和超大模型供给数据。
- 关键人物:负责人李成刚曾搭建字节搜索系统;沈科是超大模型预训练数据核心人物;Xia Xiao为开源代码模型Seed-Coder核心作者。
-
Horizon RL(强化学习):
- 构成:整合了分散在推理、视觉理解等方向的后训练团队。
- 分支与负责人:下设RL Scaling(岳宇)、Reasoning(王明轩)和视觉强化学习(吴侑彬)三个分支。
- 目标:负责强化学习,提升模型的基础智能上限,特别是推理效率和稳定性。
- 技术积累:此前已公开DAPO、VAPO等强化学习工作,持续将RL应用于长链路推理和Agent能力。
- 关键人物:负责人唐晟宇;王明轩曾任腾讯高级研究员,多次获WMT冠军;岳宇为DAPO算法作者之一。
-
跨部门协作机制:
- 虽然部门分立,但业务链条保持连贯。例如,视觉方向中,训练前数据归Pretrain Data的林毅,训练后RL归Horizon RL的吴侑彬,吴侑彬在视觉方向上需同时向林毅汇报。
- 类似交叉管理还包括:唐晟宇兼管代码预训练;周畅(原多模态交互与世界模型负责人)兼管视觉预训练。
2. 产品侧:按用户任务拆分Work与Chat
-
Product Posttrain-Work(面向办公场景的产品后训练):
- 定位:服务B端,针对办公场景优化模型的Agentic能力,支持豆包和Dola的任务模式。
- 分支:下设GUI(吴志勇)和由原有Agent办公团队合并而来的分支,负责Agentic模型的整合与发布。
- 负责人:秦禹嘉(90后,清华刘知远教授学生,面壁智能核心成员,GUI智能体UI-TARS第一作者)。
- 关键人物:GUI分支负责人吴志勇,参与过OS-Atlas、SeeClick等开源工作。
-
Product Posttrain-Chat(面向对话场景的产品后训练):
- 定位:服务C端,优化搜索问答、对话体验、个性化和安全等能力,同时控制推理成本。
- 分支:下设豆包和Dola Chat分支。
- 负责人:严林(豆包大语言模型Alignment团队负责人,中科院计算所硕士)。
- 人员变动:原Application团队负责人朱文佳继续保留该团队并更名;原相关人才吴双志转往火山引擎,负责火山API支持,向吴迪汇报。
值得关注
- 组织逻辑转变:过去大模型产品多按模型能力(如语言、视觉、代码)划分,现在转向按“用户要做什么”来划分。Chat聚焦C端日常交互,Work聚焦B端复杂任务执行。
- 行业趋势印证:此次调整并非孤立事件。腾讯近期将混元的大语言模型部与多模态模型部合并为基础模型部;Meta超级智能实验室也按模型、研究、产品、Infra重组。这表明随着Omni模型发展和Reasoning/Agent成为竞争重点,不同模态边界模糊,RL不再仅是后训练环节,而是提升智能上限的关键。
- 战略意图:通过打散传统模态壁垒,将能力重新装入数据、强化学习和产品任务中,Seed试图构建一套能真正跑通的组织方式,以应对Agent拉近模型与产品距离、直接参与业务流程的新阶段。
