前字节实习生田柯宇创业获2亿美元估值,以“视觉自回归”路线挑战世界模型巨头

2026/10/09 18:34阅读量 2

曾卷入字节跳动算力纠纷的北大博士田柯宇创立实验室,获五源资本和IDG投资,估值达2亿美元。其团队基于NeurIPS最佳论文VAR技术,开发AI专属符号语言构建世界模型,旨在通过极致压缩降低视频生成成本。该路线试图在效率上超越李飞飞等主导的空间重构派,但面临数据清洗、工程压力及过往争议带来的信任挑战。

事件概述

2026年10月,一家由前字节跳动实习生田柯宇创办的神秘实验室完成融资,获得五源资本和IDG等顶级机构3000万美元投资,投后估值达到2亿美元。尽管创始人曾因干扰大厂算力分配引发巨大争议,但其凭借在视觉生成领域的底层技术创新,仍获得了资本市场的重注。目前,该团队正致力于研发基于“世界模型”的基座模型,计划于2027年发布,目标是在机器人、自动驾驶及交互式视频领域与行业巨头展开竞争。

核心技术:AI专属符号语言与VAR路线

田柯宇团队切入世界模型赛道的核心逻辑是创造一套AI专用的“视觉词典”,以解决人类语言描述物理世界时信息维度低、算力消耗大的问题。

  • 技术原理:团队已搭建包含20万个符号的视觉词典。这些符号虽人类不可读,但AI可利用其表示、压缩和预测视频内容。该方法基于此前田柯宇作为第一作者获得的NeurIPS 2024最佳论文《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》(简称VAR)。
  • VAR创新点:不同于扩散模型或传统自回归模型,VAR采用“下一尺度预测”机制,保留图像二维结构,从模糊全局轮廓到精细细节逐层并行预测。这一架构不仅使生成速度提升20倍,还跑通了视觉生成的Scaling Law,实现了参数扩大后的性能自动涌现。
  • 预期效果:据称,该技术能将生成一秒钟视频的成本降低至少一个数量级。团队计划输入约1亿小时视频数据,让模型通过这套符号系统学习现实世界的物理规律,而非依赖显式的三维重建。

争议背景:“投毒”事件始末

田柯宇的创业之路伴随着巨大的舆论争议。2024年,他在北京大学攻读博士期间,于字节跳动商业化技术部门实习参与VAR项目时,因不满团队算力分配,编写代码干扰同事训练任务。

  • 事件经过:利用Hugging Face加载模型存档的安全漏洞,他在权重文件中植入恶意代码,动态改写优化器并插入延时指令,导致团队30多位研究者长达一个季度的工作受损。
  • 法律结果:字节跳动最初未公开此事,但在网络传言发酵后发布声明澄清损失被夸大。随后字节起诉索赔800万元。法院最终判决田柯宇违反实习合同,赔偿50万元并返还全部实习工资。
  • 当事人回应:田柯宇在后续采访中承认做法错误,称之为“以暴制暴”,并表示若重来会选择更明智的处理方式。但他也指出,此举折射出大厂内部算力资源争夺的残酷困境。

赛道竞争与资本逻辑

当前世界模型赛道呈现多流派分化态势,资本押注的核心差异在于技术路线的效率与可行性。

  • 主要竞争对手:
    • 李飞飞(World Labs):走空间重构路线,侧重从2D还原3D空间智能,累计融资超10亿美元,估值54亿美元,近期被AMD收购。
    • 杨立昆(AMI Labs):种子轮获10.3亿美元,估值45.3亿美元。
    • 其他玩家:包括像素渲染派(Sora、PixVerse)、几何物理模拟派(DeepMind Genie3)及具身规划派(宇树、Momenta等)。
  • 投资逻辑:五源资本等机构看好田柯宇的“纯自回归路线”。相较于李飞飞团队高昂的三维重建成本和算力消耗,田柯宇的方案通过极致压缩视频冗余数据,有望大幅降低推理成本,更适配硬件限制且易于跑通Scaling Law。
  • 潜在风险:
    • 技术验证:仅靠20万个符号能否在长时序复杂交互中稳定涌现物理因果,尚未经过大规模公开验证。
    • 工程压力:1亿小时高质量视频数据的清洗与治理难度极大,而团队仅10人,基础设施能力存疑。
    • 信任危机:过往的道德污点可能持续影响人才招募、学术合作及行业信任,一旦技术进展不及预期,资本耐心可能迅速耗尽。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。