《指环王》成AI新考题:卡帕西用百万token让模型手搓3D中土世界
2026/08/07 09:15阅读量 2
卡帕西宣布将《指环王》作为大模型新评测基准:让Opus 5用Three.js把小说开头改编为可运行的3D中土世界,耗时2小时、消耗100万token、生成5500行代码。新基准替代“鹈鹕骑自行车”SVG测试,旨在考察模型处理复杂项目、长时间连续工作和自我纠错的能力。网友测试呈现多样案例,并引发关于空间推理与通用推理关系的讨论。
事件概述
Anthropic 的卡帕西(Karpathy)提出一种全新的大模型评测方式:将《指环王》小说开头作为提示词,让 Opus 5 使用 Three.js 构建一个可实时运行的 3D“中土世界”。模型需要理解文学文本,将人物、建筑、道具放入三维坐标系,并安排摄像机、灯光和动画。
最终生成的画面较为粗糙,类似 90 年代末的国产 3D 动画,存在穿模、漂浮等问题,但整套场景可实际运行。本次测试消耗约 100 万 token、2 小时计算时长,并产生了 5500 行代码。卡帕西也已将项目开源。
核心信息
- 新基准取代了此前流行的“鹈鹕骑自行车”SVG 测试。后者只要求模型生成一张 SVG 图,能考察空间理解和代码生成能力,但只能测试一次性输出;新基准则要求模型规划复杂项目、连续工作数小时,并在数千行代码中反复检查和修正错误。
- 卡帕西指出,Opus 5 目前还无法真正“进入”自己生成的世界,只能在不同时间点截图检查问题。这暴露了大模型的短板:它们能写代码、搭场景、生成游戏,却还不能真正看懂视频,也不会亲自体验自己生成的游戏。
- 卡帕西计划将程序化 3D 与视频生成结合:先用 Three.js 确定分镜和角色动作,再将录屏交给 Seedance 等 Video-to-Video 模型补充纹理、光影和细节;音频则使用 ElevenLabs 生成。
- 社区网友的测试结果多样:
- 有用户用 DeepSeek V4 Flash 复现,画面中人物全部漂浮,被调侃“中国人能飞”。
- 有用户用 Claude 启动“Earth Online”项目,尝试让 AI Agent 逐步搭建整个地球,目前已完成低多边形风格的旧金山滨水区。
- 有用户用 Fable 5 和 GPT-5.6 Sol 搭建了纽约市 3D 数字模型,并接入实时数据,提出这可作为空间推理的新基准。
- 有用户用 Three.js 仅凭一个 HTML 文件生成了 Kanye West 演唱会,包含 14 首歌、独立灯光设计和球形舞台视觉,支持连接 Spotify Premium 播放完整曲目。
- 还有用户基于 Opus 5 和 Three.js 做出了可交互的游戏版本,并配有音频。
讨论与争议
- Hacker News 高赞评论认为,这些 Demo 画面质量一般,但正好说明需要更难的新基准。新基准不应只看模型能否把图画对,还要考察它能否理解一个世界。
- 也有反对观点认为,生成整个 3D 世界消耗大量 token,成本过高;同时,Three.js 生成只能证明模型在 Three.js 代码上训练得不错,不能证明它真正理解空间与物理。
- 支持者反驳称,将抽象、含义模糊的文学文本转化为 3D 动画,模型需要同时处理空间关系、物理规律、物体常识以及图形学中的数学问题,不能简单等同于“会写 Three.js”。
- 另一讨论聚焦空间推理的本质:有观点认为无论处理“石头旁边”还是“数组里面”,模型都是根据上下文逐 token 生成并完成推理。若如此,Opus 5 展示的内容可能是通用推理能力向三维世界的自然延伸。
