Seedance 2.5 之后,AI 视频进入 Harness 时代:模型越强,越需要好马具
2026/08/10 17:48阅读量 2
Seedance 2.5 将视频生成上限提升至 50 个参考素材与 30 秒直出,但复杂创作仍卡在素材管理和局部修改环节。LibTV 围绕 Seedance 2.5 推出 Harness 工作流,通过自动参考匹配、分镜生成、局部重拍和镜头合成,把模型能力转化为可迭代、可交付的成片流程。
事件概述
AI 视频正从能力展示进入实际生产环节。近期 AI 短剧角色广告报价引发讨论,而《太平年》在第 31 届白玉兰奖获得五项大奖,其制作中已有 AI 参与前期、拍摄和后期,部分 AI 镜头效率比传统 CG 提升 3 至 10 倍。
视频生成模型 Seedance 2.5 支持最多 50 个图片、视频和音频参考,可直出 30 秒视频,在指令理解和精准编辑上表现突出。但素材一多,角色与场景对应、局部修改和长片一致性成为新的瓶颈。LibTV 围绕 Seedance 2.5 做了一套 Harness,覆盖参考拆解、素材组织、片段修改和镜头合成等环节。
核心能力
- AutoLink:读取剧本后自动识别角色、场景和道具,并从画布中匹配素材填入提示词,替代手动查找和填充。
- 多镜头拆解:没有完整素材时,可自行生成锚点画面并转为视频片段,再按音乐节奏快速剪辑成片。
- 局部修改:对指定镜头或时间段重新生成并替换回原片,避免整条视频重抽。
- 拉片与再生:先拆解参考视频的风格、关键帧、运镜、节奏和声音,形成可调用的素材组,再据此生成新片段。
- 锚点图一致性:确认一张锚点图后,相关镜头沿用同一人物和视觉设定;批量调整画风、合成 20 多个镜头时仍能保持角色一致。
实测结果
- 同一 Prompt 下,Seedance 2.0 仅生成 15 秒,镜头变化和完成度有限;Seedance 2.5 可生成 30 秒,包含多机位切换和结尾大场面,首次生成已接近可用。
- 用简单需求生成 3C 广告灵感片时,LibTV 在未提供额外素材的情况下自行生成锚点画面、镜头并跟随音乐完成快切。
- 情绪类美妆广告测试中,LibTV 会先确认人物、情绪和叙事方向,再输出分镜、旁白和音乐;不满意的镜头可直接定位重做,成片整体情绪连贯。
- 88 秒动画短片共 20 多个镜头,人物三视图和场景图配合剧本自动拆分为分镜、锚点图和视频片段;需要统一画风时,Agent 能找到所有相关镜头批量修改。
- 4 分 41 秒长视频仍能组织起来,但重复画面和连续性问题更明显;长视频现阶段更像可展开、可拆分、可持续修改的工作区,而非一次生成即成片。
值得关注
文章认为,模型能力越强,越需要一套可靠的 Harness(马具)来承接素材管理、错误回退和局部修改等工程环节。类似地,AI 编程领域 Coding Agent 的体验提升,很大程度也来自外围 Harness 而非单纯模型换代。当底层模型越来越强、越来越便宜,视频产品的价值要体现在模型之外的工程化工作流上;这套素材组织和修改机制在下一代模型上仍可复用。
