ECCV 2026 MARS2 Workshop:多模态AI从“感知”迈向“商业推理”,钛动科技牵头Agentic Commerce研究
在ECCV 2026上,由钛动科技牵头的MARS2 Workshop聚焦“智能体商业(Agentic Commerce)”,探讨多模态AI如何理解营销视频并优化商业决策。挑战赛结果显示,当前模型在整体内容理解上表现良好,但在长视频时序推理和意图拆解上仍面临挑战,且小参数模型通过优化数据对齐和证据链工程可取得优于大模型的性价比。该活动标志着AI研究正从纯学术评测转向解决真实商业场景中的复杂推理问题。
事件概述
2026年9月8日至12日,欧洲计算机视觉顶会ECCV在瑞典马尔默举行。本届大会的一个显著趋势是学术界开始深入探讨“智能体商业(Agentic Commerce)”这一贴近现实世界的技术命题。其中,由钛动科技(Teads Technology)牵头举办的MARS2 Workshop(《大模型时代的多模态推理与慢思考:迈向System 2及以上》)成为焦点。该Workshop汇聚了来自牛津大学、MIT、伦敦玛丽女王大学等顶尖机构的研究者,旨在解决多模态AI在复杂商业链路中从“看见”到“想明白”的转化问题。
核心信息与技术发现
1. 挑战赛设计与赛况
MARS2同步举办了多模态AI挑战赛,基于钛动科技构建的高质量数据集M-CAR进行评测。该数据集包含3108支广告视频,覆盖30多种语言,被拆分为18198个语义片段。比赛设置三条赛道,分别对应多模态AI的三个核心能力层级:
- MAC(整体理解):判断整条视频的内容主旨。
- VTG(关键时刻定位):在长视频中精准找到影响用户决策的关键帧或片段。
- MDC(策略推理/营销意图):解读视频背后的营销逻辑和用户心理。
参赛限制与结果:
- 限制条件:为测试模型在有限算力下的潜力,规定MAC/MDC赛道模型参数量不超过14B,VTG赛道不超过8B,且必须使用开源权重。
- 冠军成绩:中国科学技术大学、南开大学等高校及字节跳动等企业团队参与激烈角逐。最终,The Boys团队在MAC赛道以86.67分夺冠,在MDC赛道以63.53分夺冠;Ya PTers团队在VTG赛道以62.27分夺冠。通用商用模型表现稳定,但专用模型在特定任务上优势明显。
2. 关键洞察:从System 1到System 2的跨越
- 能力边界显现:实验表明,AI在识别广告大致内容(System 1感知)方面已较为成熟,但在跨越多个片段梳理时序关系、追溯因果并进行商业判断(System 2推理)时,性能出现明显下滑。这揭示了当前多模态AI离真正参与复杂商业决策仍有距离。
- 性价比优化路线:消融实验显示,单纯增加参数量并非最优解。例如,VTG赛道中有团队通过引入跨模态“音频证据时间线”,将人声、音乐与画面时间轴对齐,使定位精度提升16.7分;而将参数量从4B扩展至8B反而导致分数微降(-0.2分)。这表明在算力受限情况下,优化多模态信息对齐比盲目扩大模型规模更有效。
- “证据链工程”落地思路:冠军方案普遍采用“Proposer-Critic”双模型验证机制。主模型生成初步答案后,由批判模型独立验证证据一致性,抑制幻觉输出。系统还根据视频长度动态分配Token资源,确保复杂问题有足够空间处理。这种“让AI拿着证据回答问题”的思路,为工业界提供了清晰的落地范式。
3. 产业背景与技术闭环
钛动科技凭借近十年服务全球10万+品牌出海的业务积累,构建了自研多模态模型“钛极(Tec-Chi)”。其问答推理模型Tec-Chi-Think-1.0-32B和内容理解模型Tec-Chi-VL-1.0-27B在SuperCLUE测评中均名列前茅。此外,其营销多智能体平台Navos已将AI能力嵌入市场洞察、内容生产及广告投放全流程。数据显示,2025年前三季度,钛动AI营销解决方案收入达1.16亿美元,同比增长68.5%,占总收入89.5%,净收入留存率高达132.5%。
值得关注
-
顶会角色转变:越来越多的头部科技公司(如NVIDIA、Meta、Apple及钛动科技)不再仅是论文贡献者,而是作为“议程设置者”直接下场定义顶会议题。这反映出AI技术重心正从实验室走向真实商业场景,企业急需解决一线痛点,而学术界寻求验证新算法的土壤,Workshop成为产学研高效对接的平台。
-
Agentic Commerce兴起:ECCV等传统视觉顶会开始关注Agent在商业交易链路中的作用,预示着多模态AI的未来竞争焦点将从单纯的图像/视频识别准确率,转向在跨语言、跨文化、多目标交织环境下的实际问题解决能力。
