腾讯副总裁林松涛:意图正在代替入口,Agent需要一颗「小脑」
WAIC 2026期间,腾讯副总裁林松涛与Marvis负责人蔡建涛接受专访,阐述了桌面Agent产品Marvis的差异化思路:核心不在大模型“大脑”的推理能力,而在于通过端侧模型构建“小脑”与“反射神经”,实现系统级感知——提前理解用户设备内的文件、程序与行为。Marvis上线两天DAU超30万、七日留存约54%,且44%用户使用本地文件能力;团队当前最看重的指标是用户真实任务完成率,而非DAU或会话数,现阶段也不急于收费,计划通过B端合作与出海探索商业化。
事件概述
在WAIC 2026期间,腾讯副总裁林松涛、应用宝跨端业务及Marvis负责人蔡建涛接受了媒体采访,重点介绍了桌面Agent产品Marvis的定位、技术差异与商业化思路。
核心观点:意图代替入口,Agent需要系统级感知
林松涛指出,过去20年互联网是“小助手”逻辑,只做推荐(如推荐携程购票);而AI时代“意图正在代替入口”,用户只表达意愿(如“我要买票”),平台除了交付数字能力,还必须保障结果。
Marvis并非为了追赶Agent热潮而做,而是应用宝从“分发软件”走向“直接交付服务”的必然演进。过去用户需先下载App再使用服务,现在Agent可直接完成服务,开发者也从交付App变为通过CLI、MCP、SDK等提供后台能力。
差异化:端侧“小脑”与环境感知
蔡建涛将Agent拆分为感知、思考、规划和行动四个部分。他认为多数Agent具备思考、规划、行动能力,唯独缺少“感知”——即在用户授权后,通过本地模型提前理解设备中的文件、程序与行为历史。
相较通用Agent需全盘盲扫文件并逐张交给云端模型识别(带来高Token消耗与隐私风险),Marvis利用系统权限,在端侧提前识别文件类型与内容。林松涛比喻:大模型训练编程与长程推理是拼“大脑”,而Marvis做的端侧模型相当于“小脑”和“反射神经”,保证速度、执行效率与稳定。
这些端侧模型包括翻译小模型、多模态视觉模型等,由腾讯混元训练的中尺寸模型承担“小脑”角色,更小的模型类似“反射神经”。林松涛透露,中尺寸模型已可在配备8GB显存的Windows电脑及32GB内存的Mac上运行,配置门槛低于行业同类方案。
核心数据与用户行为
- Marvis于5月20日上线,两天后DAU超过30万,七日留存约54%。
- 44%的用户使用本地文件能力,28%管理电脑硬件,18%执行浏览器任务,16%使用应用能力,仅6%将其作为搜索工具。蔡建涛认为,这意味着用户对Marvis的定位(设备助理)有清晰认知,不将其视为豆包、元宝等通用聊天的替代品。
关键指标:真实任务完成率而非DAU
林松涛表示,团队最看重的不是日活或会话数,而是用户真实任务的实际完成数——即用户认为事情确实办成了。目前还难以准确标定满意度口径(如生成PPT后用户满意度),团队承认仍处于Agent发展的早期阶段。
商业化:现阶段不收费,探索出海与B端
Marvis目前每天向用户赠送免费Token。林松涛称现阶段还不是谋求收费的时候,国内Token成本高昂且用户付费习惯尚未形成;免费额度是为了让用户完成一次真正尝试。
未来可能的路径包括:调整免费额度、推进B端合作,以及与微软、英特尔共同探索出海。海外用户为能力付费的基础与国内不同,是更看重的方向。
生态与扩展
- Skill广场:将技术概念(Skill、MCP、CLI)隐藏在背后,只让用户描述需求,目前渗透率约37%。团队计划推出“人才市场”,由开发者提供虚拟角色(如电脑管家),用户可像雇佣人才一样选择。
- 吐司(Toast):一个可通过自然语言对话生成App的产品,在供给侧创造增量。林松涛认为vibe coding时代“再小的需求也值得一个应用”,但吐司与Marvis未来存在整合可能。
结语
桌面Agent基础能力正被大模型拉平,差异取决于两个问题:Agent有多了解用户环境,以及当它说任务完成时事情是否真的完成了。Marvis将赌注押在“感知”与任务真实完成率上,这条路需要深入操作系统、降低端侧运行成本,并长期打磨可靠性。
