Token经济迎来转折点:Agent从OpenClaw、Hermes到本地开源模型的进化路径

2026/08/21 19:26阅读量 3

文章复盘了硅谷“Token Maxing”从竞相烧钱到成本失控的转折,黄东旭以亲身经历说明如何从日耗数百美元转向本地开源模型+前沿模型的混合架构,将月账单降至两三百美元。OpenClaw、Hermes、Slock等Agent产品迭代反映出从单Agent到多Agent协同的进化,而Agentic Loop与A2A网络将推动Token消耗长期持续增长。

事件概述

去年年底,硅谷兴起“Token Maxing”风潮,科技公司竞相增加Token消耗以展示对AI的全力押注。今年年中,成本失控与虚假生产力让这一策略出现转折:Uber四个月烧穿全年AI预算,Meta为员工设定Token使用上限,企业开始关注如何更经济地使用Token。

核心信息

  • 从烧钱到成本优化:嘉宾黄东旭曾坚持“无脑用最强模型”,单日账单达三四百美元,用于构建分布式数据库等复杂项目。在DeepSeek V4、GLM-5.2等开源模型能力大幅提升后,他转向本地开源模型+前沿模型的混合架构,月成本降至两三百美元。本地运行的DeepSeek V4 Flash在Mac Studio上速度约30Token/s,接近API调用,而每月电费仅二三十美元,可放心用于重复性工作和大批量论文总结。

  • Agent产品快速迭代:OpenClaw由Peter一周内开发完成,以“local-first”和开源理念在极客圈走红,被视为个人助理型Agent的标杆,但因配置复杂、稳定性不足以及作者转向OpenAI而止步。Hermes由Nous Research团队打造,擅长将成功经验沉淀为Skill,绕开了记忆难题,并通过为模型厂商导流Token获得商业模式。Slock(后更名Raft)由Kimi CLI负责人钱宇超创立,让多个Agent在聊天频道中协同讨论,用于复杂代码审查时能比单模型One-shot发现更多问题,但Token消耗约为普通方式的10倍。

  • 长期消耗仍将增长:Agent内部依赖Agentic Loop持续调用模型和工具,其Token消耗比Chatbot时代高100倍以上。未来多Agent协同、A2A网络及更复杂的Agent Harness会进一步推高用量。经济学中的杰文斯悖论同样适用于此:Token价格每年下降约10倍,但总消耗量持续扩大,整体ROI未必受损。

值得关注

  • 开源模型本地部署解锁了新场景,让许多过去受限于API成本的批量任务变得可行。
  • 投资机会更可能出现在基础设施层,如可观测性(回答Token花在哪)、记忆与上下文管理、Agent Cloud等,而非容易被大模型升级直接碾压的C端应用。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。