OpenRouter榜单信用贬值:流水、考卷与圣杯背后的定价权博弈

2026/10/07 12:35阅读量 6

文章指出OpenRouter等主流AI榜单存在严重失真,其调用量数据主要反映价格战而非模型实力,且用户结构以美国开发者为主,不具备全球代表性。同时,第三方评测机构如Artificial Analysis的考纲偏向美国职场需求,且频繁调整版本导致历史数据不可比。随着支付巨头Stripe高价收购OpenRouter,榜单正从行业参考转变为商业营销工具,中国模型厂商面临定价权、情报权和准入权的缺失,亟需建立自主评价体系。

事件概述

当前全球大模型评价体系中,以OpenRouter为代表的API聚合商榜单、Artificial Analysis(AA)的智力评测榜以及ARC-AGI系列“圣杯”榜,正面临严重的信用危机。分析认为,这些榜单并非公正的市场度量衡,而是被商业利益、地域偏好和算法迭代所扭曲的工具。中国模型在这些榜单上虽占据调用量高位,但未能转化为相应的营收优势或话语权,反而陷入“替他人抬轿”的困境。

核心信息

1. OpenRouter榜单:流量伪装成实力的营销场

  • 本质是私人流水单:OpenRouter作为API聚合平台,不赚取模型差价,仅通过充值手续费盈利。2026年8月,支付巨头Stripe以超70亿美元收购OpenRouter,使其从单纯的聚合商变为支付基础设施的一部分,掌握了钱路口子。
  • 数据失真与地域偏差:
    • 样本局限:OpenRouter周调用量仅占全球总量的约2%,且用户结构中美国占47.17%,英语占82.87%,中文不足5%。这并非“全球投票”,而是以美国开发者为主的区域性数据。
    • 价格驱动排名:榜单前列常被低价或免费模型占据。例如,“太空兔”(Space Bunny)匿名上线期间凭借0.03倍积分的超低定价冲上榜首,随后官宣接入腾讯WorkBuddy并关闭免费入口,形成“匿名刷榜-官宣收钱”的标准流水线。冠军更替频繁,反映的是促销力度而非技术代差。
    • 统计口径漏洞:所谓“周榜”实为滚动7天窗口,数据随窗口滑动剧烈波动,同一模型在不同时间点抓取的数据差异巨大,无法真实反映长期趋势。

2. Artificial Analysis(AA)榜单:偏向美国职场的定制化考卷

  • 考纲脱离中国市场:AA v4.1版中权重最高的GDPval评测由OpenAI出题,侧重美国白领的真实工作任务(如咨询备忘录、专业图表)。而中国市场的核心痛点在于即时通讯、审批流及低成本人力替代,两者错位导致中国模型在通用能力上表现优异,但在该特定维度得分不高。
  • 规则频繁变动:2026年9月,AA在短时间内连续发布v4.2至v4.3.2多个版本,更换评测科目、调整权重甚至退役旧题。这种“换尺子”操作导致历史分数失去可比性,削弱了榜单的权威性。
  • 裁判独立性存疑:部分评测依赖AI自动评分器预测人类专家判断,且评分模型本身也在快速迭代,存在“亲戚当裁判”的风险。

3. ARC-AGI榜单:圣杯折旧与规则操控

  • 防刷机制失效:旨在测试模型“现场悟规律能力”的ARC-AGI系列,在2026年被前沿模型本体迅速攻破。GPT-6 Astra在标准口径下得分62.7%,而在允许使用OpenAI专有接口的Provider Adapter口径下高达99.9%。
  • 东道主定制规则:高分为依托于特定厂商的接口特性(如上下文压缩),使得不同厂商间的对比失去公平性。新版本的推出导致旧成绩作废,榜单的保质期大幅缩短。

值得关注

  • 三权旁落风险:中国模型在OpenRouter上消耗大量Token,但大部分收入流向美国平台;在AA榜单上因考纲偏科难以获得认可;在ARC榜单上受制于美国厂商的接口规则。这反映出中国在AI领域的定价权、情报权和准入权正在流失。
  • 未来观察点:
    1. AA是否再次进行大规模版本更新或规则调整。
    2. Stripe整合OpenRouter后,榜单是否进一步演变为支付入口的商业工具。
    3. “匿名刷榜”模式是否成为行业标配。
    4. 类似“太空兔”的短期折扣结束后,市场回归常态的价格体系变化。

结论:榜单的权威源于信任,而信任正被商业玩法挤兑。对于行业参与者而言,应摒弃对单一排名的迷信,转而关注长期趋势、具体版本号下的数据对比以及真实的单位任务成本。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。