大模型公司流行「匿名公测」:Ox Alpha 掀起新一轮身份猜测

2026/08/25 13:14阅读量 3

8月20日,OpenRouter上出现匿名模型Ox Alpha,凭免费、长上下文和工具调用能力引发开发者关注,社区根据技术特征猜测其与智谱GLM-5.x系列相关。从阿里HappyHorse到小米Hunter Alpha,中国团队越来越熟练地借匿名测试获取真实反馈,但开发者也需要自行承担身份识别、能力评估和数据处理等不确定性。

事件概述

8月20日,OpenRouter上出现一个名为 Ox Alpha 的匿名模型,提供100万token上下文、支持图片和视频输入、可调用工具,并免费开放。随后,它被接入 OpenCode、Hermes 等编程 Agent,开发者开始用它修代码、跑软件工程基准,也有人通过 tokenizer、报错信息等线索猜测其出处。目前社区最流行的判断是它与智谱 GLM-5.x 系列关系密切,但智谱官方尚未认领。

核心信息

  • Ox Alpha 并非孤例。过去数月,OpenRouter 已有多款匿名「Alpha」模型上线:2月的 Pony Alpha 后被标注为 GLM-5 早期测试版本;3月的 Hunter Alpha 被小米认领为 MiMo-V2-Pro 早期版本;4月的 Elephant Alpha 揭晓为蚂蚁 Inclusion AI 的 Ling-2.6-flash。更早之前,阿里的 HappyHorse 匿名登顶视频模型盲测榜单,随后由阿里确认来自 ATH 创新团队。
  • 匿名测试是 OpenRouter 的长期机制,OpenAI、xAI、NVIDIA 等团队都曾使用。中国团队正在把海外开发者平台作为新品首发的常用渠道,以神秘代号配合免费、长上下文、Agent 等关键词,降低开发者尝试门槛。
  • 开发者对 Ox Alpha 的能力评价存在分歧。社区流传的 DeepSWE 测试中,它在10个软件工程任务里通过约8个,但该样本量过小;更大规模的社区复测结果约63%。另有研究者在 INDUCTION 基准上测试,其成绩落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略高于 Gemini 3.7 Flash;测试者调用551次API才获得87个可评估结果,期间多次遇到空回答和接口错误。这些结果并不矛盾——模型能力、工具调用、接入链路都会影响实际表现。
  • 匿名测试带来真实反馈的同时,也存在信息不对称。OpenRouter 注明提示词和输出会由上游提供商保留但不用于训练,OpenCode 则强调零数据留存,两者口径并不一致。Reddit 上有开发者指出,匿名模型难以进入企业严肃评估流程,合规审批周期可能超过模型在线时间。

值得关注

匿名发布让模型摆脱品牌预设,用户可以先看结果再谈身份,厂商也能借此获得真实使用数据。但对用户而言,身份猜测、能力判断、数据政策核对和服务稳定性风险,都转嫁到了自己身上。模型能否在真实代码库中稳定工作,本身就是产品能力的一部分。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。