AI说不出的随机数,成了鉴别套壳大模型最好的照妖镜
布拉格经济大学研究员提出利用大模型生成随机数的固有偏差作为“行为指纹”,可低成本鉴别API中转站偷换模型的套壳行为。仅需对模型提问少量随机数请求,即可通过概率分布相似度锁定模型身份,准确率媲美复杂方法。实测发现OpenRouter上售卖的Palmyra X5与通义千问Qwen3-235B指纹高度相似,存在套壳嫌疑。
事件概述
布拉格经济大学研究员托马什·布鲁克纳在7月11日发表的论文《One Token Is Enough》中,提出利用大模型生成随机数时的固有偏好偏差作为“行为指纹”,以低成本鉴别API中转站偷换模型的套壳行为。该方法仅需少量随机数请求,即可通过模型输出的概率分布锁定其真实身份。
核心信息
1. 大模型生成随机数存在稳定偏好
研究员对165个模型各问30次“生成1-100的随机数”,发现所有模型的输出分布远非均匀,且每个模型有稳定偏好:GPT-4o偏爱42、37、57;Claude Sonnet 5偏爱47;Qwen3-Max 30次输出全是42。该特性在随机颜色、随机动物等10类随机任务中均成立,偏好特征稳定可重复。
2. 行为指纹可低成本鉴别套壳模型
针对API中转站普遍偷换高价模型牟利的痛点,研究员将大模型的稳定随机偏好作为独一无二的“行为指纹”。探测请求可灵活改写为普通对话,不易被检测。对比官方参考指纹计算Jensen-Shannon散度(衡量概率分布差异的指标),即可完成验证。仅用120条请求(8个探测单元)时错误率低至10.6%,准确性接近复杂方法,成本极低。
3. 实测发现疑似套壳案例
使用该方法检测后,发现OpenRouter上以自研旗舰身份售卖的Palmyra X5,其行为指纹与通义千问Qwen3-235B的相似度为0.141,而同一模型在不同供应商部署的正常波动约为0.140,两者几乎一致,存在高度套壳嫌疑。研究数据和代码已完全公开。
4. AI无法生成真随机的本质原因
大模型无法生成真随机,因为训练数据包含了人类文化偏好(如《银河系漫游指南》中的42、宗教中的7等)。模型在输出“随机”内容时,只会选出“最符合随机认知”的答案。参数和包装可以修改,但训练形成的概率偏好会从微小输出中暴露,无法掩盖。
值得关注
该方法的扩展性极强,不仅限于随机数,还可扩展至随机颜色、动物等语义层面任务。它为解决套壳模型问题提供了一种简单、准确、不易被逃逸的解决方案,对API中转站生态有重要监督意义。
