中国开源模型成全球AI“度量衡”:从API输出转向基础底座赋能
沙特HUMAIN-M3、日本Rakuten AI 3.0及新加坡Qwen-SEA-LION等案例显示,海外机构正越来越多地基于MiniMax、DeepSeek和Qwen等中国开源模型进行本地化微调,而非从零预训练。这一趋势表明中国大模型已超越单纯的API服务,成为各国构建本土AI主权的上游基础设施。Hugging Face数据显示中国模型下载量首超美国,标志着其在全球AI生态中确立了新的能力基准与成本标准。
事件概述
近期,多个国际知名AI项目公开或间接确认使用中国开源大模型作为技术底座,标志着中国AI出海模式发生根本性转变:从输出应用层(App)和接口层(API),深入至基础模型层(Foundation Model)。沙特、日本、新加坡及美国科技巨头Meta均在不同程度上依赖中国模型架构完成本土化适配或能力补齐。
核心案例分析
1. 沙特 HUMAIN-M3:国家算力换时间
- 背景:2025年5月,沙特王储小萨勒曼宣布成立HUMAIN公司,旨在建立涵盖数据中心、云及模型的完整AI体系。
- 合作模式:沙特公共投资基金(PIF)提供资金、算力和阿拉伯语数据;中国公司MiniMax提供已完成基础训练的MiniMax-M3模型。
- 技术细节:HUMAIN-M3拥有4280亿总参数,激活230亿参数,使用超过1万亿阿拉伯语tokens进行继续训练(Continued Pre-training)。
- 成效:在七项阿拉伯语公开基准测试中,HUMAIN-M3平均分达89.37%,比未本地化的M3参考模型高出9个百分点。该模式使沙特节省了从零预训练所需的时间成本,并实现了数据主权和安全可控。
2. 日本 Rakuten AI 3.0:架构兼容性的渗透
- 现象:乐天发布的Rakuten AI 3.0虽强调为高性能日语模型,但其公开配置文件显示模型类为
DeepseekV3ForCausalLM,类型标识为deepseek_v3。 - 意义:这表明DeepSeek定义的架构和兼容方式已进入日本主流企业模型的技术路线,即便未直接复制权重,其技术栈已成为本土开发的基础选项。
3. 东南亚 Qwen 系列:多语言适配网络
- 案例:新加坡AI Singapore利用Qwen3-VL继续训练出Qwen-SEA-LION,适配缅甸、印尼、菲律宾、马来、泰米尔、泰、越南等七种语言;泰国CMKL大学基于Qwen3.5开发泰英双语模型MANGO。
- 覆盖范围:结合沙特的阿拉伯语、日本的日语案例,围绕中国模型架构的本地化实践已覆盖至少九种非中文语言。
4. 美国 Meta “牛油果计划”:顶级大厂的务实选择
- 动态:据彭博社报道,Meta在训练代号Avocado的新模型时,引入了Qwen、Gemma及OpenAI的gpt-oss等开放模型。
- 逻辑:对于拥有顶级研究团队的Meta而言,Qwen等模型无需成为最终产品,只要能以更低成本、更快速度补齐特定能力,即可进入其训练流程。
行业影响与结论
1. 成为全球AI的“度量衡”
过去,GPT和Claude定义了能力的上限;如今,中国开源模型(MiniMax, Qwen, DeepSeek, Kimi等)重新定义了行业的“及格线”。采购决策不仅考量智能程度,更关注单位能力的成本、是否支持本地部署以及是否允许客户继续训练。
2. 数据支撑趋势
根据Hugging Face数据,过去一年中国研发模型占平台下载量的41%,首次超过美国。仅Qwen家族衍生出的模型已超过11.3万个。虽然下载量不等于商业收入,但大规模的下载、微调和再训练行为证明中国开放模型已成为各国建设本土模型不可绕开的上游。
3. 战略价值:主权与抗风险
中国模型通过开源或开放权重的形式,填补了“从头预训练太贵”与“长期调用闭源模型受制于人”之间的空白。对于追求AI主权的国家而言,这种模式既保留了数据控制权,又规避了地缘政治下的制裁风险,形成了一种新的Token经济范式。
