实测讯飞星火X2.5:从创意交互到复杂研报,验证国产算力全链路交付能力
2026/09/10 08:42阅读量 3
讯飞发布参数为293B-A30B的MoE大模型星火X2.5,重点强化代码生成与智能体(Agent)能力。实测显示,该模型在3D粒子交互网页开发、61页财报数据提取与分析、以及基于多模态输入的游戏官网搭建等场景中表现优异,具备处理复杂任务及自我纠错的能力。文章指出,星火X2.5依托全国产算力平台实现从训练到推理的全链路闭环,标志着AI应用正从单纯的问答交互向稳定交付阶段演进。
事件概述
讯飞正式推出参数规模为293B-A30B的MoE大模型星火X2.5。此前,讯飞已开源了4B和1.7B两款端侧模型,均支持原生100万Token上下文窗口,并在社区引发广泛关注。此次发布的星火X2.5旨在进一步提升代码编写、智能体(Agent)协作能力,并覆盖200余种语言。目前该模型已在讯飞开放平台上线,API原生支持Anthropic Responses协议,可快速接入Codex、OpenClaw等第三方框架。
核心实测表现
测试围绕创意落地、复杂数据处理及整站设计三个维度展开,验证模型的实际交付能力:
- 创意交互开发:通过自然语言指令,模型成功生成包含手势识别功能的3D粒子交互网页。用户可通过握拳、比划数字等手势,控制粒子聚散形成“圆月”、“中秋快乐”等图案,并附带简单的互动游戏逻辑,展示了其在前端代码生成与视觉逻辑结合上的高完成度。
- 复杂文档分析与纠错:
- 财报拆解:在处理英伟达Q2财报(61页)时,模型在30分钟内提取关键营收利润数据,生成图表及投研风险简报,数值准确且结构清晰。
- 科研辅助与自检:在整合Nature/Science论文及模拟问卷数据撰写实证初稿时,模型不仅完成了数据分析,还主动指出了数据来源真实性存疑、样本量不足及未控制变量等潜在问题,展现了批判性思维与自我校验能力。
- 非结构化数据处理:面对包含错误数值的Excel截图混合文本,模型成功识别出数据Bug并输出可视化PDF报告,证明了其对非标准输入源的鲁棒性。
- 沉浸式网站构建:基于《堕神余烬》游戏的黑暗奇幻世界观Prompt,模型直接生成了包含导航、海报、Boss专题及合规组件的完整官网代码,将世界观设定与页面布局深度融合,无需额外设计师介入即可达到上线标准。
行业洞察:国产算力与Agent交付闭环
本次测试反映了AI行业两大趋势的转变:
- 从“聊天”到“交付”:随着OpenClaw等Harness Engineering框架的兴起,AI Agent不再局限于对话,而是要求能够独立调用工具、持续执行任务直至结果交付。星火X2.5将代码与智能体能力前置,正是为了适应这一从“辅助思考”到“动手干活”的需求升级。
- 全国产算力的全链路价值:相比仅做推理适配的方案,讯飞构建了从模型训练、强化学习、持续迭代到推理部署的全国产算力闭环。据科大讯飞披露,其MoE模型在国产算力平台上的训练效率已从初期的30%提升至93%。这种全链路打通使得模型能根据实际应用场景中的新问题快速反馈至训练端进行迭代,对于即将大规模普及的Agent应用而言,这种可持续运转的闭环比单次跑通更为关键。
随着国务院提出2027年智能终端及智能体应用普及率超70%的目标,国产算力正从备用选项转变为核心基础设施,而星火X2.5的发布被视为这一转型期的代表性产品。
