阶跃Step 5 Preview:27B激活参数登顶开源榜,Agent能力与性价比双突破
2026/09/21 11:46阅读量 4
阶跃星辰发布旗舰基座模型Step 5 Preview,采用MoE架构,总参数量600B但激活参数仅27B,支持1M上下文。该模型在Artificial Analysis评测中得分44分,位列全球开源第二,且单任务成本仅为Opus 5的12.5%。实测显示其在3D资产生成、游戏开发及多轮工具调用等Agent场景中表现优异,具备较强的长程规划与自我修正能力。
事件概述
阶跃星辰(StepFun)于2026年9月21日无预兆发布最新一代旗舰基座模型 Step 5 Preview。该模型凭借极高的性能价格比和强大的Agent能力,迅速登上 Artificial Analysis 全球开源模型榜单前列,引发行业关注。
核心信息与技术亮点
- 架构与参数:采用混合专家(MoE)架构,总参数量为 600B,但激活参数仅为 27B。这种设计旨在控制推理成本的同时保持高算力效率。
- 上下文窗口:支持高达 1M (一百万) Token 的上下文长度,适合处理长文档和复杂的多轮交互任务。
- 评测成绩:在 Artificial Analysis 的最新评测中,Step 5 Preview 获得 44分,排名全球开源模型 Top 2。值得注意的是,达到这一分数的大多数其他模型均为万亿参数级别。
- 成本优势:定价极具竞争力,百万输入价格为1美元,百万输出价格为2.7美元。其单个任务成本仅为 Anthropic Opus 5 的 12.5%。在 Intelligence Index 与单任务成本的权衡图中,Step 5 Preview 位于“帕累托前沿”,实现了性能与成本的最佳平衡。
实测表现:Agent能力显著提升
通过对 Blender 3D建模、游戏开发及网页构建等复杂任务的实测,Step 5 Preview 展现出超越前代 Flash 系列模型的 Agent 能力:
- 3D资产生成:通过 API 操控 Blender,模型能独立完成从建模到渲染视频的全过程,甚至自动添加 VHS 录像质感、镜头噪点及音效等后期处理细节,无需人工干预即可交付可用成果。
- 游戏开发:能够基于提示词快速生成包含赛道、赛车、人机对手及实时排名的完整赛车游戏 Demo,并配备发动机音效,逻辑结构完整。
- 代码与UI构建:在霓虹跑酷小游戏和写作网站开发中,模型不仅能实现基础功能,还能自动补全 Prompt 中未提及的细节(如视觉层次、边框反馈),审美在线,基本可直接使用。虽偶有模块溢出 Bug,但通常经过两三轮迭代修正后即可达到可用状态。
- 长程记忆与规划:在几十轮工具调用后,模型仍能保持目标清晰,通过 Long-horizon RL(长视野强化学习)和 Context Compaction(上下文压缩)技术,解决了传统模型在长链路任务中容易遗忘初始指令的问题。
技术路线解析:Narrow but Deep
Step 5 Preview 并未单纯追求参数规模的无限扩张,而是采取了 “窄而深”(Narrow but Deep) 的网络设计理念:
- 深层Transformer:构建 92层 Transformer 网络,在控制激活规模的前提下,增加信息连续变换的深度。这为复杂任务中的多跳依赖(multi-hop dependencies)提供了更长的推理路径,使前期获取的信息能在后续步骤中有效发挥作用。
- 稀疏化优化:针对长上下文带来的计算爆炸问题,团队引入了 Sparse MoE、Hybrid Sparse 和 Sparse GQA 等技术进行稀疏化处理。
- 软硬件协同:通过底层算子和数据访问优化,确保理论上的稀疏化能转化为实际的 GPU 吞吐提升,避免索引和访存开销抵消节省的算力。
行业影响
随着大模型竞争进入新阶段,头部模型间的差距正在缩小(Stanford 2026 AI Index 数据显示顶尖模型 Elo 差距已压缩至25以内)。Step 5 Preview 的发布标志着阶跃星辰重新杀回全球第一梯队,其策略聚焦于将 Frontier 级能力以大众可承受的成本落地,特别是在 Agent 自动化工作流领域,展现了从“回答者”向“执行者”转变的技术趋势。
