StartLux发布开源决策模型StartLux-Decision:多项基准超越Jev,支持毫秒级多任务判断

2026/10/04 16:32阅读量 5

9月30日,StartLux(原点星辉)推出开源决策模型StartLux-Decision,提供0.8B至27B五档版本。在Decision Index 0.2.1评测中,27B版本得分63.88,38项基准中有31项高于TypeSafe AI的Jev 1.13;在上海AI实验室采用的七项测试中,其平均准确率达91.82%,同样优于Jev。该模型支持单次请求完成多个判断,4B版本在H200上三问题平均耗时仅26毫秒,旨在通过专用决策模型与大模型协同,提升智能体执行效率。

事件概述

2026年9月30日,上海人工智能公司StartLux(原点星辉)正式发布开源决策模型 StartLux-Decision。该模型一次性推出 0.8B、2B、4B、9B、27B 五个参数量级版本,旨在解决智能体在执行任务时因等待长文本生成而产生的延迟问题。StartLux利用自建的Auto Research研发管线,在3天内完成了模型的迭代与验证。

核心性能表现

  • 基准测试领先:

    • 在独立的 Decision Index 0.2.1 评测中,StartLux-Decision-27B 获得综合得分 63.88,比竞品 Jev 1.13(57.91分)高出5.97分。在包含的38项基准中,有31项得分高于Jev 1.13。
    • 在 上海人工智能实验室(Intern-Decision) 采用的七项评测中,27B版本平均准确率达到 91.82%,高于Jev 1.13的88.74%和Intern-Decision-4B的90.02%。
    • 在公开JevBench测试中,27B版本答对208/231题,比Jev多答对9题;在Hard子集的111道难题中,少错8题。
  • 极速响应能力:

    • 模型直接输出选择及概率,无需生成回答文本。在单卡H200、BF16精度的短请求测试中,4B版本一次回答三个问题的平均耗时仅为26毫秒(启用CUDA Graph后),0.8B和2B版本分别为12.2毫秒和15.5毫秒。
    • 相比同类参考,StartLux-Decision通过快速线性注意力算子和合并前向计算,显著减少了重复调用开销。
  • 多规格覆盖:

    • 所有版本均提供原始权重及面向llama.cpp的GGUF文件(含BF16、Q8_0、Q4_K_M三种量化格式),支持本地部署。较小规格模型(0.8B-9B)在各自尺寸榜单中均取得最高分或接近榜首的成绩。

应用场景与技术特性

  • 多任务并行判断:
    StartLux-Decision支持选择题、是非题和等级评分,允许在一次请求中同时处理多个判断。例如在客服工单场景中,可同时判断“交给哪个团队”、“是否需要紧急处理”及“影响严重程度”,无需逐个生成回答。

  • 连续操作与游戏交互:

    • 网页操作: 在购物筛选和办公协作演示中,模型每步需回答“下一步操作哪个控件”和“任务是否完成”,系统根据选择执行操作并反馈状态,形成闭环。
    • 游戏环境: 在Mario、StarCraft II、DOOM等游戏中,模型用于选择移动、攻击或建造策略。例如在StarCraft II中,模型成功为人族机器人制定策略并战胜内置Hard难度AI。
  • 大模型协同机制:
    模型返回每个候选项的概率,为智能体提供了分流接口:在常规场景直接执行决策;在状态不充分或高风险操作时,可交由大模型分析或人工确认。这种分工有助于降低整体延迟并提高可靠性。

值得关注的数据细节

  • 能力分布差异: 尽管总分领先,但在“知识与推理”领域,StartLux-Decision-27B(44.3分)略低于Jev 1.13(51.4分)。其在语言理解、检索分类、工具自动化等领域优势明显,分别高出Jev 12.5、11.4和7.1分。
  • 评测说明: 上述成绩基于团队自测及特定硬件环境(如H200),不同硬件和服务栈下的时延数据不可直接横向对比。Decision Index分数经过随机基线校正,不代表原始准确率。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。