实测Jev:判断力中游但极速低成本,TypeSafe押注AI机器间交互

2026/09/20 12:31阅读量 6

TypeSafe发布首款“System One”模型Jev,该模型不生成文本,仅返回结构化判断与概率。实测显示其50道客服题准确率约64%,虽低于顶级模型,但响应速度(0.73秒/题)和成本(0.002美元/50题)极具优势。创始人Diogo Almeida质疑通用大模型的聊天化交付模式,主张模型应服务于软件自动化决策,未来99%的AI交互可能发生在机器之间。

事件概述

TypeSafe于9月15日发布名为Jev的“System One Model”,这是一款专注于结构化判断而非文本生成的模型。它接收预定义状态和问题,直接返回选择、评分或真假判断及相应概率,旨在供程序直接调用。上线Vercel AI Gateway后24小时内,近13%的付费团队试用,创下平台历史纪录。

核心信息

1. 性能实测:速度与成本优势显著,准确率居中游

测试选取50条中文电商客服问题,要求模型判断紧急度、购买意向、处理类别和严重度。

  • 准确率:Jev完整准确率约为64%–65.2%(得分32–32.6分),在便宜小模型组中排名第二,略低于DeepSeek V4 Flash。相比强组模型如MiniMax M3(准确率约75%+),Jev少做对约5.4题。
  • 速度与成本:Jev每题响应时间约0.73–0.75秒,50题总成本约0.002美元,均为测试最低。相比之下,MiniMax M3多花0.0035美元,耗时1.8秒;DeepSeek V4 Flash耗时5.58秒,成本为Jev的2.5倍。
  • 结论:Jev并未在智能上碾压同级或更强模型,而是提供了“低延迟、低成本、接受一定误差”的取舍方案。

2. 技术特性:结构保证与概率校准

  • 架构:采用新模型架构、并行sampler及RLCD(用于校准决策的强化学习)训练方法。输出空间预先限定,确保不会出现Schema之外的类型错误,即官方所称的“零幻觉”仅指不生成非法选项或格式。
  • 阈值波动风险:测试发现部分失分源于数值卡在阈值附近(如人工标注2.00,Jev输出1.99)。重复测试中个别题目出现通过/失分交替现象,表明精确概率输出并不自动等同于业务规则可靠,开发者仍需处理阈值附近的波动。
  • 概率校准:TypeSafe致力于让概率成为软件可依赖的信号,若一批判断给出80%概率,长期看应有80%成立。Choice和Score附带概率分布及置信度,辅助程序决定自动执行、补充信息或转交人工。

3. 行业背景与理念转向

  • 团队背景:CEO Diogo Almeida是OpenAI InstructGPT研究论文作者之一,曾推动语言模型遵循人类意图。联合创始人Sasha Sheng(前Meta/Facebook)、CTO Erik Gafni等均有深厚工程与研究背景。
  • 核心理念:Almeida质疑“聊天模型超越人类却未见大规模自动化落地”。TypeSafe押注未来99%的AI交互发生在机器之间(如Agent路由、工具调用、结果验证),只有1%面向人。Jev是对通用大模型“聊天化”交付模式的反叛,主张将判断接口专门优化以服务于软件执行过程。
  • 市场情绪:Jev的热度部分源于团队履历及AI圈对“更高分数、更长上下文”发布模式的审美疲劳。TypeSafe提出“Build Prod, Not God”,强调构建可投入实际使用的产品而非追求模型神化。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。