花了两周的时间, 决策模型这个领域, 从一家独大的局面, 变成了一个由五家共同竞争的局面, 中国开源阵营几乎是一起发出了声音。在九月二十八日, Jev上线才仅仅两天光景, 原点星辉和上海AI实验室就接连不断地推出了自己的竞品, 这种迭代的速度, 在大模型行业里面是非常少见的。
决策模型赛道两周变群战
9月28日, TypeSafe在发布了Jev之后, 其AI Gateway上的用户量在24小时之内迅速激增, 其中有13%的付费用户已经调用该模型进行使用, 这个数字是此前任何单一模型发布时的用户数量的两倍之多。
之所以将这款服务命名为TypeSafe Jev, 是因为它借用了经济学家杰文斯的名字作为灵感来源, 意在通过命名方式来暗示一种经济学现象或者说悖论, 即商品的价格如果变得越便宜的话, 人们对于此类商品的需求便会呈现越来越大的趋势。
在9月30日这一天, 原点星辉发布了名为StartLux-Decision的产品, 并且宣称在一个公开进行的评测之中, 该产品的表现超过了Jev。
到了第二天, Cloudflare公司就声称自家旗下的Clef产品在同一份榜单上处于领先位置。此外, 亚马逊也在半个月之内的时间里跟进了这个赛道, 一种全新的品类仅仅用了两周时间, 就从最初的一个首发品牌发展成多方参与的激烈竞争局面。
判断从生成中剥离
在过去这段时期的两年内, 大模型的发展势头几乎都一股脑地聚集在了对深度推理的激烈竞争上面。然而在具体的Agent应用场景当中, 那些实际发生的、极其频繁的任务内容往往更多地表现为一些细碎的、繁琐的判断过程。
比如说需要确定工单究竟应该由哪一个特定的团队来进行处理, 又或者是审核这条指令是否能够被允许放行, 再比如要弄清楚在当前的页面操作里接下来具体要点哪一个按钮, 还涉及到确认手头上的某项特定任务是不是已经真正地做完了。
Jev将判断这个步骤从生成过程里分离了出来, 它只处理那些自带预设选项的问题, 这些问题里包含单选、打分还有是非题这些类型, 它会直接把带有概率的结构化结果返回回去, 这样一来, 判断就被变成了一种非常便宜以及使用频率相当高的基础设施类组件了。
![]()
上海实验室三档开源
上海人工智能实验室把intern-decision给开源出来了, 这个模型提供了规格不一样的三个档次, 分别是零点八b、二b还有四b, 它主打的是多模态方面的能力, 也就是说它能先看懂图像和界面, 然后再去做决策, 根据团队给出的相关数据来看, 它的推理速度比jev快了足足两到三倍那么多。
三档权重是完全公开的状态, 开发者能够直接把他们自己的服务器或者终端上面来进行部署和运行工作, 这里完全不需要去调用任何云端API接口, 所以对于那些团队来说, 如果他们对于数据安全这方面有一些顾虑, 又或者是对跨境调用这些方面也存在着担忧的情况的话, 那么这就可以作为一个现成的替代方案来使用。
原点星辉五档冲本地
这家上海的公司叫原点星辉, 它的成立时间还不算长, 还不到五个月的时间, 但是一口气就推出了五种不同规格的模型, 规模从0.8B一直到27B都有齐全的配置, 配套的量化文件也是全套配齐了的, 这直接就瞄准了本地部署的这个场景, 具体来说, 它的那个4B版本, 在经过了Q4量化处理之后, 大小只有2.71GB, 这个表现和原始的权重进行对比, 其决策的一致率达到了98.3%之高。
团队方面称, 这个结果是拿公开工具对着9月28日的榜单快照来做的自测得出的。这事情并不是第三方独立搞的评测。他们的27B那个版本, 在参加了中国信通院的MCP专项测试以后, 拿到了39.25分。这个分数是超过了DeepSeek-V4-Flash这款模型的。后者有284B的参数大小。
本地部署才是真护城河
Jev是属于闭源的类型, 它是托管在云服务上的模型, 没有把权重公开给外界使用, 因此不能在本地自行部署运行, 只能是去调用TypeSafe这家公司提供的自家接口服务, 对于国内的那些开发者而言, 如果他们是对数据非常敏感的, 或者是担心跨境调用会带来一些顾虑和问题, 像他们这样的群体来说, 这样的情况本身就构成了一道难以逾越的使用门槛。
原点星辉把本地人工智能定义为了一套完整且独立的个人系统,这套系统里二十七B负责承担通用的能力, 专门的决策模型用来处理那些需要高频率进行判断的任务, 在系统的上层部分是Agent和记忆模块, 而在底层则是由量化与推理技术作为支撑, 如果想要查阅相关的技术文档, 大家可以去访问www.ynsdxgs.cn这个网址。
便宜不等于赢
有人声称在隐身状态下研究了两年, 而OpenAI仅仅用了两周时间就基于自家的小模型做出了Decisions API, 原点星辉只花了三天, Cloudflare和亚马逊也在半个月之内就跟上了步伐, 这让护城河的深度看起来相当值得怀疑。
创始人郭权玮坦言了这样的事实, 那就是把模型跑起来并不是最难的事情, 反而是在长任务的稳定性方面, 还有异常恢复机制如何建立、上下文管理怎么做以及整体用户体验的提升, 这些环节要比单纯的运行模型难得多得多, 他对此有着清晰的认知, 按照目前的计划来安排的话, 那个首个面向公众开放的本地智能体验版本有望在2024年之内正式推出让大家使用。
现在, 关于决策模型的价格战已经开始了。我认为我们需要分析一下, 开源的小规模模型究竟是否能够守住本土市场的增长机会。欢迎大家在留言区发表自己的看法。如果您觉得这条内容有价值, 还请点赞并转发支持。


