StartLux推出开源决策模型,引领行业新潮流
通过更聚焦的阅读结构呈现文章主线、时间信息与延展入口,帮助访问者更轻松地完成完整阅读与继续浏览。
StartLux推出开源决策模型,引领行业新潮流
在9月30日,一款新的决策模型正式发布,并迅速赢得了广泛关注。该模型在Decision Index 0.2.1的38项测试中,取得了31项优于目前最佳模型Jev的成绩,综合得分为63.88,比Jev的57.91高出近6分,且完全开源。在实战中,与Jev进行国际象棋对弈时,该模型的反应速度与对手不相上下,最终以36局中赢得35局的优异表现胜出。这款模型出自新兴的上海AI公司StartLux(原点星辉),这家成立不到五个月的企业已经两次震撼行业:首次推出的StartLux-27B本地模型在工信部测试中表现超越284B的DeepSeek-V4-Flash,以约1/60的参数量几乎打平DeepSeek-V4-Pro。这一次,凭借StartLux-Decision的高综合评价,该模型成为全球最强的决策工具。StartLux还同时推出多个版本,包括0.8B、2B、4B、9B和27B,并支持本地部署的量化模型。
为了验证其实力,可以查看一局与Jev 1.13的国际象棋对局。双方在相同棋盘状态下进行,没有借助额外搜索,StartLux-Decision-27B成功将对方打败,同时表现出色,例如更低的平均损失和优异的最佳着法命中率。在36局对局中,它赢得了35局。
对于StartLux-Decision的整体表现,尤其是27B版本,在独立测评的Decision Index 0.2.1中,得分达到63.88,38项基准中有31项高过最新的Jev 1.13版本。在另一套七项测试中,StartLux-Decision-27B的平均准确率也达到了91.82%。需要强调的是,这些成绩是StartLux团队基于公开评测工具和相应快照完成的自测,而另外七项测试则由上海AI Lab Intern-Decision团队独立评测。 谈球吧在线直播
为什么Agent需要一个专责“判断”的模型?随着StartLux-Decision的受重视程度上升,这个问题愈发突出。StartLux-Decision在客服案例中展示出色表现,通过一次请求完成团队分流、处理时效和严重等级判断,展示了决策模型与常规生成模型的明显区别:它直接选择针对具体问题的解决方案,而不需要先生成自然语言。这种能力在Agent中更为显著,能够有效处理用户如“购买最便宜、免运费的8节装AA电池”的请求。
在购物场景中,系统综合过滤型号、数量、价格及配送条件,通过StartLux-Decision逐步判断并最终完成下单。此外,这种决策模式也同样适用于办公协作,能有效处理邀请团队成员加入Design团队并设置角色的任务。