新浪科技 股票

AI参与“造AI”? StartLux 3天完成决策模型研发与验证

市场资讯 10.02 18:27

(来源:观察者网)

近日,上海人工智能企业StartLux(原点星辉)发布专用决策模型StartLux-Decision,并开放代码与模型权重。

据团队介绍,完成StartLux-Decision的研发与验证全程仅用3天,支撑这一速度的,是该公司正在建设的Auto Research方法。本次首批推出0.8B、2B、4B、9B、27B五档版本。

38项基准中31项超越Jev

在StartLux公布的测评数据显示,在独立的Decision

Index 0.2.1评测中,StartLux-Decision-27B得分63.88,高于Jev 1.13的57.91;在38项基准中,有31项得分更高。对照采用2026年9月28日的公开榜单快照。

另一组参照,来自上海人工智能实验室发布Intern-Decision时采用的七项评测组合。在该组合中,StartLux-Decision的27B版本平均准确率为91.82%,高于Jev的88.74%和Intern-Decision-4B的90.02%。

性能方面,在单张H200、BF16精度和短请求条件下,4B版本一次回答三个问题平均耗时26毫秒,0.8B与2B版本分别为12.2毫秒和15.5毫秒。测试通过本地HTTP进行,并启用快速计算内核与CUDA Graphs,测量的是请求响应时间。

让AI参与“造AI”

据团队介绍,决策模型瞄准的是智能体执行任务时大量重复出现的判断:下一步点哪个按钮、调用哪个工具、当前任务是否完成。这些问题的候选项往往已经明确,但每一步等待仍会累积,影响整体执行效率。

StartLux-Decision接收当前状态和候选项,支持选择题、是非题与等级评分。对于常规请求,它可以通过一次前向计算返回多个问题的判断及选项概率,无需逐字生成回答文本。

例如,同一条客服工单可以同时对应三个问题:应交给哪个团队、是否需要当天处理、影响程度如何。执行程序拿到结构化结果后,可以继续分流或操作;需要撰写回复、展开复杂规划时,则由通用模型接手。

让这套模型跑起来的,是StartLux正在建设的RSI(递归式自我改进)体系中的Auto Research环节。据团队介绍,它让AI参与“假设—实验—验证—新假设”的循环:分析上一轮失败、构造数据、执行训练与评测,再提出下一轮值得尝试的改进。在这一循环中,研究目标、评价标准和关键取舍仍由人类研究员把关。AI承担更多实验执行和分析工作,研究员则依据实际结果判断改动是否有效。

在此基础上,StartLux希望进一步提升AI提出假设、设计实验和验证改进的能力,使“改进AI”的能力本身也持续提高。此次StartLux-Decision的研发,是这套体系中Auto Research环节的又一次具体实践。

演示、开源与后续检验

在应用演示中,StartLux-Decision被接入模拟网店,完成商品筛选和下单;在《星际争霸II》中,为人族机器人选择建造目标、兵种优先级与攻防策略。模型提供决策,页面操作和单位控制由执行框架或脚本完成。

目前,StartLux已公开该决策模型的权重、相关代码和评测结果。Auto Research则仍作为公司内部的研发环节运行,此次对外发布的是这一流程产出的模型成果。

现有测试主要反映模型在公开基准和受控环境中的表现。它在更复杂任务中能否持续作出可靠判断,以及自动研究方法能否在更多项目中稳定带来效率提升,仍需通过后续实验和实际应用检验。

按照StartLux的技术路线,决策模型将与通用模型、智能体及运行时等模块协同,服务完整的本地智能解决方案。此次发布既为开发者提供了可使用的决策组件,也展示了AI参与模型研发的一次具体实践。

加载中...