资讯

基元律动发布模型NeoHorse,探索Harness驱动的RSI路径

雷峰网·2026/9/8 06:31:00🔗 原文

📋总体概括

基元律动(TokenRhythm)联合无问芯穹、清华、北大、阿里等机构发布首个Agent-Native模型NeoHorse-1,含4B和9B两版。公司由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办,其开源Routing Harness系统OpenSquilla的执行轨迹成为核心训练语料,配合在策略蒸馏等方法,将Agent使用工具、接收反馈、修正错误的经验内化为模型能力。在11项Agent基准评测中,4B版未加权平均分为同级最高,五项基准超越Qwen3.5-9B底座,并作为递归自我改进(RSI)的单轮工程验证。

关键信息

  • NeoHorse-1推出4B和9B两版,定位首个Agent-Native模型,由基元律动联合无问芯穹、清华、北大、阿里共同推出
  • 训练语料核心来自开源Routing Harness系统OpenSquilla产生的Agent执行轨迹,经完整性检查和目标完成、证据一致性、错误恢复等质量评估
  • 技术方法上利用路由信号估计任务能力需求、安排训练顺序,并结合Agent执行监督与在策略蒸馏更新模型
  • 评测覆盖11项Agent执行、工具交互、代码和指令遵循基准,4B版未加权平均分居同级最高,五项基准超过Qwen3.5-9B底座
  • 改善集中在流程清晰、反馈可观察、结果可验证的任务,复杂状态维护、长程调试等场景大模型仍占优

🔥犀利点评

把Routing Harness的执行轨迹反哺回模型训练,逻辑闭环漂亮——系统层经验下沉为模型能力,这是Agent基础设施公司最顺理成章的护城河。但要泼冷水:所谓RSI目前只是单轮工程验证,报告也承认复杂长程任务仍靠大模型兜底,4B赢的其实是边界清晰的评测题。轨迹质量决定模型上限,而轨迹来自自家Harness,既是优势也是自我强化的信息茧房,能否泛化到真实生产环境才是试金石。

本文由本站自动聚合,以下为原始来源:前往 雷峰网 阅读全文