2026-08-14 · AI 资讯
百灵团队联合AReno:打通单机本地智能体强化学习闭环

模型本地部署后的任务执行稳定性一直是行业痛点。近日,蚂蚁ASystem团队开发的AReno工具包与百灵大模型团队开展合作,成功在单机环境中实现了Agentic RL(强化学习)后训练闭环,有效解决了模型在工具调用与合规性方面的偏差。
本次实践选取了逻辑严密的井字棋作为最小验证任务,对Ling-3.0-tiny(7.9B参数,1.3B激活)模型进行针对性调优。通过将规则转化为Reward反馈机制并引入GSPO算法进行训练,模型不仅消除了非法动作,还在指令遵循稳定性上取得了显著飞跃。
该路径验证了一套可复现的轻量级后训练方法论,开发者无需大规模计算集群,即可在单机场景中实现模型在工具调用、领域指令遵循及业务逻辑上的专项提升。目前,Ling-3.0-tiny已在Hugging Face与魔搭社区提供多版本开源下载。
