ChengRang
EN

Agent Lightning 新增

AI 搜索研究 开源

微软亚洲研究院于 2026 年 10 月 7 日开源重建的智能体强化学习框架 v1.0,提出 Harnessed Agentic RL 范式:部署时用的那套 agent harness 直接参与训练,不必在训练框架里把智能体重写一遍。做法是在智能体与模型之间插一层 OpenAI 兼容的 LLM 代理,原有 harness 代码不改,只把模型端点指过去即可。全框架约 3500 行,由 API Gateway、Rollout Controller 与基于 verl 的 Customized Trainer 三部分组成;智能体以标准 Kubernetes 作业运行,不依赖付费沙箱服务;提出 Collocated Async RL 让 rollout 与模型更新共用同一批 GPU,端到端约为同步 RL 的两倍。基于 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B 的端到端实验只用约 6000 条训练样本,把 SWE-bench Verified 的 Pass@1 从 41.8% 提到 56.4%

强化学习 智能体训练 Harnessed Agentic RL Kubernetes 开源框架
访问 Agent Lightning 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Agent Lightning v1.0 是微软亚洲研究院在 2026 年 10 月 7 日开源重建的智能体强化学习框架,全框架约 3500 行代码。它提出并定义了一种叫 Harnessed Agentic RL 的训练范式:部署时用哪套 agent harness,训练时就让哪套 harness 直接参与强化学习,不必在训练框架里把智能体重写一遍。

要理解这件事的分量,得先看传统智能体强化学习的假设。verl、AReaL、slime 这些早期系统建立在这样一个前提上:训练框架拥有与环境的交互循环。在 ReAct 式循环里,模型产出动作、环境返回观察、观察被追加进上下文、模型再产出下一个动作,整条 rollout 能映射成一条连续的 token 轨迹。

真实世界的 harness 早就超出了这个假设。mini-SWE-agent、OpenHands、OpenCode、Claude Code、Codex 各有自己的上下文管理、工具协议、执行逻辑与依赖,通用智能体系统也一样。为训练把它们重建一遍代价高昂,而且重建出来的那个,行为未必与部署的那个一致。Agent Lightning 换了条路:在智能体与模型之间插一个 LLM 代理,智能体照原样跑,只要把原本调模型 API 的端点改指向这个代理,训练框架就能观察和记录它的模型调用。v1.0 把这个做法正式定义为 Harnessed Agentic RL。

核心功能

适合谁用

以下类型的用户会特别受益于 Agent Lightning:

优点亮点

价格与方案

以开源项目形式在 GitHub 上免费提供,可自由使用、修改与自托管。智能体执行依赖自建 Kubernetes 集群、云上 Kubernetes 或本地基础设施,相关算力按各自成本结算;框架本身不依赖付费沙箱服务。

总结与建议

Agent Lightning v1.0 抓住的是智能体强化学习里一个很实际的结构性错位:训练框架和环境循环绑在一起,而生产环境的 harness 早就不让训练框架碰那个循环了。它的解法克制得出乎意料,不重写、不接管,只在中间插一个代理,让训练侧去观察已经存在的调用。

配套的工程选择也都很实在。3500 行代码让框架保持在能读懂的规模;Collocated Async RL 解决的是 GPU 空转和独立 GPU 池的两难;把智能体跑成标准 Kubernetes 作业,则把 rollout 规模化时最容易失控的那笔商业沙箱费用拿掉了。官方示例用 6000 条样本拿到 14.6 个百分点的提升,也说明这套东西在小数据上就能见效。

适合的对象比较明确:已经有一套生产级智能体、想用强化学习继续提升、又不打算为了训练把它重写一遍的团队。

版本演进

分类
AI 搜索研究
价格
开源
标签
强化学习 · 智能体训练 · Harnessed Agentic RL
官网