产品简介
Agent Lightning v1.0 是微软亚洲研究院在 2026 年 10 月 7 日开源重建的智能体强化学习框架,全框架约 3500 行代码。它提出并定义了一种叫 Harnessed Agentic RL 的训练范式:部署时用哪套 agent harness,训练时就让哪套 harness 直接参与强化学习,不必在训练框架里把智能体重写一遍。
要理解这件事的分量,得先看传统智能体强化学习的假设。verl、AReaL、slime 这些早期系统建立在这样一个前提上:训练框架拥有与环境的交互循环。在 ReAct 式循环里,模型产出动作、环境返回观察、观察被追加进上下文、模型再产出下一个动作,整条 rollout 能映射成一条连续的 token 轨迹。
真实世界的 harness 早就超出了这个假设。mini-SWE-agent、OpenHands、OpenCode、Claude Code、Codex 各有自己的上下文管理、工具协议、执行逻辑与依赖,通用智能体系统也一样。为训练把它们重建一遍代价高昂,而且重建出来的那个,行为未必与部署的那个一致。Agent Lightning 换了条路:在智能体与模型之间插一个 LLM 代理,智能体照原样跑,只要把原本调模型 API 的端点改指向这个代理,训练框架就能观察和记录它的模型调用。v1.0 把这个做法正式定义为 Harnessed Agentic RL。
核心功能
- Harnessed Agentic RL 范式:在智能体与模型之间放置一个 OpenAI 兼容的 LLM 代理,原有 harness 代码一行不改,只把模型端点指过去。训练框架由此能观察并记录每次模型调用的提示、响应与对数概率,环境交互循环仍由 harness 自己掌管
- 约 3500 行的完整控制面:整个框架由 API Gateway、Rollout Controller 与 Customized Trainer 三部分组成:网关存储 rollout、模型与事件并充当 LLM 代理;rollout 控制器以本地进程或标准 Kubernetes 作业启动并管理智能体执行,把智能体执行与训练器分开;训练器基于 verl 创建 rollout、收集样本并通过样本适配器组装最终训练样本
- Collocated Async RL:同步 RL 要等一批里最慢的智能体、让 GPU 空转,完全异步 RL 提高了利用率但要求 rollout 与训练各自独立的 GPU 池。v1.0 让 rollout 与模型更新共用同一批 GPU:收集够 rollout 后网关暂停接收新请求、等在途请求完成,更新结束再恢复。整个过程对外部 harness 透明,实验中端到端约为同步 RL 的两倍,且比常规异步 RL 占用更少 GPU
- 原生 Kubernetes 作业调度:智能体直接作为标准 Kubernetes 作业运行,可以复用自建集群、云上 Kubernetes 或本地基础设施,不依赖 Modal Sandbox、E2B 这类商业沙箱服务,随着 rollout 规模上去费用不会失控,整条流水线也保持开源可复现
- 针对真实 harness 的四个难题给出方案:训练系统只能观察到一串 LLM 请求与响应对,一次 rollout 可能被切成可变数量的训练样本,由此带来重分词与样本合并、优势计算、损失归一化和训练后端调度四个问题。v1.0 对这四项分别给出处理,其中 rollout 级优势配合 rollout 级归一化在实验中取得更高的验证奖励,并让策略熵在训练中更稳定
- 端到端训练示例与实测提升:基于 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B 的完整流水线覆盖数据清洗、环境构建、奖励黑客防护与 RL 训练。训练集约 6000 条样本,不需要大规模算力,单独 RL 训练把 SWE-bench Verified 的 Pass@1 从 41.8% 提到 56.4%,绝对提升 14.6 个百分点
适合谁用
以下类型的用户会特别受益于 Agent Lightning:
- [object Object]
- [object Object]
- [object Object]
- [object Object]
- [object Object]
优点亮点
- 开源且整框架仅约 3500 行,规模小到可以读懂、修改和扩展
- Harnessed Agentic RL 让部署用的 harness 直接参与训练,省去在训练框架内重建智能体的工程量
- 接入成本低,对现有 harness 通常只需把模型端点指向其代理
- 智能体作为标准 Kubernetes 作业运行,复用已有集群或本地基础设施,不依赖付费沙箱服务
- Collocated Async RL 让 rollout 与模型更新共享 GPU,端到端约为同步 RL 的两倍且占用更少显卡
- 对重分词、优势计算、损失归一化与后端调度四个真实 harness 难题都有明确处理
- 端到端示例只用约 6000 条样本就把 SWE-bench Verified 的 Pass@1 提升 14.6 个百分点,数据效率可观
- 训练器基于 verl 构建,熟悉该生态的团队上手更快
价格与方案
以开源项目形式在 GitHub 上免费提供,可自由使用、修改与自托管。智能体执行依赖自建 Kubernetes 集群、云上 Kubernetes 或本地基础设施,相关算力按各自成本结算;框架本身不依赖付费沙箱服务。
总结与建议
Agent Lightning v1.0 抓住的是智能体强化学习里一个很实际的结构性错位:训练框架和环境循环绑在一起,而生产环境的 harness 早就不让训练框架碰那个循环了。它的解法克制得出乎意料,不重写、不接管,只在中间插一个代理,让训练侧去观察已经存在的调用。
配套的工程选择也都很实在。3500 行代码让框架保持在能读懂的规模;Collocated Async RL 解决的是 GPU 空转和独立 GPU 池的两难;把智能体跑成标准 Kubernetes 作业,则把 rollout 规模化时最容易失控的那笔商业沙箱费用拿掉了。官方示例用 6000 条样本拿到 14.6 个百分点的提升,也说明这套东西在小数据上就能见效。
适合的对象比较明确:已经有一套生产级智能体、想用强化学习继续提升、又不打算为了训练把它重写一遍的团队。
版本演进
- Agent Lightning v1.0 开源发布 (2026-10-07):微软亚洲研究院提出 Harnessed Agentic RL 训练范式并开源完全重建的 v1.0,让部署时使用的同一 agent harness 直接参与强化学习。框架约 3500 行,由 API Gateway、Rollout Controller 与基于 verl 的 Customized Trainer 三部分组成;在智能体与模型之间插入 OpenAI 兼容 LLM 代理,原有 harness 代码不改即可接入。提出 Collocated Async RL 让 rollout 与模型更新共用同一批 GPU,端到端约为同步 RL 的两倍;智能体以标准 Kubernetes 作业运行,不依赖商业沙箱服务。针对重分词与样本合并、优势计算、损失归一化、后端调度四个难题给出方案。基于 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B 的端到端实验用约 6000 条训练样本,把 SWE-bench Verified 的 Pass@1 从 41.8% 提到 56.4%