Agent Lightning — 架构与原理
30 秒导读: Agent Lightning 是微软研究院的一个训练框架,一句话——让你「几乎不改代码」就能用强化学习(RL)去调优任何 AI agent。它的做法是在「跑 agent」和「训 agent」之间插一个中央数据库
LightningStore:agent 照常跑、框架在旁边把每一次 LLM 调用/工具调用/奖励都记成结构化事件(span),再把这些事件翻译成 RL 认识的 (提示, 回答, 奖励) 三元组,喂给训练算法;算法学完把新模型权重或新提示词写回 store,agent 下一轮就用上了。
本页是总入口:先讲清「这是什么」(零基础也能懂),再给一张顶层全景图和一条主线走查,最后是各章阅读地图。想深入某个机制,按地图跳对应章节。
1. 这是什么(零基础也能懂)
一句话定义
Agent Lightning 是一个agent 训练框架:它把你已经写好的 AI agent 当成一个「黑盒」照常运行,在旁边观测它、给它打分,然后用强化学习等算法反过来优化它背后的语言模型或提示词。
项目自称 “The absolute trainer to light up AI agents.”,版本 0.3.1(依据:agentlightning/__init__.py:3 __version__)。