loongsage

百度白鸽团队出品、面向前沿 LLM 的生产级 Agentic RL 框架,内置经过验证的训练 recipe。

📅 收录: 2026-08-29 🔄 更新: 2026-08-29

这是什么?适合谁?

LoongSage(baidu-baige/LoongSage)是百度白鸽团队出品、面向前沿 LLM 的生产级 Agentic RL 框架:面向强化学习驱动的 Agent 训练,内置经过验证的训练 recipe。

核心价值:把「Agentic RL(强化学习驱动的 Agent 训练)」做成生产级框架——中文团队开源、方向稀缺,内置已验证的训练配方,降低从零搭建 RL 训练管线的门槛。

适合人群

  • 做 Agent RL / 强化学习训练的算法工程师
  • 研究 RL 驱动 Agent 能力的研究者
  • 需要生产级训练框架的团队

使用前提:Python 与深度学习环境;理解强化学习(PPO 等)与 LLM 训练基础。

准备工作

  1. 算力:RL 训练需要 GPU 资源(具体规模按模型与任务)。
  2. Python 环境:装 PyTorch 与相关训练依赖。
  3. 基座模型:准备要训练的 LLM 基座。
  4. 成本:Apache-2.0 开源免费;算力与训练成本自担。
  5. 时间预算:环境搭建 + 跑通示例 recipe 约半天。

快速上手(3 步)

第一步:安装框架

git clone https://github.com/baidu-baige/LoongSage
cd LoongSage
pip install -e .   # 具体依赖与安装以 README 为准

第二步:准备环境与数据

配置算力、基座模型与训练数据。

第三步:启动训练 recipe

用内置 recipe 启动一轮 Agentic RL 训练并观察指标。

成功判定:用内置 recipe 成功启动一轮 Agent RL 训练,并在日志中看到 reward 与 loss 指标。

初级用法

Agentic RL

面向 Agent 任务的强化学习训练范式。

内置 recipe

提供经过验证的训练配方,省去调参试错。

生产级设计

面向生产环境的训练流程与稳定性设计。

高级玩法

自定义 reward

针对自有任务设计奖励函数,扩展训练场景。

多环境训练

把 Agent 放进多环境交互,提升泛化能力。

训练监控

接入指标面板,持续跟踪训练曲线。

小技巧

  1. 先跑内置 recipe:验证环境后再改。
  2. 奖励函数先简单后复杂:RL 对 reward 极敏感。
  3. 算力预算先估算:RL 训练成本不低。
  4. 多存 checkpoint:便于回滚与对比。
  5. 对齐团队目标:RL 收益需要明确的任务定义。

常见踩坑

踩坑 1:算力不足

  • 现象:训练 OOM 或速度极慢。
  • 原因:RL 训练资源需求大。
  • 解决:先小模型小规模验证,再扩展。

踩坑 2:reward 设计不当

  • 现象:模型学偏、行为异常。
  • 原因:奖励函数与目标不一致。
  • 解决:简化 reward,逐步迭代并加人工校验。

踩坑 3:依赖版本冲突

  • 现象:安装失败。
  • 原因:深度学习依赖复杂。
  • 解决:按 README 锁定版本或用容器。

踩坑 4:期望过高

  • 现象:训练几轮没看到明显提升。
  • 原因:RL 收益需要充分调参与数据。
  • 解决:设合理目标,先复现 recipe 基线。

踩坑 5:项目极新

  • 现象:文档与社区有限。
  • 原因:项目 2026-08 创建。
  • 解决:以 README 与源码为准。

常见问题 FAQ

Q1: 什么是 Agentic RL?

A: 用强化学习训练 Agent 在环境中做出更好决策,而非仅做监督微调。

Q2: 需要多少算力?

A: 取决于模型与任务规模,建议先小规模验证,具体见 README。

Q3: 免费吗?

A: Apache-2.0 开源免费;算力成本自担。

Q4: 适合新手吗?

A: 需要 RL 与 LLM 训练基础,门槛较高。

Q5: 和 DRL 框架有什么区别?

A: 它聚焦 Agent 场景的 RL 训练,内置针对 Agent 的 recipe。

进阶学习建议

掌握基础后,建议深入:

  1. 复现内置 recipe 的基线指标,建立自己的训练起点。
  2. 为自有 Agent 任务设计奖励函数,跑通第一轮定制训练。
  3. 研究多环境交互与课程学习,提升 Agent 泛化能力。

参考链接


最后更新:2026-08-29 · 作者:MagicNetWorld · 基于公开资料整理,关键数据经 GitHub API 独立实测核验,AI 辅助生成

📊 评分与标签

评分说明

总分 7.4/10 · S_入选

📊 可观测社区指标(采集日期:2026-08-29)

  • GitHub: baidu-baige/LoongSage ★32, 🔱1(GitHub API 实时验证)
  • License: Apache-2.0;仓库创建 2026-08-28,最后推送 2026-08-28(活跃)
  • 语言: Python;定位「生产级 Agentic RL 训练框架」

⚙️ 功能完整度 1.8/2.5

  • 生产级 Agentic RL 框架 + 内置 recipe,训练链路完整
  • 竞品对比 1(通用 RLHF 框架):面向对齐而非 Agent 任务
  • 竞品对比 2(手写 RL 管线):灵活但工程量大

✨ 输出质量 1.9/2.5

  • 内置已验证 recipe,产出质量有基线保障
  • 竞品对比 1(监督微调):无法做环境交互决策
  • 竞品对比 2(纯推理 Agent):无训练能力

🖐️ 易用性 1.1/1.5

  • RL 训练门槛高,需专业背景
  • 竞品对比 1(商用训练平台):开箱即用但贵
  • 竞品对比 2(自建训练):免费但门槛高

💰 性价比 1.2/1.5

  • Apache-2.0 开源免费;算力成本另计
  • 竞品对比 1(商用 RL 平台):按算力订阅收费
  • 竞品对比 2(自建管线):成本可控但费人力

🔒 稳定性 0.7/1.0

  • 项目极新(2026-08-28 创建)、fork 1
  • 竞品对比 1(成熟 RL 框架):久经考验
  • 竞品对比 2(实验脚本):不稳定

🛡️ 隐私安全 0.7/1.0

  • 训练数据与模型本地可控
  • 竞品对比 1(云端训练平台):数据上传第三方
  • 竞品对比 2(本地训练):数据自控

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

🏷️ 标签说明

📋 来源核实

  • ✅ 已验证: GitHub 仓库 - stars/forks/license/pushed_at/语言经 GitHub API 实时核验(2026-08-29)
  • ✅ 已验证: 官方 README - 能力与定位比对
  • ⚠️ 未实测: 内置 recipe 的完整训练流程
  • ⚠️ 未验证: 不同任务下的实际训练收益

⚠️ 局限与未实测声明

  • 本文基于 2026-08-29 GitHub 公开信息整理,未实际运行 LoongSage
  • 项目创建仅一天,训练 recipe 的实际效果待复现验证
  • 项目较新,能力与命令以仓库 README 为准

同分类推荐

AI开发平台 分类下的其他工具

)}