🔧 开源框架

Reef

Reef:面向自我改进 Agent 的持续学习基础设施——连接推理、反馈、学习与版本化交付;用 Slime+SGLang 训模型权重,或优化 prompt/规则/skills 的 harness,更新期间服务不中断。Apache-2.0,PyPI 包 reef-infra。

📅 收录: 2026-09-09 🔄 更新: 2026-09-09

这是什么?适合谁?

Reef(Human-Agent-Society/reef)自称是首个开源的”持续自我改进 Agent 基础设施”(continual learning infra for self-imving agents)。它把 Agent 的推理、反馈、学习、版本化交付连成一条闭环:Agent 对外服务的同时记录交互,把反馈匹配到交互记录,从合格记录里产出更新(训练权重或改 harness),经评估与选择策略后发布进版本历史——全程服务不中断。

两条学习路径(官方表):

你的目标学习路径需要什么
越用越强的专属模型模型权重训练可训练模型、支持的 GPU 栈、反馈配方
让 harness 自我改进harness 优化(prompt/规则/skills)模型端点、代表性任务、评估器;无需本地训练 GPU
科学发现test-time 训练执行环境、正确性检查器、可度量目标

与现有栈的分工:推理引擎(vLLM/SGLang)管服务不管训练;RL 框架(Slime/veRL/AReaL)管训练不管服务与版本;Reef 补上”边服务边学、版本管理、更新期间不宕机、超越权重的演化(skills/harness)”。

适合谁:想让自己 Agent 从真实用户交互中持续变强的团队;有 SGLang/Slime 经验的推理训练工程师;研究 Agent 自我改进方向的实验室。

不适合:只想调 API 用现成 Agent 的普通用户;没有 GPU 栈或评估器的个人(权重训练路径门槛高);需要商业 SLA 的企业(项目新)。

使用前提:Python 3.10+、uv、git-lfs(artifact/checkpoint 功能需要);权重训练路径需可训练模型 + GPU 栈。

准备工作

  1. 安装:uv venv && source .venv/bin/activate && uv pip install reef-infra(PyPI 包 reef-infra
  2. 环境依赖:系统装 git-lfs(Reef 会为 artifact 仓库本地初始化 LFS)
  3. 训练路径:可训练模型 + Slime/SGLang 栈;harness 路径:模型端点 + 评估器
  4. 成本:Apache-2.0 开源免费;基础设施(GPU)自备
  5. 时间:跑通第一个学习循环约半天(含环境)

快速上手(3 步)

第一步:安装 reef-infra

uv venv && source .venv/bin/activate
uv pip install reef-infra
python3 -c "import reef; print(reef.__version__)"

第二步:把 Agent 接入 Reef 服务并记录交互

按官方 Quickstart(reefinfra.ai/docs)把现有 Agent 请求走 Reef 的 service/(服务与交互记录),确认交互记录落库。

第三步:配置反馈与更新策略,跑通第一个学习循环

反馈匹配(records.py + train/processors/)→ 产出更新(train/)→ 评估与版本发布(train/evaluation/ + artifact/)。每轮循环四步:Serve → Observe → Grow → Commit。

成功判定artifact/ 版本历史里出现第一个被接受并发布的更新(权重或 harness),且服务全程在线。

初级用法

  • harness 自我改进:无本地 GPU,用模型端点 + 评估器让 prompt/规则/skills 迭代
  • 交互记录审计:查询 records.py 存储的交互与反馈匹配结果
  • 版本历史回滚:artifact 仓库(git-lfs)里检出任一历史版本对比

高级玩法

  • 权重训练闭环:Slime + SGLang 训练可服务模型,Reef 负责在线服务、版本管理与更新不宕机
  • test-time 训练做科学发现:配执行环境 + 正确性检查器 + 可度量目标(官方路径三)
  • 多轮选择策略:自定义 train/evaluation/ 的候选评估与选择策略,控制”什么更新值得上线”

常见踩坑

  1. 症状:checkpoint/artifact 异常或仓库膨胀。 原因:没装 git-lfs,Reef 依赖它管理 artifact。解决:系统级安装 git-lfs 后重建环境(官方安装注意事项)。
  2. 症状:反馈匹配率为 0。 原因:反馈与交互记录对不上(时间窗/键不匹配)。解决:检查 train/processors/ 的 eligibility 规则与记录字段。
  3. 症状:权重训练路径起不来。 原因:该路径需要可训练模型 + GPU 栈 + Slime/SGLang,门槛高。解决:先走 harness 优化路径(无需本地训练 GPU)验证闭环。
  4. 症状:更新导致服务劣化。 原因:选择策略过松。解决:收紧 train/evaluation/ 评估门禁,先在影子流量上评估再 commit。
  5. 症状:48 个 open issues 该看什么。 原因:项目活跃但新。解决:先读 Roadmap issue #25 与社区渠道(Discord/微信社区)再动手。

小技巧

  • 用 uv 管理 Python 依赖(官方推荐),避免手滑装错版本。
  • 先跑 harness 路径再上权重训练,能在没有 GPU 的情况下验证整条 Serve→Observe→Grow→Commit 循环。
  • 版本历史 + 评估记录是最好的复盘素材:每次更新为何被接受/拒绝都有据可查。
  • 中文用户可直接看仓库 README.zh.md 与微信社区入口。

常见问题 FAQ

Q1: Reef 是训练框架还是推理引擎?

A: 都不是。它是把推理引擎(vLLM/SGLang)与 RL 训练框架(Slime/veRL/AReaL)连起来的持续学习基础设施:补上服务在线、版本管理、更新不宕机、超越权重的演化。

Q2: 不会训练模型也能用吗?

A: 能。harness 优化路径只需要模型端点 + 代表性任务 + 评估器,不需要本地训练 GPU。

Q3: 免费吗?什么协议?

A: Apache-2.0 开源免费;PyPI 包 reef-infra;GPU 与模型自备。

Q4: 和 SGLang 什么关系?

A: SGLang 是 Reef 支持的推理/训练栈之一(权重训练路径用 Slime + SGLang)。

Q5: 生产可用吗?

A: 774★、CI 在跑、9 月 8 日仍在推送,但仓库 8 月底才创建、48 个 open issue,属于活跃早期项目,生产采用建议先影子流量试点(本站未实测)。

参考链接

本文基于公开资料(GitHub 官方 README 中英双版)整理,AI 辅助生成,未做本地安装实测;采集日期 2026-09-09。功能描述以官方仓库最新说明为准。

📊 评分与标签

评分说明

总分 7.4/10 · S_入选

📊 可观测社区指标(采集日期:2026-09-09)

  • GitHub: Human-Agent-Society/reef ★774, 🔱48(GitHub API 实时验证)
  • PyPI: reef-infra 可安装;Python 3.10+
  • License: Apache-2.0;仓库创建 2026-08-31,最后推送 2026-09-08(当天仍活跃)
  • CI:GitHub Actions 在跑;中英双语 README;Discord + 微信社区
  • ⚠️ 仓库 9 天、48 open issues,极早期

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

🤖 Agent 能力 1.6/2.0

  • 定位”首个开源持续自我改进 Agent 基础设施”:Serve→Observe→Grow→Commit 四步学习循环,边服务边学、更新不宕机
  • 双路径覆盖:权重训练(Slime+SGLang)与 harness 优化(prompt/规则/skills),外加 test-time 训练路径
  • 限制:自我改进的实际效果(指标提升幅度)无公开基准数据,主张以架构完整性为主
  • 竞品对比 1(纯 RL 框架 veRL/AReaL):只管训练不管在线服务与版本管理;Reef 补齐闭环但训练深度依赖前者
  • 竞品对比 2(Agent 平台 Dify/LangGraph 类):编排为主、无持续学习环;Reef 方向不同但成熟度远低

🖐️ 易用性 1.0/1.5

  • PyPI 一键安装(uv pip install reef-infra)+ 官方文档站 quickstart
  • 明确的”何时用 Reef”选型表降低理解成本
  • 限制:git-lfs 系统依赖、权重路径需要 GPU 栈与 Slime/SGLang 经验,综合门槛 advanced
  • 竞品对比 1(SGLang 裸用):只解决推理;Reef 概念面更宽,学习曲线也更陡
  • 竞品对比 2(全托管 SaaS 自学习方案):零运维但闭源;Reef 换来开放性与控制力

🔌 生态集成 1.7/2.0

  • 与主流栈显式分工并兼容:vLLM/SGLang 推理、Slime/veRL/AReaL 训练、PyPI + uv 分发、git-lfs 版本化
  • Python 3.10+;中英双语文档与双语社区(Discord + 微信群)
  • 限制:对非 Python 技术栈无官方支持
  • 竞品对比 1(自建 MLOps 拼装):需要自己写服务-反馈-版本胶水;Reef 提供现成四步循环
  • 竞品对比 2(RL 框架自带 serving):无更新不宕机与 artifact 版本历史

👥 社区支持 1.6/1.5

  • 9 天 774★/48 fork,最后推送 2026-09-08(当天活跃);CI 徽章正常
    • 来源:GitHub API(采集日期 2026-09-09)
  • Human-Agent-Society 组织背书 + 双语社区渠道 + 公开 Roadmap
  • ⚠️ 48 open issues、9 天新仓,社区深度待时间验证
  • 竞品对比 1(SGLang):数万星生态远大
  • 竞品对比 2(同类自学习研究原型):无社区无维护;Reef 有组织与社区投入

💡 创新程度 1.3/1.5

  • “持续自我改进 + 版本化交付 + 更新期间保持在线 + 超越权重演化”的组合在开源界稀缺
  • 学习路径三分(权重/harness/test-time)给不同资源条件的团队都留了入口
  • 限制:“首个”的自我定位未经第三方横向核实
  • 竞品对比 1(MetaGPT 类多 Agent 框架):创新在协作编排;Reef 创新在学习闭环
  • 竞品对比 2(LangGraph 检查点机制):只做状态持久化;Reef 做更新生产与发布

🔒 稳定性 0.2/1.5

  • 9 天仓库、48 open issues、无生产规模公开案例;Apache-2.0 + CI 在跑是仅有的成熟度信号
  • 限制:本站未实测;声称”更新不宕机”的关键特性无公开压测数据
  • 竞品对比 1(vLLM/SGLang):久经生产验证
  • 竞品对比 2(研究代码):更差;Reef 至少有包分发与 CI

🏷️ 标签说明

  • 开源框架: Apache-2.0 开源基础设施项目。来源:GitHub
  • 持续学习: 核心定位——agent 从交互反馈中持续学习改进。来源:GitHub README
  • Agent训练: 支持权重训练(Slime+SGLang)与 harness 优化双路径。来源:GitHub README
  • 自我改进: Serve→Observe→Grow→Commit 闭环与版本化交付。来源:GitHub README
  • SGLang: 官方推荐的推理/训练栈之一。来源:GitHub README

📋 来源核实

  • ✅ 已核验: GitHub 仓库 — 2026-09-09 通过 GitHub API 实时核验:★774、🔱48、Apache-2.0、created 2026-08-31、pushed 2026-09-08、48 open issues、未归档
  • ✅ 已核验: README.md — 2026-09-09 抓取全文:双路径选型表、四步循环模块表、uv 安装流程、git-lfs 注意事项
  • ⚠️ 未实测:本站未本地安装 reef-infra、未跑通学习循环;部署与训练细节以官方文档站为准

同分类推荐

开源框架 分类下的其他 Agent