Reef
Reef:面向自我改进 Agent 的持续学习基础设施——连接推理、反馈、学习与版本化交付;用 Slime+SGLang 训模型权重,或优化 prompt/规则/skills 的 harness,更新期间服务不中断。Apache-2.0,PyPI 包 reef-infra。
这是什么?适合谁?
Reef(Human-Agent-Society/reef)自称是首个开源的”持续自我改进 Agent 基础设施”(continual learning infra for self-imving agents)。它把 Agent 的推理、反馈、学习、版本化交付连成一条闭环:Agent 对外服务的同时记录交互,把反馈匹配到交互记录,从合格记录里产出更新(训练权重或改 harness),经评估与选择策略后发布进版本历史——全程服务不中断。
两条学习路径(官方表):
| 你的目标 | 学习路径 | 需要什么 |
|---|---|---|
| 越用越强的专属模型 | 模型权重训练 | 可训练模型、支持的 GPU 栈、反馈配方 |
| 让 harness 自我改进 | harness 优化(prompt/规则/skills) | 模型端点、代表性任务、评估器;无需本地训练 GPU |
| 科学发现 | test-time 训练 | 执行环境、正确性检查器、可度量目标 |
与现有栈的分工:推理引擎(vLLM/SGLang)管服务不管训练;RL 框架(Slime/veRL/AReaL)管训练不管服务与版本;Reef 补上”边服务边学、版本管理、更新期间不宕机、超越权重的演化(skills/harness)”。
适合谁:想让自己 Agent 从真实用户交互中持续变强的团队;有 SGLang/Slime 经验的推理训练工程师;研究 Agent 自我改进方向的实验室。
不适合:只想调 API 用现成 Agent 的普通用户;没有 GPU 栈或评估器的个人(权重训练路径门槛高);需要商业 SLA 的企业(项目新)。
使用前提:Python 3.10+、uv、git-lfs(artifact/checkpoint 功能需要);权重训练路径需可训练模型 + GPU 栈。
准备工作
- 安装:
uv venv && source .venv/bin/activate && uv pip install reef-infra(PyPI 包 reef-infra) - 环境依赖:系统装
git-lfs(Reef 会为 artifact 仓库本地初始化 LFS) - 训练路径:可训练模型 + Slime/SGLang 栈;harness 路径:模型端点 + 评估器
- 成本:Apache-2.0 开源免费;基础设施(GPU)自备
- 时间:跑通第一个学习循环约半天(含环境)
快速上手(3 步)
第一步:安装 reef-infra
uv venv && source .venv/bin/activate
uv pip install reef-infra
python3 -c "import reef; print(reef.__version__)"
第二步:把 Agent 接入 Reef 服务并记录交互
按官方 Quickstart(reefinfra.ai/docs)把现有 Agent 请求走 Reef 的 service/(服务与交互记录),确认交互记录落库。
第三步:配置反馈与更新策略,跑通第一个学习循环
反馈匹配(records.py + train/processors/)→ 产出更新(train/)→ 评估与版本发布(train/evaluation/ + artifact/)。每轮循环四步:Serve → Observe → Grow → Commit。
成功判定:artifact/ 版本历史里出现第一个被接受并发布的更新(权重或 harness),且服务全程在线。
初级用法
- harness 自我改进:无本地 GPU,用模型端点 + 评估器让 prompt/规则/skills 迭代
- 交互记录审计:查询
records.py存储的交互与反馈匹配结果 - 版本历史回滚:artifact 仓库(git-lfs)里检出任一历史版本对比
高级玩法
- 权重训练闭环:Slime + SGLang 训练可服务模型,Reef 负责在线服务、版本管理与更新不宕机
- test-time 训练做科学发现:配执行环境 + 正确性检查器 + 可度量目标(官方路径三)
- 多轮选择策略:自定义
train/evaluation/的候选评估与选择策略,控制”什么更新值得上线”
常见踩坑
- 症状:checkpoint/artifact 异常或仓库膨胀。 原因:没装 git-lfs,Reef 依赖它管理 artifact。解决:系统级安装 git-lfs 后重建环境(官方安装注意事项)。
- 症状:反馈匹配率为 0。 原因:反馈与交互记录对不上(时间窗/键不匹配)。解决:检查
train/processors/的 eligibility 规则与记录字段。 - 症状:权重训练路径起不来。 原因:该路径需要可训练模型 + GPU 栈 + Slime/SGLang,门槛高。解决:先走 harness 优化路径(无需本地训练 GPU)验证闭环。
- 症状:更新导致服务劣化。 原因:选择策略过松。解决:收紧
train/evaluation/评估门禁,先在影子流量上评估再 commit。 - 症状:48 个 open issues 该看什么。 原因:项目活跃但新。解决:先读 Roadmap issue #25 与社区渠道(Discord/微信社区)再动手。
小技巧
- 用 uv 管理 Python 依赖(官方推荐),避免手滑装错版本。
- 先跑 harness 路径再上权重训练,能在没有 GPU 的情况下验证整条 Serve→Observe→Grow→Commit 循环。
- 版本历史 + 评估记录是最好的复盘素材:每次更新为何被接受/拒绝都有据可查。
- 中文用户可直接看仓库
README.zh.md与微信社区入口。
常见问题 FAQ
Q1: Reef 是训练框架还是推理引擎?
A: 都不是。它是把推理引擎(vLLM/SGLang)与 RL 训练框架(Slime/veRL/AReaL)连起来的持续学习基础设施:补上服务在线、版本管理、更新不宕机、超越权重的演化。
Q2: 不会训练模型也能用吗?
A: 能。harness 优化路径只需要模型端点 + 代表性任务 + 评估器,不需要本地训练 GPU。
Q3: 免费吗?什么协议?
A: Apache-2.0 开源免费;PyPI 包 reef-infra;GPU 与模型自备。
Q4: 和 SGLang 什么关系?
A: SGLang 是 Reef 支持的推理/训练栈之一(权重训练路径用 Slime + SGLang)。
Q5: 生产可用吗?
A: 774★、CI 在跑、9 月 8 日仍在推送,但仓库 8 月底才创建、48 个 open issue,属于活跃早期项目,生产采用建议先影子流量试点(本站未实测)。
参考链接
本文基于公开资料(GitHub 官方 README 中英双版)整理,AI 辅助生成,未做本地安装实测;采集日期 2026-09-09。功能描述以官方仓库最新说明为准。
📊 评分与标签
评分说明
总分 7.4/10 · S_入选
📊 可观测社区指标(采集日期:2026-09-09)
- GitHub: Human-Agent-Society/reef ★774, 🔱48(GitHub API 实时验证)
- PyPI: reef-infra 可安装;Python 3.10+
- License: Apache-2.0;仓库创建 2026-08-31,最后推送 2026-09-08(当天仍活跃)
- CI:GitHub Actions 在跑;中英双语 README;Discord + 微信社区
- ⚠️ 仓库 9 天、48 open issues,极早期
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
🤖 Agent 能力 1.6/2.0
- 定位”首个开源持续自我改进 Agent 基础设施”:Serve→Observe→Grow→Commit 四步学习循环,边服务边学、更新不宕机
- 双路径覆盖:权重训练(Slime+SGLang)与 harness 优化(prompt/规则/skills),外加 test-time 训练路径
- 限制:自我改进的实际效果(指标提升幅度)无公开基准数据,主张以架构完整性为主
- 竞品对比 1(纯 RL 框架 veRL/AReaL):只管训练不管在线服务与版本管理;Reef 补齐闭环但训练深度依赖前者
- 竞品对比 2(Agent 平台 Dify/LangGraph 类):编排为主、无持续学习环;Reef 方向不同但成熟度远低
🖐️ 易用性 1.0/1.5
- PyPI 一键安装(
uv pip install reef-infra)+ 官方文档站 quickstart - 明确的”何时用 Reef”选型表降低理解成本
- 限制:git-lfs 系统依赖、权重路径需要 GPU 栈与 Slime/SGLang 经验,综合门槛 advanced
- 竞品对比 1(SGLang 裸用):只解决推理;Reef 概念面更宽,学习曲线也更陡
- 竞品对比 2(全托管 SaaS 自学习方案):零运维但闭源;Reef 换来开放性与控制力
🔌 生态集成 1.7/2.0
- 与主流栈显式分工并兼容:vLLM/SGLang 推理、Slime/veRL/AReaL 训练、PyPI + uv 分发、git-lfs 版本化
- Python 3.10+;中英双语文档与双语社区(Discord + 微信群)
- 限制:对非 Python 技术栈无官方支持
- 竞品对比 1(自建 MLOps 拼装):需要自己写服务-反馈-版本胶水;Reef 提供现成四步循环
- 竞品对比 2(RL 框架自带 serving):无更新不宕机与 artifact 版本历史
👥 社区支持 1.6/1.5
- 9 天 774★/48 fork,最后推送 2026-09-08(当天活跃);CI 徽章正常
- 来源:GitHub API(采集日期 2026-09-09)
- Human-Agent-Society 组织背书 + 双语社区渠道 + 公开 Roadmap
- ⚠️ 48 open issues、9 天新仓,社区深度待时间验证
- 竞品对比 1(SGLang):数万星生态远大
- 竞品对比 2(同类自学习研究原型):无社区无维护;Reef 有组织与社区投入
💡 创新程度 1.3/1.5
- “持续自我改进 + 版本化交付 + 更新期间保持在线 + 超越权重演化”的组合在开源界稀缺
- 学习路径三分(权重/harness/test-time)给不同资源条件的团队都留了入口
- 限制:“首个”的自我定位未经第三方横向核实
- 竞品对比 1(MetaGPT 类多 Agent 框架):创新在协作编排;Reef 创新在学习闭环
- 竞品对比 2(LangGraph 检查点机制):只做状态持久化;Reef 做更新生产与发布
🔒 稳定性 0.2/1.5
- 9 天仓库、48 open issues、无生产规模公开案例;Apache-2.0 + CI 在跑是仅有的成熟度信号
- 限制:本站未实测;声称”更新不宕机”的关键特性无公开压测数据
- 竞品对比 1(vLLM/SGLang):久经生产验证
- 竞品对比 2(研究代码):更差;Reef 至少有包分发与 CI
🏷️ 标签说明
- 开源框架: Apache-2.0 开源基础设施项目。来源:GitHub
- 持续学习: 核心定位——agent 从交互反馈中持续学习改进。来源:GitHub README
- Agent训练: 支持权重训练(Slime+SGLang)与 harness 优化双路径。来源:GitHub README
- 自我改进: Serve→Observe→Grow→Commit 闭环与版本化交付。来源:GitHub README
- SGLang: 官方推荐的推理/训练栈之一。来源:GitHub README
📋 来源核实
同分类推荐
开源框架 分类下的其他 Agent