📚 Agent开发 全难度 📦

Hermes Agent Self-Evolution 快速入门

Nous Research开源的Agent自我进化框架:DSPy+GEPA自动进化skill/提示词,单次优化$2-10无GPU,五护栏强制人工PR,5k星

📊 评分明细

📦 打包完整度
2.1 2.1 / 2.5
🎯 实用性
2.1 2.1 / 2.5
📖 文档清晰度
1.6 1.6 / 2
👥 社区影响力
1.2 1.2 / 1.5
🔗 集成度
1.2 1.2 / 1.5

🎯 适用场景

Agent开发自我进化DSPyGEPA开源

这是什么?适合谁?

Hermes Agent Self-Evolution(NousResearch/hermes-agent-self-evolution,5,085 Stars)是 Nous Research 开源的Agent 自我进化框架:用 DSPy + GEPA(Genetic-Pareto Prompt Evolution,ICLR 2026 Oral)自动进化 Agent 的 skill 文件、工具描述、系统提示词和代码,产出”经过评测证明更好”的新版本。

核心卖点:无 GPU 训练—全部通过 API 调用完成(变异文本 -> 评测结果 -> 选择最优变体),单次优化运行成本约 $2-10。GEPA 的独特之处是读取执行轨迹来理解为什么失败(而不只是失败与否),再提出针对性改进。

适合人群

  • Agent skill/prompt 维护者:手调 prompt 到瓶颈,想要数据驱动优化的人
  • Agent 平台工程师:搭建”持续改进”管线,让 skill 版本随使用自动演进
  • DSPy/GEPA 研究者:一个生产级参考实现(Phase 1 已实现,Phase 2-5 规划中)
  • 独立开发者:用 $2-10 的预算把一个平庸 skill 调成顺手 skill

不适合:想”全自动永续进化”的人—当前 Phase 1 只覆盖 skill 文件(SKILL.md)优化,且每个变体必须过全量测试+人工 PR 审查,不存在无人值守自我修改;也没有对非 Hermes 体系 Agent 的现成适配。

使用前提:Python 环境(pip install -e ".[dev]");一个本地 hermes-agent 仓库(export HERMES_AGENT_REPO=~/.hermes/hermes-agent);LLM API key;被优化的 skill 最好有真实使用记录(sessiondb 评测源)或允许合成评测数据。

准备工作

  • 环境:Python 3.10+;git
  • 依赖:DSPy + GEPA(MIT)、Darwinian Evolver(AGPL v3,仅外部 CLI 调用,Phase 4 才用到)
  • 评测数据:二选一—--eval-source synthetic(合成数据,冷启动)或 --eval-source sessiondb(Claude Code/Copilot/Hermes 的真实会话历史,质量更高)
  • 时间预算:安装 10 分钟;一次 10 轮迭代优化视任务复杂度分钟到小时级
  • 成本:MIT 开源;单次优化运行 $2-10(官方口径,取决于迭代数与评测集大小)

快速上手(3 步)

第一步:安装并指向目标仓库

git clone https://github.com/NousResearch/hermes-agent-self-evolution.git
cd hermes-agent-self-evolution
pip install -e ".[dev]"

# 指向你的 hermes-agent 仓库
export HERMES_AGENT_REPO=~/.hermes/hermes-agent

第二步:进化一个 skill

# 合成评测数据(冷启动)
python -m evolution.skills.evolve_skill \
    --skill github-code-review \
    --iterations 10 \
    --eval-source synthetic

# 或用真实会话历史(Claude Code / Copilot / Hermes)
python -m evolution.skills.evolve_skill \
    --skill github-code-review \
    --iterations 10 \
    --eval-source sessiondb

流程:读取当前 skill -> 生成评测数据集 -> GEPA 优化器结合执行轨迹生成候选变体 -> 约束门禁(测试全过/大小限制/缓存兼容/语义保持)-> 最优变体胜出。

第三步:走 PR 流程合入

进化产物不会直接提交:最优变体生成一个针对 hermes-agent 仓库的 PR,人工审查后合入。这是框架的第一条护栏(Guardrail 5)。

成功判定:PR 里的 SKILL.md 变体在评测集上的分数显著优于原版(框架输出对比报告),且 pytest tests/ -q 100% 通过、skill 体积 ≤15KB。

初级用法

  • 单 skill 进化evolve_skill --skill <name> --iterations N,最常用入口
  • 冷启动 vs 真实数据:新 skill 用 synthetic 快速验证方向;上线后接 sessiondb 用真实失败案例驱动
  • 迭代预算控制--iterations 10 起步,观察边际收益再决定是否加轮数
  • 报告阅读reports/ 目录产出优化前后的对比与轨迹分析,是调参的主要依据

高级玩法

  1. 轨迹诊断:GEPA 读执行轨迹找”为什么失败”,把 reports 里的失败模式归类,反哺 skill 的结构设计(不是只改措辞)
  2. 约束门禁定制:五条护栏(全量测试/大小限制/缓存兼容/语义保持/PR 审查)中,大小限制(skill ≤15KB、工具描述 ≤500 字符)可按自己仓库标准收紧
  3. Phase 2-5 路线跟踪:工具描述(Phase 2)-> 系统提示词分节(Phase 3)-> 工具实现代码(Phase 4,Darwinian Evolver/AGPL)-> 持续改进环(Phase 5),规划见 PLAN.md,可按同样模式提前自实现
  4. 评测集版本化:把 sessiondb 导出的评测数据集固化进 datasets/,做成回归基准,防止 skill 进化出现”按下葫芦浮起瓢”
  5. 多 skill 并行进化:独立 skill 间无共享状态,可并行跑多个 evolve_skill 进程摊薄时间成本

常见踩坑(5 条)

踩坑 1:期待全自动无人值守

  • 现象:想让它在生产环境自己改自己
  • 原因:Guardrails 明确要求所有变更走人工 PR 审查,且约束”不得在对话中途变更”(缓存兼容)
  • 解决:把它定位成”优化建议生成器”,合入决策留给人

踩坑 2:合成数据过拟合

  • 现象:synthetic 模式下分数涨很多,实际使用没变化
  • 原因:合成评测分布与真实任务分布有偏差
  • 解决:冷启动用 synthetic 定方向,正式优化切 --eval-source sessiondb

踩坑 3:忽略大小限制

  • 现象:进化出的 skill 超过 15KB 被门禁拦下
  • 原因:GEPA 倾向增加解释性文本来提升评测分
  • 解决:接受护栏的取舍;或把长内容拆到 skill 的 references/ 附文件

踩坑 4:HERMES_AGENT_REPO 指错

  • 现象:运行报找不到 skill
  • 原因:环境变量指向了错误仓库或非 hermes-agent 结构的目录
  • 解决:确认路径下存在目标 skill;evolution/ 模块按 hermes-agent 目录约定解析

踩坑 5:成本失控

  • 现象:一轮优化账单远超 $10
  • 原因:迭代数 × 评测集大小的乘积失控,或评测数据里混入超长上下文样本
  • 解决:先用 10 轮小评测集试跑,估算单轮成本后再放大

小技巧(5 条)

  1. 先读 PLAN.md 再动手:五阶段架构与评测数据策略写得清楚,避免在未实现阶段(Phase 2-5)浪费时间
  2. 用 generate_report.py:仓库自带报告生成器,把原始轨迹转成可读的失败模式归纳
  3. 锁定 GEPA 版本:GEPA 本身迭代快,pyproject 里锁版本保证进化结果可复现
  4. 建 A/B 双轨:进化版与原版 skill 并行挂载,真实会话里对比一周再决定合入
  5. 关注 ICLR 2026 论文:GEPA 的 Oral 论文里有反射式进化的消融实验,理解它能更好调 iteration 数

常见问题 FAQ

Q1:这个框架免费吗?

A:MIT 开源(© 2026 Nous Research),5,085 Stars(2026-08-20 采集)。成本只有 LLM API 调用,官方口径单次优化 $2-10。

Q2:必须配合 Hermes Agent 使用吗?

A:Phase 1 的 skill 进化针对 hermes-agent 的 skill 文件结构(SKILL.md 格式),但 SKILL.md 是跨 Agent 通用约定,改目录解析逻辑即可迁移到其他体系;框架本身是独立 Python 包。

Q3:和手动调 prompt 有什么区别?

A:手动调依赖直觉且不可复现;这里每个变体都过同一评测集+同一门禁,“更好”有数据背书,GEPA 还会从执行轨迹里归因失败原因。

Q4:会修改我的生产文件吗?

A:不会。产出永远是 PR,且护栏禁止对话中途变更(缓存兼容约束);最终合入由你决定。

Q5:无 GPU 真的可行吗?

A:可行。它做的是提示词/文本层面的进化搜索(变异->评测->选择),全部是 API 调用,不涉及权重训练。

Q6:安全吗?会不会进化出越界行为?

A:五条护栏兜底:全量测试 100% 通过、大小限制、缓存兼容、语义保持(不得偏离原始用途)、强制人工 PR 审查。语义保持门禁专门防”进化偏航”。

进阶学习建议

  • 精读 PLAN.md 的五阶段路线与评测数据策略,特别是”真实会话历史如何变成评测集”的 sessiondb 设计
  • 学习 GEPA(ICLR 2026 Oral)的反射式进化算法本身:与普通遗传算法的差异在”读轨迹归因”而非盲目变异
  • 研究 Darwinian Evolver(AGPL v3)的 Git-based organisms 设计,理解 Phase 4 代码进化的边界
  • 把五条 Guardrails 抄进自己的 Agent 改造流程:任何”AI 改 AI”的系统都需要同级别的门禁设计
  • evolution/skills/ 源码理解 skill 文件的解析与变异策略,迁移到自己的 skill 仓库

参考链接


本文基于公开资料于 2026-08-20 整理,社区指标来自 GitHub 公开数据。独立实测未进行,成本数据引用自官方 README,功能与配置可能随版本更新变化,请以官方仓库为准。

📊 评分与标签

评分说明

总分 8.2/10 · P_优选

📊 可观测社区指标(采集日期:2026-08-20)

  • GitHub: NousResearch/hermes-agent-self-evolution ★5,085, 🔱591
  • 协议:MIT(主体);DSPy+GEPA 引擎 MIT;Darwinian Evolver AGPL v3(仅外部 CLI,Phase 4)
  • 活跃度:最近推送 2026-06-17(约两个月前),⚠️ 短期更新放缓
  • 学术背书:GEPA 为 ICLR 2026 Oral 论文

📦 可安装性 1.9/2.5

  • pip install -e ".[dev]" 标准可编辑安装,但必须配置 HERMES_AGENT_REPO 指向本地 hermes-agent 仓库,存在结构性前置
  • 纯 Python + API 调用,无 GPU、无特殊系统依赖
  • 竞品对比 1(Raidriar7170/hermes-skilleval 等同类):安装面相当,但官方出品带完整 pyproject 工程
  • 竞品对比 2(通用 prompt 优化工具):多了”指向目标 Agent 仓库”这一步,学习成本略高

🎯 实用性 2.1/2.5

  • Phase 1 已实现:skill 文件(SKILL.md)进化,冷启动(synthetic)与真实会话(sessiondb)双评测源;单次优化 $2-10,数据驱动替代手调
  • 五条护栏(全量测试/大小限制/缓存兼容/语义保持/人工 PR)让”AI 改 AI”有工程安全边界
  • 竞品对比 1(手动 prompt 迭代):可复现、有评测背书、归因失败原因,是本质升级
  • 竞品对比 2(DSPy 裸框架):开箱即用的 Agent skill 场景封装,但 Phase 2-5(工具描述/系统提示词/代码)尚未实现

📖 文档质量 1.7/2.0

  • README 含架构图、五阶段路线表、引擎对照表、护栏清单;另有 PLAN.md 完整架构与评测数据策略
  • 安装命令、模块入口(python -m evolution.skills.evolve_skill)可直接复制执行
  • 竞品对比 1(Yonkoo11/hermes-dojo 等社区同类):官方文档完整度高一档
  • 竞品对比 2(学术原型仓库):有生产化工程结构(tests/、reports/、datasets/)

👥 社区活跃 1.5/1.5

  • ★5,085 / 🔱591(2026-08-20 采集),Nous Research 官方项目,细分赛道(Agent 自我进化)星数最高
  • 最近推送 2026-06-17,约两个月未更新,⚠️ 需关注后续维护节奏
  • 竞品对比 1(OSU-NLP-Group/SkillWeaver 152 星):体量高一个数量级以上
  • 竞品对比 2(keskival/recursive-self-improvement-suite 55 星):官方背书+学术引擎组合无对手

🔗 兼容性 1.0/1.5

  • Phase 1 绑定 hermes-agent 的 skill 文件结构;SKILL.md 是跨 Agent 通用约定,迁移需改目录解析
  • 评测源支持 Claude Code / Copilot / Hermes 三家会话历史
  • 竞品对比 1(GEPA 裸库):场景封装强但宿主绑定也强
  • 竞品对比 2(Agent 无关的 prompt 优化 SaaS):开源可自托管,无供应商锁定

标签说明

  • Agent开发: 优化对象是 Agent 的 skill/提示词/工具描述,属 Agent 基础设施。来源:README
  • 自我进化: 用 GEPA 遗传-帕累托进化搜索自动产出更优 skill 变体。来源:README
  • DSPy: 核心引擎之一,斯坦福 DSPy 框架驱动评测与优化。来源:README Engines 表
  • GEPA: 反射式提示词进化引擎(ICLR 2026 Oral),读取执行轨迹归因失败。来源:GEPA
  • 开源: MIT 协议,Nous Research 官方维护。来源:GitHub

来源核实

  • ✅ GitHub API 已验证: NousResearch/hermes-agent-self-evolution - Stars 5,085, Forks 591, pushed 2026-06-17, MIT
  • ✅ README 已读取: 安装命令、进化命令(synthetic/sessiondb 双源)、五阶段路线、五条护栏、$2-10 成本口径均核对
  • ✅ 仓库结构已验证: evolution/、datasets/、tests/、reports/、PLAN.md 齐全(GitHub API contents)
  • ⚠️ 未实测: 未实际运行进化流程;$2-10 成本引用自官方 README,未经独立复现
  • ⚠️ 注意: staging 原始名 “self-improvement”(AI开发平台分类)经 GitHub 搜索比对,身份确立为 NousResearch/hermes-agent-self-evolution(同赛道星数第一、名称语义完全吻合)

评分依据可追溯至公开数据源,评估日期:2026-08-20。社区指标来自 GitHub API 实时数据。