EvoTrace 真实 Agent 轨迹编译后训练数据集工作流
📌 适用场景:真实 Agent 使用轨迹 → 验证后训练数据集
将真实 Claude Code/Codex 使用轨迹编译为经验证、可交易的后训练数据集的工作流
📋 完整步骤
- 1
导入与考古
/init 导入本地 Claude Code/Codex 历史,规范化 + Git 考古(重建任务开始前的仓库状态)
- 2
候选筛选
/candidates 按证据排序会话,隐藏嵌套 subagent 重复项,找出历史中值得保留的一小部分
- 3
顺序评审
/review 运行四 Agent 顺序评审:Episode Miner → Candidate Gate → Task Builder/Hardener → Verifier Critic,路由/构建/批评
- 4
验证与校准
/validate 在 Docker 中做双态验证(拒绝基线、接受参考实现);/calibrate 用自对弈测量难度
这是什么?适合谁?
EvoTrace(Apache-2.0,构建于 DeepSeek Harness 之上)是一个本地优先的轨迹编译器:把真实 Claude Code / Codex 会话编译成可复用的训练、评估、验证资产。你控制源数据和产出资产。
它解决的问题——为什么原始轨迹不够:一段 transcript 可能包含 prompt、消息、命令、diff,但后训练需要更多:
- 一个连贯的任务边界,而不是整段聊天
- 任务开始前的仓库状态
- 可复现的依赖和执行环境
- 一个独立的 verifier(拒绝基线、接受已知良好状态)
- 把每个任务、补丁、verifier、run 连起来的 provenance
- 用全新尝试衡量的难度,而非 token 数或补丁大小
EvoTrace 用会话导入、Git/仓库考古、确定性门禁、专用 Agent、隔离执行来弥合这个编译缺口。
适合人群:做 coding-agent 后训练/RL 的研究者;想把日常 Agent 使用沉淀为数据集的人;需要「可验证执行环境」的评测工程师。
不适合:它不是又一个 coding agent,也不要求你改变 Claude Code/Codex 的使用方式。早期 alpha,DeepSeek Harness 是开发者预览。
准备工作
- 安装:macOS/Linux/WSL 用
curl -LsSf https://raw.githubusercontent.com/jinzijian/EvoTrace/main/install.sh | sh;Windows PowerShell 用irm .../install.ps1 | iex。 - 运行时:Git、Node 22.19+/24+、Python 3.9+;Docker 仅在构建/验证可执行环境时需要。
- 模型:本地导入和确定性挖掘不需要模型;Agent 评审、加固、校准、进化需要。
- 成本:Apache-2.0 开源,免费;模型 API 按用量。
- 时间预算:导入分钟级;评审 + Docker 验证小时级。
核心流程(4 步)
第一步:导入与考古
启动 evotrace(打开 DeepSeek Harness Web app),Settings 选 provider(DeepSeek/OpenAI/Anthropic)。在 app 里输入 / 运行 /init——导入现有 Claude Code/Codex 历史,规范化 + Git 考古(重建任务开始前的仓库状态)。
第二步:候选筛选
/candidates 按证据排序会话,隐藏嵌套 subagent 重复项;/show 1 检查候选 1 及其缺失的证据。状态即证据:Mined(有信号)→ Buildable → Bundle generated → Verified → Calibrated。
第三步:顺序评审
/review 1 运行四 Agent 顺序评审(从不并行):Episode Miner(隔离连贯 episode)→ Candidate Gate(判断价值并记录不可变路由)→ Task Builder/Hardener(构建/加固)→ Verifier Critic(审计 Docker run、verifier 证据、谱系、难度)。每个角色最小权限。
第四步:验证与校准
/validate 1 在 Docker 中做双态验证——一次合规 run 拒绝基线、接受参考实现,并对照确切 bundle digest 记录。/calibrate 1 用全新 solver 尝试衡量难度(默认目标五次尝试两次通过)。
常见踩坑
踩坑 1:把长但弱的轨迹当训练就绪
- 现象:一条很长的会话被误标为可训练。
- 原因:长度 ≠ 质量。
- 解决:评审可能拒绝并给明确理由——拒绝是有用结果,防止弱轨迹被误标。状态按证据升级,不按长度。
踩坑 2:跳过 Docker 验证
- 现象:verifier 没在隔离环境跑过就信任。
- 原因:未验证的 verifier 可能不可靠。
- 解决:验证在可弃 Docker 世界跑(无源码 bind mount、无 Docker socket、无 host 网络、无特权、无 host 凭证)。
踩坑 3:/evolve 没有 held-out 资产
- 现象:只跑
/evolve 1就宣称经验迁移有效。 - 原因:无对照,只是接线 smoke test,不能证明迁移。
- 解决:
/evolve 1 2——asset 1 探索压缩,asset 2 必须是同仓库独立构建的 held-out 任务,比较基线/条件化 solver 尝试。
踩坑 4:把「加长补丁」当「任务加固」
- 现象:以为把补丁写长就是变难。
- 原因:加固必须加可测行为、兼容性、边界用例或失败约束。
- 解决:
/harden 1只认可测的新约束,加长不算加固。
踩坑 5:混淆状态含义
- 现象:看到「Buildable」以为可执行。
- 原因:状态即证据——Buildable 只表示任务/仓库基/重构置信度/参考补丁/verifier 命令/环境门通过;Bundle generated 的 verifier 尚未可信。
- 解决:只有 Verified(Docker 双态验证通过)才表示 verifier 可信。
初级用法
无模型挖掘
/init
/candidates
/show 1
本地导入和确定性挖掘不需要模型,先摸清历史里有什么值得保留。
常用配方
- 编译并独立验证可执行任务:
/review 1→/build 1→/validate 1→/runs - 让简单任务变难:
/harden 1→/calibrate 2 - 测试经验迁移:
/evolve 1 2
命令参考
/init [all|codex|claude]、/candidates、/search、/show、/review、/build、/validate、/harden、/calibrate、/evolve、/assets、/runs、/doctor。
高级玩法
失败关闭(fail closed)
空 prompt 包装、低置信重构、缺失参考补丁、缺失验证命令、不支持的 environment、候选切换、资产谱系不匹配——全部失败关闭,不产生带缺陷资产。
最小权限四角色
Orchestrator 暴露固定域工具而非任意 host shell;Builder 不能批准自己的 verifier(Verifier Critic 是独立子会话);自我对弈和进化是显式操作(会把选定任务上下文发给配置的模型)。
沙箱契约
读 docs/sandbox-contract.md、task-quality-standard.md、schema.md、design.md 了解规范性边界。
小技巧
- 先
/candidates再/review:只评审证据强的候选,省模型成本。 - 拒绝也是收获:一条弱轨迹被拒绝,防止它被误标为训练就绪。
- 验证看 digest:Verified 状态对照确切 bundle digest 记录,注意谱系一致性。
- 难度看新尝试:用
/calibrate的 solver 尝试衡量难度,别猜 token 数。 - held-out 是迁移的硬前提:没有独立 held-out 任务的
/evolve只是接线测试。
常见问题 FAQ
Q1: EvoTrace 是又一个 coding agent 吗?
A: 不是。它是构建在 DeepSeek Harness 上的轨迹编译器,不改你使用 Claude Code/Codex 的方式。它把已存在的工作编译成训练/评估/验证资产。
Q2: 我的代码和数据会上云吗?
A: 导入和挖掘读本地历史与 Git 证据,不改源仓库;验证在可弃 Docker 世界跑;只有 self-play/evolution 会把选定任务上下文发给配置的模型(显式操作)。
Q3: 需要 Docker 吗?
A: 只在构建或验证可执行环境时需要;本地导入和确定性挖掘不需要。
Q4: 产出什么资产?
A: 候选目录、偏好/恢复数据(DPO/SFT/QA)、可执行任务包(eval/RL)、verifier 和奖励候选、难度证据、执行经验。同一验证任务今天可评测、明天可评分、之后可产 RL 数据。
Q5: 现在是正式版吗?
A: 早期 alpha,DeepSeek Harness 是开发者预览。生成的任务和 verifier 在通过证据和 Docker 验证门之前仍是候选。
参考链接
本文基于公开资料整理(GitHub 仓库 README,数据核验日期 2026-08-27),AI 辅助生成。
📊 评分与标签
评分说明
总分 8.0/10 · P_优选
📊 可观测社区指标(采集日期:2026-08-27)
- GitHub: jinzijian/EvoTrace ★160, 🔱5(GitHub API 实时验证)
- License: Apache-2.0;最后推送:2026-08-21(采集日前 6 天,活跃)
- 基础:DeepSeek Harness(开发者预览);状态:早期 alpha
📋 流程完整性 2.5/3.0
- 覆盖「导入考古→候选筛选→四 Agent 顺序评审→Docker 验证/校准」的轨迹到后训练资产完整闭环;状态即证据(Mined→Buildable→Bundle generated→Verified→Calibrated)+ 失败关闭;不足是 DPO/SFT/RL 导出器仍在进行、Marketplace 是 roadmap。
- 来源:官方 README
- 竞品对比 1(手写数据集脚本):无考古、无 verifier、无谱系。
- 竞品对比 2(RepoLaunch):只做环境重建,不挖任务和学习信号。
🔄 可复用性 2.0/2.5
- 同一验证任务今天评测、明天评分、之后产 RL 数据;产出多种资产(偏好/恢复数据、可执行任务包、verifier/奖励候选、难度证据、执行经验);但早期 alpha,复用受限于 DeepSeek Harness 预览状态。
- 来源:官方 README
- 竞品对比 1(一次性数据集脚本):不可版本化、不可复用。
- 竞品对比 2(托管 RL 平台):可复用但数据出本地。
📖 文档清晰度 1.7/2.0
- README 含核心工作流 ASCII 图、状态即证据表、命令参考、沙箱契约/任务质量标准/schema/design 四文档链接;中英双语;但概念密集,入门需读多份文档。
- 来源:官方 README
- 竞品对比 1(同量级项目):文档更系统。
- 竞品对比 2(ARTEMIS):单 README 更直白。
🔧 工具集成 1.1/1.5
- 构建于 DeepSeek Harness(Web UI/sessions/streaming/slash commands/插件运行时),集成 Git 考古、Docker 验证、四角色 Orchestrator;受 Harness 预览状态约束。
- 来源:官方 README
- 竞品对比 1(Artemis):MCP 集成更丰富。
- 竞品对比 2(独立 CLI 工具):集成面更窄。
💡 创新性 0.7/1.0
- 「把真实 coding-agent 轨迹编译为经验证、可交易的后训练资产」的定位独特,状态即证据 + 最小权限四角色 + 失败关闭的工程纪律出众;但本质是 Harness 之上的专业分布,非全新范式。
- 来源:官方 README
- 竞品对比 1(RepoLaunch):先例存在(仓库→环境),EvoTrace 更早地挖学习信号。
- 竞品对比 2(RL 数据合成工具):无真实轨迹 provenance。
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
🏷️ 标签说明
- 自动化: 轨迹自动编译管线。来源:官方 README
- 开源免费: Apache-2.0 协议。来源:GitHub API
- 数据集: 产出偏好/恢复/任务数据集。来源:官方 README
- 后训练: 面向 DPO/SFT/RL 的资产。来源:官方 README
- 工作流: 多步编译流程。来源:官方 README
📋 来源核实
- ✅ 已验证: GitHub 仓库 - stars/forks/license/pushed_at 经 GitHub API 实时核验(2026-08-27)
- ✅ 已验证: 官方 README - 核心工作流/状态表/命令参考/安全边界逐条比对
- ⚠️ 未实测: 实际导入轨迹并编译资产
- ⚠️ 未验证: 双态验证、自对弈校准为作者自述
⚠️ 局限与未实测声明
- 本文基于 2026-08-27 GitHub 公开 README 整理,未实际运行 EvoTrace
- 早期 alpha,DeepSeek Harness 开发者预览,功能稳定性与产出质量未独立验证
- 竞品对比基于公开文档,未经同环境实测