workflow 自动化

EvoTrace 真实 Agent 轨迹编译后训练数据集工作流

📌 适用场景:真实 Agent 使用轨迹 → 验证后训练数据集

将真实 Claude Code/Codex 使用轨迹编译为经验证、可交易的后训练数据集的工作流

8.0 /10 ★★★★☆
🪜 4 个步骤 🛠️ 0 款工具 ⏱️ 视轨迹规模(小时级) 🎯 高级 🕒 更新于 2026-08-27

📋 完整步骤

  1. 1

    导入与考古

    /init 导入本地 Claude Code/Codex 历史,规范化 + Git 考古(重建任务开始前的仓库状态)

  2. 2

    候选筛选

    /candidates 按证据排序会话,隐藏嵌套 subagent 重复项,找出历史中值得保留的一小部分

  3. 3

    顺序评审

    /review 运行四 Agent 顺序评审:Episode Miner → Candidate Gate → Task Builder/Hardener → Verifier Critic,路由/构建/批评

  4. 4

    验证与校准

    /validate 在 Docker 中做双态验证(拒绝基线、接受参考实现);/calibrate 用自对弈测量难度

这是什么?适合谁?

EvoTrace(Apache-2.0,构建于 DeepSeek Harness 之上)是一个本地优先的轨迹编译器:把真实 Claude Code / Codex 会话编译成可复用的训练、评估、验证资产。你控制源数据和产出资产。

它解决的问题——为什么原始轨迹不够:一段 transcript 可能包含 prompt、消息、命令、diff,但后训练需要更多:

  • 一个连贯的任务边界,而不是整段聊天
  • 任务开始前的仓库状态
  • 可复现的依赖和执行环境
  • 一个独立的 verifier(拒绝基线、接受已知良好状态)
  • 把每个任务、补丁、verifier、run 连起来的 provenance
  • 用全新尝试衡量的难度,而非 token 数或补丁大小

EvoTrace 用会话导入、Git/仓库考古、确定性门禁、专用 Agent、隔离执行来弥合这个编译缺口。

适合人群:做 coding-agent 后训练/RL 的研究者;想把日常 Agent 使用沉淀为数据集的人;需要「可验证执行环境」的评测工程师。

不适合:它不是又一个 coding agent,也不要求你改变 Claude Code/Codex 的使用方式。早期 alpha,DeepSeek Harness 是开发者预览。

准备工作

  1. 安装:macOS/Linux/WSL 用 curl -LsSf https://raw.githubusercontent.com/jinzijian/EvoTrace/main/install.sh | sh;Windows PowerShell 用 irm .../install.ps1 | iex
  2. 运行时:Git、Node 22.19+/24+、Python 3.9+;Docker 仅在构建/验证可执行环境时需要。
  3. 模型:本地导入和确定性挖掘不需要模型;Agent 评审、加固、校准、进化需要。
  4. 成本:Apache-2.0 开源,免费;模型 API 按用量。
  5. 时间预算:导入分钟级;评审 + Docker 验证小时级。

核心流程(4 步)

第一步:导入与考古

启动 evotrace(打开 DeepSeek Harness Web app),Settings 选 provider(DeepSeek/OpenAI/Anthropic)。在 app 里输入 / 运行 /init——导入现有 Claude Code/Codex 历史,规范化 + Git 考古(重建任务开始前的仓库状态)。

第二步:候选筛选

/candidates 按证据排序会话,隐藏嵌套 subagent 重复项;/show 1 检查候选 1 及其缺失的证据。状态即证据:Mined(有信号)→ Buildable → Bundle generated → Verified → Calibrated。

第三步:顺序评审

/review 1 运行四 Agent 顺序评审(从不并行):Episode Miner(隔离连贯 episode)→ Candidate Gate(判断价值并记录不可变路由)→ Task Builder/Hardener(构建/加固)→ Verifier Critic(审计 Docker run、verifier 证据、谱系、难度)。每个角色最小权限。

第四步:验证与校准

/validate 1 在 Docker 中做双态验证——一次合规 run 拒绝基线、接受参考实现,并对照确切 bundle digest 记录。/calibrate 1 用全新 solver 尝试衡量难度(默认目标五次尝试两次通过)。

常见踩坑

踩坑 1:把长但弱的轨迹当训练就绪

  • 现象:一条很长的会话被误标为可训练。
  • 原因:长度 ≠ 质量。
  • 解决:评审可能拒绝并给明确理由——拒绝是有用结果,防止弱轨迹被误标。状态按证据升级,不按长度。

踩坑 2:跳过 Docker 验证

  • 现象:verifier 没在隔离环境跑过就信任。
  • 原因:未验证的 verifier 可能不可靠。
  • 解决:验证在可弃 Docker 世界跑(无源码 bind mount、无 Docker socket、无 host 网络、无特权、无 host 凭证)。

踩坑 3:/evolve 没有 held-out 资产

  • 现象:只跑 /evolve 1 就宣称经验迁移有效。
  • 原因:无对照,只是接线 smoke test,不能证明迁移。
  • 解决:/evolve 1 2——asset 1 探索压缩,asset 2 必须是同仓库独立构建的 held-out 任务,比较基线/条件化 solver 尝试。

踩坑 4:把「加长补丁」当「任务加固」

  • 现象:以为把补丁写长就是变难。
  • 原因:加固必须加可测行为、兼容性、边界用例或失败约束。
  • 解决:/harden 1 只认可测的新约束,加长不算加固。

踩坑 5:混淆状态含义

  • 现象:看到「Buildable」以为可执行。
  • 原因:状态即证据——Buildable 只表示任务/仓库基/重构置信度/参考补丁/verifier 命令/环境门通过;Bundle generated 的 verifier 尚未可信。
  • 解决:只有 Verified(Docker 双态验证通过)才表示 verifier 可信。

初级用法

无模型挖掘

/init
/candidates
/show 1

本地导入和确定性挖掘不需要模型,先摸清历史里有什么值得保留。

常用配方

  • 编译并独立验证可执行任务:/review 1/build 1/validate 1/runs
  • 让简单任务变难:/harden 1/calibrate 2
  • 测试经验迁移:/evolve 1 2

命令参考

/init [all|codex|claude]/candidates/search/show/review/build/validate/harden/calibrate/evolve/assets/runs/doctor

高级玩法

失败关闭(fail closed)

空 prompt 包装、低置信重构、缺失参考补丁、缺失验证命令、不支持的 environment、候选切换、资产谱系不匹配——全部失败关闭,不产生带缺陷资产。

最小权限四角色

Orchestrator 暴露固定域工具而非任意 host shell;Builder 不能批准自己的 verifier(Verifier Critic 是独立子会话);自我对弈和进化是显式操作(会把选定任务上下文发给配置的模型)。

沙箱契约

读 docs/sandbox-contract.md、task-quality-standard.md、schema.md、design.md 了解规范性边界。

小技巧

  1. /candidates/review:只评审证据强的候选,省模型成本。
  2. 拒绝也是收获:一条弱轨迹被拒绝,防止它被误标为训练就绪。
  3. 验证看 digest:Verified 状态对照确切 bundle digest 记录,注意谱系一致性。
  4. 难度看新尝试:用 /calibrate 的 solver 尝试衡量难度,别猜 token 数。
  5. held-out 是迁移的硬前提:没有独立 held-out 任务的 /evolve 只是接线测试。

常见问题 FAQ

Q1: EvoTrace 是又一个 coding agent 吗?

A: 不是。它是构建在 DeepSeek Harness 上的轨迹编译器,不改你使用 Claude Code/Codex 的方式。它把已存在的工作编译成训练/评估/验证资产。

Q2: 我的代码和数据会上云吗?

A: 导入和挖掘读本地历史与 Git 证据,不改源仓库;验证在可弃 Docker 世界跑;只有 self-play/evolution 会把选定任务上下文发给配置的模型(显式操作)。

Q3: 需要 Docker 吗?

A: 只在构建或验证可执行环境时需要;本地导入和确定性挖掘不需要。

Q4: 产出什么资产?

A: 候选目录、偏好/恢复数据(DPO/SFT/QA)、可执行任务包(eval/RL)、verifier 和奖励候选、难度证据、执行经验。同一验证任务今天可评测、明天可评分、之后可产 RL 数据。

Q5: 现在是正式版吗?

A: 早期 alpha,DeepSeek Harness 是开发者预览。生成的任务和 verifier 在通过证据和 Docker 验证门之前仍是候选。

参考链接

本文基于公开资料整理(GitHub 仓库 README,数据核验日期 2026-08-27),AI 辅助生成。

📊 评分与标签

评分说明

总分 8.0/10 · P_优选

📊 可观测社区指标(采集日期:2026-08-27)

  • GitHub: jinzijian/EvoTrace ★160, 🔱5(GitHub API 实时验证)
  • License: Apache-2.0;最后推送:2026-08-21(采集日前 6 天,活跃)
  • 基础:DeepSeek Harness(开发者预览);状态:早期 alpha

📋 流程完整性 2.5/3.0

  • 覆盖「导入考古→候选筛选→四 Agent 顺序评审→Docker 验证/校准」的轨迹到后训练资产完整闭环;状态即证据(Mined→Buildable→Bundle generated→Verified→Calibrated)+ 失败关闭;不足是 DPO/SFT/RL 导出器仍在进行、Marketplace 是 roadmap。
  • 竞品对比 1(手写数据集脚本):无考古、无 verifier、无谱系。
  • 竞品对比 2(RepoLaunch):只做环境重建,不挖任务和学习信号。

🔄 可复用性 2.0/2.5

  • 同一验证任务今天评测、明天评分、之后产 RL 数据;产出多种资产(偏好/恢复数据、可执行任务包、verifier/奖励候选、难度证据、执行经验);但早期 alpha,复用受限于 DeepSeek Harness 预览状态。
  • 竞品对比 1(一次性数据集脚本):不可版本化、不可复用。
  • 竞品对比 2(托管 RL 平台):可复用但数据出本地。

📖 文档清晰度 1.7/2.0

  • README 含核心工作流 ASCII 图、状态即证据表、命令参考、沙箱契约/任务质量标准/schema/design 四文档链接;中英双语;但概念密集,入门需读多份文档。
  • 竞品对比 1(同量级项目):文档更系统。
  • 竞品对比 2(ARTEMIS):单 README 更直白。

🔧 工具集成 1.1/1.5

  • 构建于 DeepSeek Harness(Web UI/sessions/streaming/slash commands/插件运行时),集成 Git 考古、Docker 验证、四角色 Orchestrator;受 Harness 预览状态约束。
  • 竞品对比 1(Artemis):MCP 集成更丰富。
  • 竞品对比 2(独立 CLI 工具):集成面更窄。

💡 创新性 0.7/1.0

  • 「把真实 coding-agent 轨迹编译为经验证、可交易的后训练资产」的定位独特,状态即证据 + 最小权限四角色 + 失败关闭的工程纪律出众;但本质是 Harness 之上的专业分布,非全新范式。
  • 竞品对比 1(RepoLaunch):先例存在(仓库→环境),EvoTrace 更早地挖学习信号。
  • 竞品对比 2(RL 数据合成工具):无真实轨迹 provenance。

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

🏷️ 标签说明

📋 来源核实

  • ✅ 已验证: GitHub 仓库 - stars/forks/license/pushed_at 经 GitHub API 实时核验(2026-08-27)
  • ✅ 已验证: 官方 README - 核心工作流/状态表/命令参考/安全边界逐条比对
  • ⚠️ 未实测: 实际导入轨迹并编译资产
  • ⚠️ 未验证: 双态验证、自对弈校准为作者自述

⚠️ 局限与未实测声明

  • 本文基于 2026-08-27 GitHub 公开 README 整理,未实际运行 EvoTrace
  • 早期 alpha,DeepSeek Harness 开发者预览,功能稳定性与产出质量未独立验证
  • 竞品对比基于公开文档,未经同环境实测