Reverify
Reverify:反幻觉验证工具——AI 提议声明,确定性工具对照真实工件裁决,只放行核验通过的事实;附会话无损轮换(rollover)。MCP server + CLI,支持 Claude Code/Codex/Gemini CLI/OpenCode。Python + MIT。
评分明细
适用场景
这是什么?适合谁?
Reverify(2akouwu/reverify)是一个反幻觉验证工具,主打一句话:“Stop your AI from making things up”。它的机制是让确定性工具当裁判:模型提出一条结构性或行为性声明(比如某个 API 存在、某个 struct 字段偏移是多少、某函数做什么),工具拿真实工件去核对,返回 VERIFIED / REFUTED 加证据——模型永远不能自说自话地把推断当事实。
它今天做两件事:
reverify verify:对 AI 的每条声明做地面真值核验,只有活下来的才算事实(也可以通过 MCP server 让你的 agent 直接调用)reverify rollover:把当前会话无损交接给文件并开启新会话,替代有损的自动摘要,让长任务不漂移、不需要/clear——支持 Claude Code、Codex、Gemini CLI 和 OpenCode
适合谁:重度使用编码 Agent 且被幻觉 API/字段/偏移量坑过的开发者;想在 CI 里给 AI 产出加”事实门禁”的工程团队;做二进制逆向、需要 AI 辅助但不敢信 AI 结论的安全研究员。
不适合:只用 AI 写散文、对事实精度不敏感的用户;需要生成内容而非核验内容的场景。
使用前提:Python 3 环境;MCP 宿主(Claude Code/Codex 等)可选——CLI 也能独立用。
准备工作
- 安装:
pip install reverify(PyPI 包 reverify) - 环境:Python 3.x;要接 agent 则准备一个受支持的 CLI(Claude Code / Codex / Gemini CLI / OpenCode)
- 准备:被核验的目标工件(源码 / 二进制 / 文档)
- 成本:MIT 开源免费
- 时间:装好后 10 分钟内可跑通第一条核验
快速上手(3 步)
第一步:安装
pip install reverify
得到 reverify CLI(含 verify 与 rollover 两个子命令)。
第二步:跑第一条核验
reverify verify
按提示让 AI 先对目标工件提出声明(例如某个字段的偏移量),reverify 对照真实工件裁决并输出 VERIFIED / REFUTED 与证据。
第三步:接进你的编码 Agent(MCP)
reverify mcp
把 MCP server 挂到 Claude Code / Codex / Gemini CLI / OpenCode,此后 agent 的结构性声明会自动走核验通道,不再裸奔。
成功判定:一条错误声明被 REFUTED 且附带反证证据;一条正确声明 VERIFIED 通过。
初级用法
- API 存在性核验:AI 声称”某库有
foo(x)函数”——verify 直接对源码/文档裁决,不存在即 REFUTED - 字段偏移核验:逆向场景下 AI 报 struct 偏移,工具对二进制实测
- 上下文轮换:长会话执行到 token 高位时
reverify rollover,开新会话但保留完整文件化上下文 - CI 门禁:把核验命令加入流水线,AI 相关产出不通过事实门禁就红
高级玩法
- 反幻觉基准复现:
python benchmarks/prologue_prior.py——官方在 71 个真实 Windows 系统文件上测得 AI 教科书式回答 97% 错误、reverify 0 条放行;同一门禁在 CI 的 Linux/macOS 每次推送运行,并有独立 aarch64 复核 - 长任务防漂移流水线:verify(事实锁定)+ rollover(无损续命)组合,跑数小时级 agent 任务不因上下文腐化而累积幻觉
- 二进制逆向辅助:把 reverify 当作逆向 agent 的”可信度过滤器”,AI 只负责提议,PE/ELF 解析器负责裁决
常见踩坑
- 症状:核验结果全是 REFUTED。 原因:AI 声明本身多为幻觉(官方基准里错误率高达 97%),这不是工具坏了。解决:把 REFUTED 当作工作清单——让 agent 根据反证证据修正后重提。
- 症状:rollover 后新会话”失忆”。 原因:误以为 rollover 是自动摘要。解决:上下文完整保存在交接文件里,让新会话按需读取该文件,而不是依赖压缩摘要。
- 症状:MCP 客户端连不上。 原因:宿主版本或启动命令不匹配。解决:按仓库文档确认
reverify mcp的 stdio 配置;四 CLI(Claude Code/Codex/Gemini CLI/OpenCode)为官方验证路径。 - 症状:非 Python 技术栈想用。 原因:CLI 是 Python 的。解决:走 MCP 协议接入(语言无关),或把 verify 挂成外部命令。
- 症状:担心工具太慢。 原因:每条声明都做实测核验。解决:只对关键结构性声明启用,叙事性内容不必全量核验。
小技巧
- 先核验”事实密度最高”的声明(API 签名、偏移量、配置项),性价比远高于核验描述性文字。
- CI 中把 reverify 与你现有的测试并排跑,红色即阻断——它就是给 AI 产出加的单元测试。
- rollover 交接文件本身可 grep、可 diff,长任务结束后是很好的复盘材料。
- 逆向场景搭配 EXAMPLE.md 的 kernel32.dll 案例(幻觉 prologue 被当场抓获)能快速理解裁决格式。
常见问题 FAQ
Q1: 它和让另一个 LLM 复查有什么区别?
A: 复查仍是概率判断;reverify 用确定性工具对照真实工件实测,输出带证据的 VERIFIED/REFUTED。官方基准里 71 条错误声明全部被捕获、0 条被放行(同门禁在 CI 三平台运行)。
Q2: 免费吗?什么协议?
A: MIT 开源免费,PyPI 可装。
Q3: 支持哪些 agent 宿主?
A: MCP server 模式支持 Claude Code、Codex、Gemini CLI、OpenCode;CLI 本身宿主无关。
Q4: rollover 会丢上下文吗?
A: 设计目标恰恰是替代有损 auto-summary:会话交给文件、新会话读取文件,事实与上下文在重置间存活(“grounded facts and context survive resets”)。
Q5: 项目很新,可靠吗?
A: 仓库 2026-08-31 创建、9 天 1038★,MIT、CI 在跑、9 月 7 日仍在推送;但确实极新,生产采用建议先小范围试点(本站未实测全部功能)。
Q6: 只能用于逆向吗?
A: 不是。逆向只是幻觉最严重的”证明场”;任何”AI 声明可被确定性工具核对”的场景(源码 API、文档、配置)都适用。
参考链接
本文基于公开资料(GitHub 官方 README 与基准文档)整理,AI 辅助生成,未做本地安装实测;采集日期 2026-09-09。功能与数据以官方仓库最新说明为准。
📊 评分与标签
评分说明
总分 8.6/10 · P_优选
📊 可观测社区指标(采集日期:2026-09-09)
- GitHub: 2akouwu/reverify ★1038, 🔱216(GitHub API 实时验证)
- PyPI: reverify 可安装;Python
- License: MIT;仓库创建 2026-08-31,最后推送 2026-09-07(≈9 天 1038★/216 fork)
- CI:GitHub Actions 每次推送在 Linux/macOS 运行同一验证门;独立 aarch64 复核一致
- ⚠️ 仓库极新(9 天),热度可持续性与项目成熟度待观察
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
📦 可安装性 2.2/2.5
pip install reverify/ PyPI 包发布正常,另有 MCP server 模式(reverify mcp)可挂到 Claude Code、Codex、Gemini CLI、OpenCode- 提供两个开箱能力:
reverify verify(声明核验)与reverify rollover(上下文无损轮换),均无重型依赖 - 限制:MCP server 接入细节与各 CLI 兼容矩阵需按官方文档逐项确认,本站未逐一实测
- 竞品对比 1(自写 LLM 断言脚本):无统一证据格式与 CI 门禁,reverify 提供标准化 VERIFIED/REFUTED 回执
- 竞品对比 2(Guardrails/Pydantic AI 类校验库):偏输出结构校验,reverify 直接对”结构性/行为性事实声明”对源工件核验
🎯 实用性 2.3/2.5
- 解决 LLM 最高频失效模式:幻觉 API、字段、偏移量、函数行为——模型提议,确定性工具裁决,只放行核验通过的事实
- 硬核证据:71 个真实 Windows 系统文件上 AI 教科书式回答错误率 97%,reverify 全部捕获、0 条错误声明被放行;同一门禁在 CI 的 Linux/macOS 每次推送运行
rollover把会话交接给文件再开新会话,替代有损 auto-summary,缓解长任务上下文腐化(Claude Code/Codex/Gemini CLI/OpenCode)- 限制:覆盖以二进制逆向为主战场,其他域(纯 Web API 声明等)效果需自评
- 竞品对比 1(手动 review AI 结论):不可扩展、不可 CI 化;reverify 把裁决自动化并可入流水线
- 竞品对比 2(仅靠模型自评/second-opinion prompt):仍是概率判断;reverify 用确定性工具对工件实测,非概率自评
📖 文档质量 1.7/2.0
- README 含清晰问题陈述、两条能力线、基准方法(
python benchmarks/prologue_prior.py可复现)、demo 动图 - EXAMPLE.md/BENCHMARK.md 提供可复现实验与独立架构复核记录
- 限制:中文资料缺失;MCP 各客户端接入的逐步文档分散在仓库内,需自行翻找
- 竞品对比 1(同类反幻觉工具):多数只有营销页;reverify 附可复现基准
- 竞品对比 2(学术原型):论文有代码无维护;reverify 有 CI、PyPI 与活跃推送
👥 社区活跃 1.3/1.5
- 9 天 1038★/216 fork,fork/star 比例正常(约 21%);最后推送 2026-09-07,3 天内仍活跃
- 来源:GitHub API(采集日期 2026-09-09)
- 4 个 open issues,处理节奏待观察;无大型组织背书,个人主导项目
- 竞品对比 1(Guardrails 类):大厂或基金背书更稳但方向不同
- 竞品对比 2(dspy 断言机制):社区大但需自建裁决工具链
🔗 兼容性 1.1/1.5
- 明确支持 Claude Code、Codex、Gemini CLI、OpenCode 四个主流 CLI(MCP server + rollover 均覆盖)
- Python 3.x 主线;二进制逆向基准绑定 Windows PE 场景,跨平台核验逻辑在 CI 三平台运行
- 限制:未声明对其他 MCP 宿主(如 Cursor)的官方支持;非 Python 技术栈只能走 MCP 协议接入
- 竞品对比 1(单一 CLI 专用方案):只能服务一个宿主
- 竞品对比 2(通用断言框架):宿主无关但装配成本高
🏷️ 标签说明
- AI安全: 定位反幻觉/事实验证基础设施,把 AI 声明置于确定性裁决之下。来源:GitHub README
- 开源免费: MIT 开源。来源:GitHub
- MCP: 提供 MCP server 模式接入任意 MCP 客户端。来源:GitHub README
- 反幻觉: 核心主张即”Stop your AI from making things up”,71 文件 0 错误放行的基准支撑。来源:BENCHMARK.md
- 质量门禁: 同一门禁可进 CI 每次推送运行(Linux/macOS)。来源:GitHub README
📋 来源核实
- ✅ 已核验: GitHub 仓库 — 2026-09-09 通过 GitHub API 实时核验:★1038、🔱216、MIT、created 2026-08-31、pushed 2026-09-07、4 open issues、未归档
- ✅ 已核验: README.md — 2026-09-09 抓取全文:反幻觉定位、
reverify verify/reverify rollover两条能力线、71 文件 97% 错误率/0 错误放行基准、MCP 与四 CLI 支持 - ⚠️ 未实测:本站未在本地 Claude Code/Codex 中实际安装运行 reverify;
pip install reverify与 MCP 接入步骤均以官方文档为准