Reverify

Reverify:反幻觉验证工具——AI 提议声明,确定性工具对照真实工件裁决,只放行核验通过的事实;附会话无损轮换(rollover)。MCP server + CLI,支持 Claude Code/Codex/Gemini CLI/OpenCode。Python + MIT。

📊 评分明细

📦 打包完整度
2.2 2.2 / 2.5
🎯 实用性
2.2 2.2 / 2.5
📖 文档清晰度
1.7 1.7 / 2
👥 社区影响力
1.3 1.3 / 1.5
🔗 集成度
1.3 1.3 / 1.5

🎯 适用场景

AI安全开源免费MCP反幻觉质量门禁

这是什么?适合谁?

Reverify(2akouwu/reverify)是一个反幻觉验证工具,主打一句话:“Stop your AI from making things up”。它的机制是让确定性工具当裁判:模型提出一条结构性或行为性声明(比如某个 API 存在、某个 struct 字段偏移是多少、某函数做什么),工具拿真实工件去核对,返回 VERIFIED / REFUTED 加证据——模型永远不能自说自话地把推断当事实。

它今天做两件事:

  1. reverify verify:对 AI 的每条声明做地面真值核验,只有活下来的才算事实(也可以通过 MCP server 让你的 agent 直接调用)
  2. reverify rollover:把当前会话无损交接给文件并开启新会话,替代有损的自动摘要,让长任务不漂移、不需要 /clear——支持 Claude Code、Codex、Gemini CLI 和 OpenCode

适合谁:重度使用编码 Agent 且被幻觉 API/字段/偏移量坑过的开发者;想在 CI 里给 AI 产出加”事实门禁”的工程团队;做二进制逆向、需要 AI 辅助但不敢信 AI 结论的安全研究员。

不适合:只用 AI 写散文、对事实精度不敏感的用户;需要生成内容而非核验内容的场景。

使用前提:Python 3 环境;MCP 宿主(Claude Code/Codex 等)可选——CLI 也能独立用。

准备工作

  1. 安装:pip install reverify(PyPI 包 reverify
  2. 环境:Python 3.x;要接 agent 则准备一个受支持的 CLI(Claude Code / Codex / Gemini CLI / OpenCode)
  3. 准备:被核验的目标工件(源码 / 二进制 / 文档)
  4. 成本:MIT 开源免费
  5. 时间:装好后 10 分钟内可跑通第一条核验

快速上手(3 步)

第一步:安装

pip install reverify

得到 reverify CLI(含 verifyrollover 两个子命令)。

第二步:跑第一条核验

reverify verify

按提示让 AI 先对目标工件提出声明(例如某个字段的偏移量),reverify 对照真实工件裁决并输出 VERIFIED / REFUTED 与证据。

第三步:接进你的编码 Agent(MCP)

reverify mcp

把 MCP server 挂到 Claude Code / Codex / Gemini CLI / OpenCode,此后 agent 的结构性声明会自动走核验通道,不再裸奔。

成功判定:一条错误声明被 REFUTED 且附带反证证据;一条正确声明 VERIFIED 通过。

初级用法

  • API 存在性核验:AI 声称”某库有 foo(x) 函数”——verify 直接对源码/文档裁决,不存在即 REFUTED
  • 字段偏移核验:逆向场景下 AI 报 struct 偏移,工具对二进制实测
  • 上下文轮换:长会话执行到 token 高位时 reverify rollover,开新会话但保留完整文件化上下文
  • CI 门禁:把核验命令加入流水线,AI 相关产出不通过事实门禁就红

高级玩法

  • 反幻觉基准复现python benchmarks/prologue_prior.py——官方在 71 个真实 Windows 系统文件上测得 AI 教科书式回答 97% 错误、reverify 0 条放行;同一门禁在 CI 的 Linux/macOS 每次推送运行,并有独立 aarch64 复核
  • 长任务防漂移流水线:verify(事实锁定)+ rollover(无损续命)组合,跑数小时级 agent 任务不因上下文腐化而累积幻觉
  • 二进制逆向辅助:把 reverify 当作逆向 agent 的”可信度过滤器”,AI 只负责提议,PE/ELF 解析器负责裁决

常见踩坑

  1. 症状:核验结果全是 REFUTED。 原因:AI 声明本身多为幻觉(官方基准里错误率高达 97%),这不是工具坏了。解决:把 REFUTED 当作工作清单——让 agent 根据反证证据修正后重提。
  2. 症状:rollover 后新会话”失忆”。 原因:误以为 rollover 是自动摘要。解决:上下文完整保存在交接文件里,让新会话按需读取该文件,而不是依赖压缩摘要。
  3. 症状:MCP 客户端连不上。 原因:宿主版本或启动命令不匹配。解决:按仓库文档确认 reverify mcp 的 stdio 配置;四 CLI(Claude Code/Codex/Gemini CLI/OpenCode)为官方验证路径。
  4. 症状:非 Python 技术栈想用。 原因:CLI 是 Python 的。解决:走 MCP 协议接入(语言无关),或把 verify 挂成外部命令。
  5. 症状:担心工具太慢。 原因:每条声明都做实测核验。解决:只对关键结构性声明启用,叙事性内容不必全量核验。

小技巧

  • 先核验”事实密度最高”的声明(API 签名、偏移量、配置项),性价比远高于核验描述性文字。
  • CI 中把 reverify 与你现有的测试并排跑,红色即阻断——它就是给 AI 产出加的单元测试。
  • rollover 交接文件本身可 grep、可 diff,长任务结束后是很好的复盘材料。
  • 逆向场景搭配 EXAMPLE.md 的 kernel32.dll 案例(幻觉 prologue 被当场抓获)能快速理解裁决格式。

常见问题 FAQ

Q1: 它和让另一个 LLM 复查有什么区别?

A: 复查仍是概率判断;reverify 用确定性工具对照真实工件实测,输出带证据的 VERIFIED/REFUTED。官方基准里 71 条错误声明全部被捕获、0 条被放行(同门禁在 CI 三平台运行)。

Q2: 免费吗?什么协议?

A: MIT 开源免费,PyPI 可装。

Q3: 支持哪些 agent 宿主?

A: MCP server 模式支持 Claude Code、Codex、Gemini CLI、OpenCode;CLI 本身宿主无关。

Q4: rollover 会丢上下文吗?

A: 设计目标恰恰是替代有损 auto-summary:会话交给文件、新会话读取文件,事实与上下文在重置间存活(“grounded facts and context survive resets”)。

Q5: 项目很新,可靠吗?

A: 仓库 2026-08-31 创建、9 天 1038★,MIT、CI 在跑、9 月 7 日仍在推送;但确实极新,生产采用建议先小范围试点(本站未实测全部功能)。

Q6: 只能用于逆向吗?

A: 不是。逆向只是幻觉最严重的”证明场”;任何”AI 声明可被确定性工具核对”的场景(源码 API、文档、配置)都适用。

参考链接

本文基于公开资料(GitHub 官方 README 与基准文档)整理,AI 辅助生成,未做本地安装实测;采集日期 2026-09-09。功能与数据以官方仓库最新说明为准。

📊 评分与标签

评分说明

总分 8.6/10 · P_优选

📊 可观测社区指标(采集日期:2026-09-09)

  • GitHub: 2akouwu/reverify ★1038, 🔱216(GitHub API 实时验证)
  • PyPI: reverify 可安装;Python
  • License: MIT;仓库创建 2026-08-31,最后推送 2026-09-07(≈9 天 1038★/216 fork)
  • CI:GitHub Actions 每次推送在 Linux/macOS 运行同一验证门;独立 aarch64 复核一致
  • ⚠️ 仓库极新(9 天),热度可持续性与项目成熟度待观察

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

📦 可安装性 2.2/2.5

  • pip install reverify / PyPI 包发布正常,另有 MCP server 模式(reverify mcp)可挂到 Claude Code、Codex、Gemini CLI、OpenCode
  • 提供两个开箱能力:reverify verify(声明核验)与 reverify rollover(上下文无损轮换),均无重型依赖
  • 限制:MCP server 接入细节与各 CLI 兼容矩阵需按官方文档逐项确认,本站未逐一实测
  • 竞品对比 1(自写 LLM 断言脚本):无统一证据格式与 CI 门禁,reverify 提供标准化 VERIFIED/REFUTED 回执
  • 竞品对比 2(Guardrails/Pydantic AI 类校验库):偏输出结构校验,reverify 直接对”结构性/行为性事实声明”对源工件核验

🎯 实用性 2.3/2.5

  • 解决 LLM 最高频失效模式:幻觉 API、字段、偏移量、函数行为——模型提议,确定性工具裁决,只放行核验通过的事实
  • 硬核证据:71 个真实 Windows 系统文件上 AI 教科书式回答错误率 97%,reverify 全部捕获、0 条错误声明被放行;同一门禁在 CI 的 Linux/macOS 每次推送运行
  • rollover 把会话交接给文件再开新会话,替代有损 auto-summary,缓解长任务上下文腐化(Claude Code/Codex/Gemini CLI/OpenCode)
  • 限制:覆盖以二进制逆向为主战场,其他域(纯 Web API 声明等)效果需自评
  • 竞品对比 1(手动 review AI 结论):不可扩展、不可 CI 化;reverify 把裁决自动化并可入流水线
  • 竞品对比 2(仅靠模型自评/second-opinion prompt):仍是概率判断;reverify 用确定性工具对工件实测,非概率自评

📖 文档质量 1.7/2.0

  • README 含清晰问题陈述、两条能力线、基准方法(python benchmarks/prologue_prior.py 可复现)、demo 动图
  • EXAMPLE.md/BENCHMARK.md 提供可复现实验与独立架构复核记录
  • 限制:中文资料缺失;MCP 各客户端接入的逐步文档分散在仓库内,需自行翻找
  • 竞品对比 1(同类反幻觉工具):多数只有营销页;reverify 附可复现基准
  • 竞品对比 2(学术原型):论文有代码无维护;reverify 有 CI、PyPI 与活跃推送

👥 社区活跃 1.3/1.5

  • 9 天 1038★/216 fork,fork/star 比例正常(约 21%);最后推送 2026-09-07,3 天内仍活跃
    • 来源:GitHub API(采集日期 2026-09-09)
  • 4 个 open issues,处理节奏待观察;无大型组织背书,个人主导项目
  • 竞品对比 1(Guardrails 类):大厂或基金背书更稳但方向不同
  • 竞品对比 2(dspy 断言机制):社区大但需自建裁决工具链

🔗 兼容性 1.1/1.5

  • 明确支持 Claude Code、Codex、Gemini CLI、OpenCode 四个主流 CLI(MCP server + rollover 均覆盖)
  • Python 3.x 主线;二进制逆向基准绑定 Windows PE 场景,跨平台核验逻辑在 CI 三平台运行
  • 限制:未声明对其他 MCP 宿主(如 Cursor)的官方支持;非 Python 技术栈只能走 MCP 协议接入
  • 竞品对比 1(单一 CLI 专用方案):只能服务一个宿主
  • 竞品对比 2(通用断言框架):宿主无关但装配成本高

🏷️ 标签说明

  • AI安全: 定位反幻觉/事实验证基础设施,把 AI 声明置于确定性裁决之下。来源:GitHub README
  • 开源免费: MIT 开源。来源:GitHub
  • MCP: 提供 MCP server 模式接入任意 MCP 客户端。来源:GitHub README
  • 反幻觉: 核心主张即”Stop your AI from making things up”,71 文件 0 错误放行的基准支撑。来源:BENCHMARK.md
  • 质量门禁: 同一门禁可进 CI 每次推送运行(Linux/macOS)。来源:GitHub README

📋 来源核实

  • ✅ 已核验: GitHub 仓库 — 2026-09-09 通过 GitHub API 实时核验:★1038、🔱216、MIT、created 2026-08-31、pushed 2026-09-07、4 open issues、未归档
  • ✅ 已核验: README.md — 2026-09-09 抓取全文:反幻觉定位、reverify verify/reverify rollover 两条能力线、71 文件 97% 错误率/0 错误放行基准、MCP 与四 CLI 支持
  • ⚠️ 未实测:本站未在本地 Claude Code/Codex 中实际安装运行 reverify;pip install reverify 与 MCP 接入步骤均以官方文档为准