这是什么?适合谁?
CDAF(UditAkhourii/cdaf,Cached Descriptive Asset Files)是一个开源视频侧车文件格式,解决 AI Agent 处理视频时「反复重分析同一段视频」造成的 token 浪费。
问题:当多个 Agent 或同一个 Agent 的多次会话都要理解同一段视频时,每次都重新把视频喂给视觉模型做帧分析——既慢又烧钱。CDAF 的做法是:第一次分析视频后,把描述性结果缓存成一份侧车文件,之后任何 Agent 直接读缓存,不必重新解析视频。
核心价值:把「视频理解」从重复计算变成一次计算、多次复用,显著降低视频场景的 token 与延迟成本。
适合人群:
- 构建视频理解 / 视频问答 Agent 的开发者
- 需要批量处理大量视频、又不想为每个视频反复付费的团队
- 关注「Agent 基础设施标准化」的研究者(含可复现基准)
使用前提:Python 环境;有视频处理 / 视觉模型调用需求;理解「侧车文件」= 与视频并存的描述性元数据文件。
准备工作
- Python 3.10+:CLI 用 Python 编写。
- 成本:MIT 开源,完全免费;真正的开销来自你调用的视觉模型。
- 视频素材:准备一段用于测试的视频文件。
- 时间预算:安装 + 跑通第一个缓存流程约 15 分钟。
- 学术关联:仓库附 Zenodo 记录(zenodo.org/records/22110594),便于引用与复现。
快速上手(3 步)
第一步:安装
git clone https://github.com/UditAkhourii/cdaf
cd cdaf
pip install -r requirements.txt # 具体依赖以 README 为准
第二步:为视频生成侧车文件
python cdaf.py analyze video.mp4 --output video.cdaf
工具调用视觉模型分析视频,产出描述性缓存文件(关键帧、场景、对象、时间戳等结构化描述)。
第三步:让 Agent 读缓存而非重分析
后续任何 Agent 任务直接读取 video.cdaf,跳过重复的视频重分析。
成功判定:同一段视频第二次处理时,不再发起视觉模型调用,而是从 .cdaf 缓存直接加载描述,耗时与 token 显著下降。
初级用法
侧车文件里有什么
- 结构化描述:场景、对象、动作、对话等语义信息
- 时间戳对齐:描述与视频时间轴对应,便于按片段检索
- 可复用元数据:一次生成,多个 Agent 共享
Spec + CLI + Skill 三件套
仓库提供格式规范(Spec)、命令行工具(CLI)与 Agent Skill 封装,方便把「生成缓存 → 读取缓存」接入现有 Agent 工作流。
高级玩法
批量视频预处理
对视频库批量跑 analyze,一次性建好全部侧车文件,后续所有 Agent 任务都走缓存路径,成本只付一次。
可复现基准
仓库带可复现基准(配合 Zenodo 记录),可以量化「用缓存 vs 不用缓存」在 token / 延迟上的差异,用于说服团队采纳。
接入 Agent Skill
用仓库提供的 Skill 封装,让 Claude Code / Codex 等 Agent 自动在需要时生成与读取 .cdaf 文件,无需人工干预。
小技巧
- 缓存粒度按需:侧车文件可按「整段视频」或「按片段」粒度生成,根据检索需求选择。
- 先测基准再推广:用仓库基准先量出节省比例,再决定覆盖范围。
- 时间戳对齐很关键:确保描述带时间戳,按片段检索才有效。
- Zenodo 引用:学术用途可引用 Zenodo 记录保证可复现性。
- 版本管理:视频更新后需重新生成缓存,避免描述与画面漂移。
常见踩坑
踩坑 1:视频变了但缓存没更新
- 现象:Agent 读到的描述与视频实际内容不符。
- 原因:视频文件被替换/剪辑后,旧
.cdaf仍指向旧描述。 - 解决:视频内容变更后必须重新
analyze生成新缓存。
踩坑 2:以为缓存零成本
- 现象:首次生成缓存仍要付视觉模型调用费。
- 原因:缓存省的是「重复分析」,不是「第一次分析」。
- 解决:只有多次复用同一视频时收益才明显;一次性处理无节省。
踩坑 3:格式不兼容
- 现象:别的工具读不了
.cdaf。 - 原因:这是新格式,生态尚未普及。
- 解决:确认下游工具支持;必要时按 Spec 自行转换。
踩坑 4:大视频缓存文件膨胀
- 现象:侧车文件过大拖慢加载。
- 原因:描述粒度太细、关键帧太多。
- 解决:按需求调整粒度,只保留必要的关键帧与语义。
踩坑 5:忽略视觉模型差异
- 现象:换模型后缓存质量/格式漂移。
- 原因:不同视觉模型输出风格不同。
- 解决:固定模型版本,或重新生成缓存保持一致性。
常见问题 FAQ
Q1: CDAF 和普通视频转写(transcription)有什么区别?
A: 转写只覆盖语音文本;CDAF 侧车文件是更广的「描述性资产」,可包含视觉场景、对象、动作等多模态语义,并带时间戳对齐。
Q2: 它省的是什么钱?
A: 省的是「重复视频理解」的视觉模型 token 与延迟。同一视频被多个 Agent / 多次会话复用时收益最大。
Q3: 需要联网吗?
A: 生成缓存需要调用视觉模型(可能联网);读取缓存是本地操作。
Q4: 支持哪些视频格式?
A: 具体支持列表以仓库 Spec 为准,常见视频格式通常可处理。
Q5: 现在是稳定版吗?
A: 项目较新(2026-08 创建),带可复现基准但尚未大规模生产验证,生产使用前先跑通端到端。
进阶学习建议
掌握基础后,建议深入:
- 视频库缓存流水线:把「批量 analyze → 缓存入库 → Agent 读缓存」做成定时 pipeline,视频理解成本只付一次。
- 缓存失效策略:建立「视频 hash → 缓存版本」的映射,视频变更自动触发重新分析。
- 可复现成本报告:用仓库基准方法产出「缓存前后 token/延迟对比」报告,量化 ROI。
参考链接
最后更新:2026-08-28 · 作者:MagicNetWorld · 基于公开资料整理,关键数据经 GitHub API 独立实测核验,AI 辅助生成
📊 评分与标签
评分说明
总分 8.2/10 · P_优选
📊 可观测社区指标(采集日期:2026-08-28)
- GitHub: UditAkhourii/cdaf ★95, 🔱6(GitHub API 实时验证)
- License: MIT;仓库创建 2026-08-26,最后推送 2026-08-27(活跃)
- 语言: Python;附 Zenodo 记录(22110594)与可复现基准
⚙️ 功能完整度 2.1/2.5
- 提供 Spec + CLI + Agent Skill + 可复现基准,覆盖「生成缓存 → 读取缓存」全链路;不足是生态尚新、下游工具支持面窄。
- 来源:官方仓库
- 竞品对比 1(逐次视频重分析):功能等价但每次重复烧 token。
- 竞品对比 2(通用视频转写工具):只覆盖语音文本,缺少多模态描述资产。
✨ 输出质量 2.0/2.5
- 结构化描述 + 时间戳对齐,可复用性好;但描述质量依赖所选视觉模型,模型换挡后一致性无保证。
- 来源:官方仓库
- 竞品对比 1(手写帧分析脚本):输出不可复用、无标准格式。
- 竞品对比 2(商业视频理解 API):质量稳定但按次计费、不缓存复用。
🖐️ 易用性 1.2/1.5
- 一条 analyze 命令生成缓存,接入简单;但需理解「侧车文件」范式,且格式新颖学习成本存在。
- 来源:官方仓库
- 竞品对比 1(平台上传即分析):零安装上手更简单。
- 竞品对比 2(自建缓存层):完全可控但要自己设计格式。
💰 性价比 1.4/1.5
- MIT 开源免费,缓存复用直接降低重复分析成本;一次性处理无节省,复用场景 ROI 高。
- 来源:GitHub API
- 竞品对比 1(逐次调用商业 API):重复分析成本累加。
- 竞品对比 2(商业视频理解 SaaS):订阅费用高、无缓存复用。
🔒 稳定性 0.8/1.0
- 项目极新(创建 2026-08-26),活跃但尚缺长期生产验证。
- 来源:GitHub API
- 竞品对比 1(成熟转写服务):商业级稳定性更高。
- 竞品对比 2(自家缓存脚本):久经使用但缺乏标准化。
🛡️ 隐私安全 0.7/1.0
- 缓存本地存储,视频不必反复外发;但首次分析需调用视觉模型(数据可能出本地)。
- 来源:官方仓库
- 竞品对比 1(纯本地脚本):零外发但需自己搭分析能力。
- 竞品对比 2(云视频平台):视频全程托管在第三方。
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
🏷️ 标签说明
- AI视频生成: 面向视频理解与生成的 Agent 基础设施。来源:官方仓库
- 开源免费: MIT 协议。来源:GitHub API
- 视频理解: 核心是视频的语义描述与复用。来源:官方仓库
- Agent: 附 Agent Skill 封装,服务 Agent 工作流。来源:官方仓库
- 缓存: 侧车文件本质是描述性缓存。来源:官方仓库
📋 来源核实
- ✅ 已验证: GitHub 仓库 - stars/forks/license/pushed_at/语言经 GitHub API 实时核验(2026-08-28)
- ✅ 已验证: Zenodo 记录 - 学术可复现关联确认
- ⚠️ 未实测: 实际生成/读取 .cdaf 的端到端流程
- ⚠️ 未验证: 缓存节省比例等量化指标
⚠️ 局限与未实测声明
- 本文基于 2026-08-28 GitHub 公开信息整理,未实际运行 cdaf
- 项目极新,格式规范与命令用法以仓库 Spec/README 为准
- 成本节省为方向性描述,具体数值需按自身场景实测
同分类推荐
AI视频生成 分类下的其他工具