# 0.006 元 vs 0.124 元:视频理解的性价比实验 > 当多模态大模型已经能"直接看视频",把视频压缩成信息层再喂 LLM 还有意义吗? > 我们用 5 组对照实验、3 个真实 B站视频、18 次完整跑测,拿数据回答了这个问题。 **TL;DR**:原生视频理解质量确实最高,但成本是信息层方案的 **8-12 倍**。在语音密集类视频上,我们的方案质量打平原生理解,成本只有 1/9。结论:原生视频是"质量上限",信息层是"性价比甜区"。 ## 背景:一个正在被范式威胁的项目 [dsh-video-understand](https://github.com/ilps2/dsh-video-understand) 的设计前提是"LLM 不能直接看视频"——所以把视频压缩成 **AVIS 信息层**(ASR 转写 + 场景结构 + 运动对象轨迹,约 1-2k token)再喂 LLM,单视频成本约 0.006-0.01 元。 但 2026 年的今天,MiMo v2.5 等模型已经原生支持 `video_url` 直传。对手不再需要压缩时,"token 压缩 99.99%"这个卖点还值钱吗? 我们没有靠感觉回答,而是设计了一场对照实验。 ## 实验设计 **5 个实验组**,同一模型(mimo-v2.5)、同一 API key、同一批问题,唯一变量是信息获取方式: | 组 | 方案 | |---|---| | A | 引擎默认:信息层 → LLM(本项目主线) | | B | 引擎 + 视觉细节问题(触发视觉聚焦补帧) | | C | B站字幕直取 → 纯文本 LLM(最便宜的理论基线) | | D | 均匀抽帧(每 30s 1 帧 JPEG)直发 VLM | | E | **原生视频理解**:视频本体经 `video_url` 直发 mimo-v2.5 | **3 个样本视频**(B站,5-11 分钟):电影解说(语音密集)、街舞比赛(纯视觉无解说)、烹饪教程(语音+画面并重)。 **判定标准预先约定**(防止事后找补):若 E 组质量全面 ≥ B 且成本差距 < 3 倍 → 项目价值存疑。 ## 结果 ### 质量分(盲评,5 分制)vs 成本(元) | 视频 | A 引擎 | B 引擎视觉 | C 字幕 | D 抽帧 | E 原生视频 | |---|---|---|---|---|---| | 解说 | 4.0 / 0.011 | 2.0\* | ❌ 不可用 | 3.0 / 0.010 | 4.7 / **0.124** | | 舞蹈 | 3.7 / 0.007 | 4.0 / 0.007 | ❌ 不可用 | 3.7 / 0.008 | 4.5 / **0.078** | | 教程 | **4.7** / 0.009 | 3.7 / 0.023 | ❌ 不可用 | 3.7 / 0.006 | 4.7 / **0.082** | \* B 组解说暴露了引擎一个真 bug(视觉聚焦未触发),已修复,见下文。 ### 关键数字 - **E 组输入 token:7.6 万 - 12.1 万**(2fps 全量帧);A 组信息层:**870 - 2,217 token**——50-100 倍差距 - **E 组成本是 A/B 组的 8-12 倍**,远超"价值存疑"的 3 倍阈值 - 教程视频:A 组 4.7 分**打平** E 组——"麻椒花椒同放否则发苦"这类口播技巧、广告段定位(精确到秒)全部拿到,成本 1/9 ## 三个意外发现 ### 1. 字幕基线全灭 理论上最便宜的路线(抓 B站 CC/AI 字幕 → 纯文本问答)在三个视频上**全部不可用**——B站 AI 字幕需要登录态,游客抓不到。这条路线在真实场景不构成竞争。 ### 2. 抽帧基线是真正的贴身对手 D 组成本与 A 相当(0.006-0.01 元),纯视觉视频质量打平。但它的死穴是**没有听觉**:解说视频里情节靠猜,幻觉明显("找口红""金色皮肤的男人"都是编的);教程里口播技巧完全丢失,只能读到画面字幕。视频理解不只是"看"。 ### 3. 实验反手抓出引擎一个真 bug B 组解说视频的三个视觉问题,引擎全部回答"信息层未提供"。排查发现:**自评模块检测到 visual 缺口,却只记录、不行动**——初始定位判 gap=none 时聚焦计划为空,自评发现缺口后循环直接退出,补救机制形同虚设。 修复后([e9e6d6d](https://github.com/ilps2/dsh-video-understand/commit/e9e6d6d)):自评逐题打分取最差,发现 visual/asr 缺口自动追加聚焦动作。同一视频重跑,视觉问题从"信息层未提供"变成"长鼻子驼背特效形象、克里斯汀·韦格夸张神态",成本仅 +0.001 元。**对照实验不只是验证方案,也是最好的压测。** ## 结论 按预设判定标准,"项目价值存疑"**未触发**,定位成立: - **语音密集视频**:信息层质量 ≥ 抽帧,持平原生理解,成本 1/9-1/12 - **纯视觉视频**:质量接近(4.0 vs 4.5),成本 1/11 - **独有护城河**:L0 全本地(隐私场景硬需求)+ 信息层缓存复用(同一视频追问成本 1/20,缓存命中价是未命中的 1/50)+ 无登录态可用 一句话:**原生视频理解是质量上限,信息层是性价比甜区。** 在批量分析、反复追问、隐私敏感这三个场景,优势还会进一步放大。 ## 复现 实验代码与判定标准全部开源,一条命令跑完 5 组 × 3 视频: ```bash git clone https://github.com/ilps2/dsh-video-understand.git cd dsh-video-understand && npx dsh-video-understand doctor --fix bash experiments/run.sh <解说BV> <舞蹈BV> <教程BV> ``` - 实验设计(含预设判定标准):[experiments/benchmark.md](https://github.com/ilps2/dsh-video-understand/blob/main/experiments/benchmark.md) - 插件安装(0.5.0 起零手动命令):`npm install dsh-video-understand` *数据说明:成本按 MiMo 价目计算(输入缓存命中 ¥0.02/百万、未命中 ¥1/百万、输出 ¥2/百万 token),2026-08-20 实测。*