# 密集文字识别:五模型三轮补充实验 _DSH 视觉分块插件 v2.0 · 2026-08-23 · Asia/Shanghai_ --- ## 📋 摘要 本实验专门隔离“密集小字能否被完整读出”。4 张合成文档各包含 100 个无语义、唯一的 8 位随机码,覆盖横版、竖版、低对比小字和轻微线条干扰。每组对每页运行 3 轮,共计 12 次读取、1,200 个严格整码判断;任意一位字符错误都视为整码错误。 结果显示,**DeepSeek 单图直读 F1 为 19.68%,使用 v2 分块插件后为 96.44%**,提高 76.76 个百分点。低对比页 D03 上,直读召回率为 0%,插件为 93.33%;带线条干扰的 D04 上,直读为 0.33%,插件为 99.00%。这为“每张图片最多 384 个视觉 token 会在密集小字场景损害读取质量”提供了直接、受控的工程证据。DeepSeek 官方说明大图会缩放,且每张图片的视觉 token 上限为 384;多张图片分别计算。[^1] 五组严格整码 F1 排名为:GPT-5.5 99.25%、GPT-5.6 Terra 98.67%、DeepSeek + v2 插件 96.44%、GPT-5.6 Luna 94.99%、DeepSeek 单图直读 19.68%。 > ⚠️ **结论边界:** 这是合成密集随机码基准,不是自然场景通用视觉排行榜。Codex 三模型与 DeepSeek API 的延迟和计费可观测性不同,不能把全部运营指标视为同口径服务基准。 ## 🔬 实验设计 ### 文档与难度 随机码使用固定种子 `20260823` 生成,并排除 `I/O/0/1` 等天然易混字符,减少字体歧义。随机串没有语言语义,模型无法依赖常识补全文字。 | 页面 | 尺寸 | 排布 | 字号 | 难点 | | --- | ---: | --- | ---: | --- | | D01 | 2400×1200 | 5×20 | 18 px | 宽幅缩放 | | D02 | 1200×2400 | 4×25 | 17 px | 长竖版 | | D03 | 2600×1600 | 5×20 | 14 px | 低对比小字 | | D04 | 1800×2600 | 4×25 | 16 px | 线条干扰 | ### 对照组 | 组别 | 输入 | 执行方式 | | --- | --- | --- | | GPT-5.5 | 单张原图 | Codex,medium reasoning | | GPT-5.6 Luna | 单张原图 | Codex,medium reasoning | | GPT-5.6 Terra | 单张原图 | Codex,medium reasoning | | DeepSeek 直读 | 单张原图 | `deepseek-v4-flash-vision-exp` | | DeepSeek + v2 | 全局图 + 完整覆盖切片 + 1 张细节图 | 同一 DeepSeek 模型 | DeepSeek 插件根据页面尺寸生成 10–14 张输入图,平均每次 12 张;单图直读固定为 1 张。所有 DeepSeek 调用关闭思考模式、温度为 0。各页、轮次和 DeepSeek 策略采用固定种子随机顺序。 ### 盲测与重复 实验单位是文档页,独立页数量为 `n=4`;三轮属于技术重复,不把 12 次调用误报为 12 张独立文档。Codex 第 2、3 轮使用全新、无历史上下文的模型实例,避免看到前一轮答案。所有模型在输出前均禁止访问标签、评分结果和其他模型答案;标签只在输出完成后用于计分。 ```mermaid flowchart LR accTitle: Dense Text Benchmark Flow accDescr: Reproducible dense-code pages are sent blindly to five model arms, after which exact codes are extracted and scored with latency, token, and price records. generate[⚙️ 生成随机码] --> render[📄 渲染密集页] render --> blind[🔒 五组盲读] blind --> extract[🔍 提取八位码] extract --> score[📊 计算严格指标] classDef process fill:#dbeafe,stroke:#2563eb,stroke-width:2px,color:#1e3a5f classDef success fill:#dcfce7,stroke:#16a34a,stroke-width:2px,color:#14532d class generate,render,blind,extract process class score success ``` ### 指标定义 主指标是唯一 8 位码集合的微平均召回率、精确率和 F1。每页知道有 100 个码,但评分不因“输出数量接近 100”而给分;只有完整字符串与标签完全一致才算命中。延迟记录为端到端墙钟时间。DeepSeek token 来自 API `usage`;Codex 当前任务界面不返回任务级视觉/input token 或可计费金额。 ## 📊 主要结果 ### 严格整码准确率 | 组别 | 召回率 | 精确率 | F1 | | --- | ---: | ---: | ---: | | GPT-5.5 | 99.17% | 99.33% | 99.25% | | GPT-5.6 Terra | 98.67% | 98.67% | 98.67% | | DeepSeek + v2 插件 | 96.00% | 96.89% | 96.44% | | GPT-5.6 Luna | 94.75% | 95.23% | 94.99% | | DeepSeek 单图直读 | 19.08% | 20.32% | 19.68% | DeepSeek 插件相对单图直读:召回率提高 **76.92 个百分点**,F1 提高 **76.76 个百分点**,F1 约为原来的 4.90 倍。插件版比 Luna 高 1.46 个百分点,但仍低于 Terra 2.22 个百分点、低于 GPT-5.5 2.81 个百分点。 ### 逐页召回率 | 组别 | D01 | D02 | D03 | D04 | | --- | ---: | ---: | ---: | ---: | | GPT-5.5 | 98.67% | 99.00% | 99.67% | 99.33% | | GPT-5.6 Terra | 99.33% | 99.00% | 96.67% | 99.67% | | DeepSeek + v2 插件 | 94.33% | 97.33% | 93.33% | 99.00% | | GPT-5.6 Luna | 97.33% | 96.00% | 91.33% | 94.33% | | DeepSeek 单图直读 | 29.67% | 46.33% | 0.00% | 0.33% | D03 的 14 px 低对比字是插件版 DeepSeek 和 Luna 的共同难点。D04 虽然带有线条干扰,但插件版达到 99%,说明本次失败的主因更接近整图缩放后的字符分辨率,而非简单背景杂线。 ### 延迟 | 组别 | 中位延迟 | P95 延迟 | 口径 | | --- | ---: | ---: | --- | | DeepSeek + v2 插件 | 6.08 s | 7.29 s | API 请求 | | DeepSeek 单图直读 | 6.87 s | 7.84 s | API 请求 | | GPT-5.6 Terra | 25.17 s | 739.81 s | Codex 端到端 | | GPT-5.6 Luna | 27.48 s | 47.70 s | Codex 端到端 | | GPT-5.5 | 27.95 s | 708.11 s | Codex 端到端 | 插件版 DeepSeek 的中位延迟没有上升,反而比直读低约 0.79 秒;样本量小且服务波动存在,不能据此断言多图必然更快。GPT-5.5 和 Terra 的 P95 被首轮两次 11–12 分钟的长尾检查拉高,报告保留该观测,不用截尾数掩盖。 ## 💰 Token 与价格 ### DeepSeek 可观测资源 | 指标 | 单图直读 | v2 插件 | 变化 | | --- | ---: | ---: | ---: | | 图片 / 次 | 1.0 | 12.0 | +11.0 | | Prompt token / 次 | 441.0 | 4,323.0 | +880.3% | | Completion token / 次 | 694.5 | 647.8 | -6.7% | | 总 token / 次 | 1,135.5 | 4,970.8 | +337.8% | | 中位延迟 | 6.87 s | 6.08 s | -11.5% | 价格按 2026-08-23 核实的 DeepSeek V4 Flash 公布价估算:缓存命中输入 ¥0.02/百万 token、未命中输入 ¥1/百万 token、输出 ¥2/百万 token。[^2] 实验视觉模型没有单独列在公开价格表,因此以下金额是估算,不等同于最终账单。 | 估算口径 | 单图直读 / 次 | v2 插件 / 次 | 插件增幅 | | --- | ---: | ---: | ---: | | 观察到的缓存混合 | ¥0.001830 | ¥0.004521 | +147.1% | | 全部输入未命中 | ¥0.001830 | ¥0.005619 | +207.0% | 虽然插件每次更贵,但“每 100 个正确整码”的观察缓存成本约为 ¥0.00471,单图直读约为 ¥0.00959。换言之,在这套密集文字任务中,插件的单次账单约为 2.47 倍,但每个正确结果的成本约降低 51%。 ### Codex 价格边界 GPT-5.5、Luna 和 Terra 通过 Codex 订阅环境运行。当前任务界面没有暴露三者的任务级输入/视觉 token、输出 token 或可计费金额,因此这些栏位必须记为 `不可观测`,不能根据模型名称猜测 API 价格,也不能与 DeepSeek 账单做虚假的精确比较。 ## 💡 解释与局限 ### 384 token 是否降低读取质量 答案是:**会,至少在密集小字、低对比和大幅缩放组合下会显著降低。** 同一 DeepSeek 模型、同一提示、同一 4 页数据、同样三轮重复中,改变的核心是从 1 张整图改为具有完整覆盖的多张局部图。整图仅得到约 441 个 prompt token,其中视觉输入受到单图 384 上限约束;插件平均得到 4,323 个 prompt token,并把每个局部区域放到独立图片预算中。准确率由 19.68% F1 上升到 96.44%,与“分辨率预算不足”机制一致。 这不意味着任何普通图片都应分割。上一轮长收据实验中,DeepSeek 直读已达到 94.10% F1,插件只提高到 96.80%;本轮密集随机码把文本尺寸和语义补全能力同时压低,因此放大效果被刻意放大。插件应由图像尺寸、文字密度和任务风险触发,而不是对所有图片强制开启。 ### 方法局限 - 只有 4 张独立文档页,三轮是技术重复,外推到自然文档时需要更大数据集 - 合成随机码消除了语言先验,适合测试看清能力,但比自然语言 OCR 更苛刻 - 提示明确告知每页有 100 个码,可能帮助模型控制输出数量,但不会帮助猜出随机字符 - Codex 与 DeepSeek 的推理入口、延迟定义、token 可观测性不同 - 插件同时改变图片数量、局部分辨率和输入 token,不能把提升归因于单一内部算子 - 公开价格页没有单列视觉实验模型,成本采用 V4 Flash 公布价估算 ## 🎯 结论与建议 1. **密集文字默认开启 v2:** 当整图长边大于约 1800 px、字号很小或任务要求逐项不漏时,单图 384 视觉 token 风险很高 2. **保留完整覆盖切片:** 仅添加一个中心放大图不够;D01–D04 的信息分散在全页,必须保证每个源像素进入至少一个基础切片 3. **把低对比增强作为 v0.3 优先项:** D03 的插件召回率仍只有 93.33%,可在切片后增加局部对比度增强或灰度锐化的可选复核图 4. **用两阶段策略控制成本:** 第一阶段快速直读并报告低置信区域,第二阶段只对疑难坐标生成细节图,可望降低平均 4,323 个 prompt token 5. **继续使用严格随机码回归:** 它对一字符错误敏感,适合作为插件版本升级时的固定防退化测试 ## 🔗 复现材料 公开仓库包含汇总 JSON 和可复现实验脚本;测试图片、精确标签及未聚合模型输出保留在本地实验目录,不纳入公共版本,也不包含任何 API 密钥。 ## 🔗 参考资料 [^1]: DeepSeek. “图像理解:Token 用量.” _DeepSeek API Docs_. https://api-docs.deepseek.com/zh-cn/guides/vision [^2]: DeepSeek. “模型 & 价格.” _DeepSeek API Docs_. https://api-docs.deepseek.com/zh-cn/quick_start/pricing --- _最后更新:2026-08-23_