# beta.8:首次检索后的 token 与延迟优化 2026-09-08。已在隔离的原生 dsh Web(npm `@deepseek-ai/dsh@0.1.3-alpha.2`)验证 beta.8。固定同一请求时,实际输入 token 减少 3.38%;本地暖索引检索中位耗时下降 76.7%。一组真实论文追问同时观测到更少总输入、更短完成时间,但首 token 和未缓存输入没有改善,不能声称成本全面下降或普遍加速。 ## 具体改动 - 同一 PDF 的多页正文读取、引文定位分别合并成批量 Python 操作,减少进程启动和重复打开文档;正文、引用、定位精度和缺口信息保持一致。 - 查询明确指定 Figure/Fig./Table/图/表编号时,优先匹配原文行首的图表标题。真实论文的 Figure 1 从首次检索前八页之外提升到首位(物理第 3 页);仍保留其他候选,不把标题匹配当作视觉理解。 - 利用 dsh `agent/pre-step` 和原生会话 surface replacement,在下一次模型请求之前,将新工具结果中完全重复的同文档同页文本/图片替换为对当前可见原文的引用。原始工具记录和界面证据保留;不改写已发送请求,也不覆盖缓存前缀来追求表面缩短。 - 文本引用包含原始事件、字段位置、UTF-16 切片范围和 SHA-256。每一步及原生溢出恢复后,检查引用来源是否仍可见且内容一致;失效时从不可变日志恢复必要原文或原图附件。恢复会增加当前上下文,优先保证证据完整。`reuseVisibleEvidence: false` 可关闭上下文复用,批量读取和标题定位仍工作。 ## 可归因的实际 token 检查 取真实论文问答第四步结束、最终回答之前的上下文。两次调用使用相同模型、High 推理、系统提示、工具定义、图片和事实内容,仅改变重复证据的表示。通过原生 llm adapter 各调用一次,输出限制 32 token,读取 provider 返回用量。 | 输入,包括缓存 | 原始表示 | 证据复用 | |---|---:|---:| | provider 输入 token | 27,697 | 26,760 | | 差异 | | **少 937(3.38%)** | 两次输出均因 32-token 上限结束,因此这项检查只证明输入计数差异,不检验答案质量。精确源文恢复由原生日志回放检查另行验证,不能把省下的 5,932 JSON 字节当成 5,932 token。 实际 provider 计数(原开发环境记录) · 原生回放脚本(原开发环境记录) · 回放数据(原开发环境记录) ## 暖索引本地耗时 同一 36 页论文,三个交替顺序的成对试验。使用不触发新标题排序的相同查询,单独比较批量读取;每次完整结果都通过深相等和 SHA-256 检查。 | 操作,中位数 | beta.7 | beta.8 | 下降 | |---|---:|---:|---:| | retrieve | 1,544 ms | 359 ms | 76.7% | | expand | 895 ms | 389 ms | 56.5% | 这是本地工具完成时间,不包含模型生成时间。数据、索引覆盖和证据预算相同。标题定位的召回变化另列,未混入这项“返回内容相同”的比较。 成对计时与校验值(原开发环境记录) · 脚本(原开发环境记录) · 图 1 定位结果(原开发环境记录) ## 真实 agent 追问 两条隔离测试会话均从同一个已完成的论文问答前缀(原会话事件 49)分叉,选择相同 PDF。模型均为 `deepseek-v4-flash-vision-exp / High`。追问要求直接看第 13、15 页表格,核对 guidance/no-guidance gFID、行为克隆 NFE/成功率、Maze2D 平均得分/NFE,并提供可点击引用。 | 指标 | beta.7 | beta.8 | |---|---:|---:| | 模型调用 | 4 | 3 | | 输入 token,含缓存 | 141,797 | 105,073(−25.9%) | | 输出 token | 4,522 | 2,873 | | 整轮完成 | 41.088 s | 28.547 s(−30.5%) | | 首次文档工具返回后至完成 | 36.929 s | 22.933 s(−37.9%) | | 首步首个流事件延迟 | 0.720 s | 1.848 s | | 未缓存输入 token | 6,501 | 38,129 | | 文档工具调用 | 8 | 7 | 两版都读取了第 13、15 页图片,全部工具结果非错误。优化版实际产生一次原生证据 surface replacement,并调用了四次 library_cite。要求核对的关键数字均与原图一致:无 guidance gFID 1.55→1.43、有 guidance 1.16→1.19;策略 NFE 100→1、Square 94%→96%、Transport 72%→74%;Maze2D 平均分 127.2→130.0、NFE 192→2.3、Medium 128.5→122.9。 模型解释仍有限制:把作者对 gFID 饱和的解释写得过于确定,把“持平”混入“改善”,并出现以 NFE 概括推理成本的措辞。beta.8 没有消除这些主模型表述问题,不能宣称回答整体无误。引用提供定位,不自动证明语义解释正确。 这只有一组自由执行轨迹;少走一步可能受模型随机性影响,不能把 25.9% 全部归因于证据复用。新版本系统提示改变了请求前缀,本组还观测到缓存命中下降,不能从总输入下降推断账单下降。计数试验才隔离了证据复用的直接 token 收益。本轮没有切换模型、降低推理档位或删掉新增证据来制造优势。 用量、工具与最终回答(原开发环境记录) · 审计脚本(原开发环境记录) ## 验证与交付 Python 定向检查通过;正文/引文批量输出保持一致;跨文档防复用、精确文本片段和同页图片去重检查通过。真实轨迹可以还原原文并以原生 Session 重放。额外模拟来源字段被改写、被截成非法 JSON、原图附件被移除,所保留的后续证据均精确恢复并可重放。恢复检查结果(原开发环境记录) 本报告对应 beta.8 的功能实现,beta.9 仅作发布准备。隔离测试实例已更新;测试完成后已删除临时模型凭据并移除计数诊断接口,不保留后台付费调用。脚本引用的 `/private/tmp` 测试快照和本机运行时不是公开可携带数据集;重跑需要重新提供相应环境和文档。