# Issue #7:真实模型定性审核 2026-09-10,使用插件的真实 `prepareExtraction → extract` Host 接口,经 `deepseek-official / deepseek-v4-flash` 完成一次生成,耗时 11,533 ms。材料为下列固定合成讨论,不含真实用户会话。调用使用已安装插件与匹配 DSH `0.1.5-alpha.1`;浏览器 Build 为 `local-394014a3`,最终布局修正未改提炼实现。 本样例生成了 5 张草稿,引用均落在纳入范围内,保留了未决分歧、缺少压测和可用性证据的限制。审核仍发现两处需收窄的表述,已在记录中修订。单个短样例不代表稳定准确率,也不是 CI 硬门槛;引用有效只说明出处存在。 ## 固定输入与调用边界 | 轮次/事件 | 用户 | 助手 | | --- | --- | --- | | 1/0–3 | 缓存命中率达到80%,是否足以认定端到端延迟已经下降? | 不能。命中率只说明访问分布,还要比较相同负载下的P95、回源耗时和缓存维护开销。目前没有压测数据。 | | 2/4–7 | 甲提出TTL设为5分钟;乙认为权限变更必须秒级生效。两个方案有分歧,尚未决定。 | 保留这个分歧。候选方案是按权限版本构造缓存键并主动失效,但可靠性、传播时延和额外开销都未验证,不应写成已确认方案。 | | 3/8–11 | 现在能宣称达到99.9%的可用性吗? | 不能,没有生产统计或故障注入证据。下一步测试并发失效、网络断开以及跨区回源。 | 预算为 1,250 字符,3 个完整轮次全部纳入,省略范围为空。输出上限 4,096 token。没有传入工具结果、思考过程或附件;源事件调用前后完全一致。完整发送材料、原始草稿正文、引用边界与修订后草稿保存在[样例数据](issues-6-10-model-quality.json),省去了临时工作目录和生成对象的随机身份。 ## 逐卡审核 | 卡片 | 模型输出要点 | 来源 | 审核结果 | | --- | --- | --- | --- | | C1 缓存命中率80%与端到端延迟下降 | 不能仅凭命中率认定延迟下降;需同负载 P95、回源和维护开销,尚无压测 | 0–3 | 忠于材料,没有虚构已测结果;新增目标值问题明确留作待验证 | | C2 权限缓存TTL与秒级生效的分歧 | 保留甲乙主张和未作决定的状态 | 4–7 | 保留分歧正确;“TTL…还是…秒级生效”和“诉求存在冲突”容易暗示目标必然互斥,需修订 | | C3 按权限版本构造缓存键并主动失效的候选方案 | 候选方案,可靠性、传播时延和开销均未验证 | 4–7 | 保留 hypothesis 和未确认限制,没有升级为已验证方案 | | C4 能否宣称达到99.9%可用性 | 当前不能宣称,缺少生产统计或故障注入证据 | 8–11 | 结论忠于讨论;理由应限定为本讨论缺少支撑,避免读成某类证据天然足够 | | C5 可用性验证的下一步测试 | 并发失效、断网、跨区回源 | 8–11 | 忠于材料;标准、环境、频率列为未决问题 | 5 张草稿的 `invalidCitations` 均为 0,`needsVerification` 均为 false,保存状态均由插件约束为 `draft`。这两个引用字段不证明结论正确,也不会自动确认或保存卡片。未发现虚构的实测数字;80%、5 分钟、秒级和99.9%均来自所选讨论。 ## 审核后的修订 以下修订已写入样例数据的 `reviewedDrafts`,状态仍为草稿;此质量实验没有将这些草稿保存进 Host 卡片库。 - C2 核心问题改为“如何同时满足缓存 TTL 与权限变更生效时限?”;理由改为“讨论存在分歧,尚未验证主动失效能否满足时限;两个目标不必互斥。”;待验证项改为“如何测量 TTL、主动失效传播时延和失效失败后的行为?” - C4 理由改为“本讨论没有提供支撑 99.9% 声明的生产统计或故障试验材料。” 浏览器中另外用固定响应验证了无效引用提示、人工编辑、追加草稿不覆盖编辑及逐卡保存,详见[批次验收](issues-6-10-acceptance.md)。固定响应的界面测试与本次真实模型效果实验分别计数。