# 91ai 评测可复现性状态 本页说明 91ai 自建评测在**当前仓库**中的可复现程度。它衡量的是公开产物是否足以让第三方复跑,不评价作者是否实际运行过测试,也不替代报告中的 L1–L5 证据分级。 截至 2026-07-10,两套已发布评测均为 **R1:narrative-only / artifacts-not-published**。报告可以作为作者运行记录和选型线索阅读,但当前仓库没有足够产物让第三方独立复现其中分数或排名。 ## 等级定义 | 等级 | 名称 | 验收标准 | | --- | --- | --- | | R1 | Narrative only | 已公开方法、环境、结果或限制的文字记录,但关键运行产物未发布;不能仅从仓库复跑结果。 | | R2 | Artifacts published | 已公开可执行 harness、输入/样本清单、配置模板、版本清单和原始结果;第三方可以审计分数来源,但尚未完成独立环境复跑。 | | R3 | Independently rerun | 第三方在干净环境按公开命令完成代表性复跑,关键结果落在预先声明的容差内;复跑环境、提交版本、日志和差异均已记录。 | | R4 | Continuously verified | R3 基础上建立定期或变更触发的自动复跑、结果留档和漂移告警;失败不会静默覆盖历史基线。 | > R 等级只描述仓库产物成熟度。例如,作者自己安装并运行得到的 L1 证据,在 harness 和原始结果未公开时,仍可能处于 R1。 ## 当前状态总览 | 评测 | 当前等级 | 当前可用内容 | 当前不能验证的内容 | | --- | --- | --- | --- | | [四大开源知识库平台 RAG 横评](kb-rag-platform-benchmark.md) | **R1** | 环境、数据集、指标、结果表、工程观察、局限 | 运行脚本、数据快照、平台/依赖完整版本清单、原始逐题结果和分数重算 | | [AI 记忆系统评测](memory-systems-eval/) | **R1** | 方法论、环境记录、冒烟和缩减子集结果、项目详解、已知局限 | harness、适配器、输入子集、原始 context/answer/judge/score、证据台账和分数重算 | ## 四大开源知识库平台 RAG 横评 ### 已公开 - 作者运行环境、共享模型、四类数据集和指标定义的文字说明。 - 四个平台的结果表、部署摩擦、解析行为和工程故障记录。 - FastGPT 使用 top-1、其他平台使用 top-5,以及样本量和代理数据集等限制说明。 ### 当前缺失 - 报告所述 `kb-benchmark/` 运行目录及其中脚本;该目录不在当前仓库。 - 数据构建产物、题目与 golden 文档快照,以及许可允许范围内的获取/校验说明。 - 四个平台、镜像、依赖、配置和评测代码的完整版本锁定清单。 - 逐题检索、生成、裁判结果及汇总分数的可重算原始文件。 - 第三方在干净环境中的复跑记录。 ### 已知协议偏差 - `qwen2.5:14b` 同时参与答案生成和裁判;同族裁判偏差可能影响绝对分数,也可能影响相对排名,当前不能证明排名不受影响。 - FastGPT 结果来自 top-1,其他三家来自 top-5,不是严格 apples-to-apples。 - 扫描件判断来自本次记录的版本、配置和 DocVQA 样本;不能外推为所有版本、解析插件或企业扫描文档的永久能力结论。 - 每个数据集仅使用 40–50 题,且 CUAD / DocVQA 是企业文档的代理数据集。 ### 升级验收 升到 R2: - [ ] 发布可执行的数据构建、灌库、检索、生成和评分脚本。 - [ ] 发布完整版本/镜像清单、脱敏配置模板和运行命令。 - [ ] 发布可合法分发的输入清单、校验值、逐题原始结果和汇总脚本。 - [ ] 为 top-1 / top-5 差异提供统一口径重跑,或将两类结果彻底分表,不再生成统一排名。 - [ ] 明确裁判 prompt、模型参数、失败重试和人工校准结果。 升到 R3: - [ ] 由未参与原运行的人在干净环境完成代表性复跑。 - [ ] 记录仓库提交、平台/镜像版本、硬件、命令、日志和结果校验值。 - [ ] 预先声明允许容差,并逐项解释超出容差的结果。 ## AI 记忆系统评测 ### 已公开 - 13 个候选的分类、方法论、作者环境和项目级分析。 - 3 会话 / 12 查询冒烟结果和 3–4 题 LongMemEval 缩减子集结果表。 - embedding、reader、judge、回答协议和吞吐限制等 caveat 的文字记录。 - 负分排查案例和部分工具未取得 hands-on 结果的说明。 ### 当前缺失 - 报告规划的 `runs/2026-07-03-memory-systems-eval/` 目录;该目录不在当前仓库。 - driver、finish、judge、各工具适配器及其依赖锁定文件。 - 冒烟输入、LongMemEval 实际子集、原始召回上下文、答案、裁判输出和分数。 - 完整工具版本、配置、随机性控制和证据台账。 - 第三方在干净环境中的复跑记录。 ### 已知协议偏差 - 部分运行使用本地 `qwen2.5:14b`,部分抽取、reader 或 judge 使用 `gpt-5.4`;不能概括为所有结果都来自同一后端。 - Supermemory、Memvid、Basic Memory 使用各自 embedding,未统一为 `qwen3-embedding:4b`。 - Letta 由 agent 直接作答,其他多数工具采用“检索 → 固定 reader”协议;Letta 的 12/12 不能与其他冒烟分数严格横比。 - LongMemEval 是每工具 3–4 题、约 9K token 的缩减子集,不是完整 500 题基准。 - “Supermemory 最高”只表示它在参加该缩减子集的 4 个工具中以 2/4 得到本次最高分,不代表它在 13 个项目或完整 LongMemEval 上排名第一。 ### 升级验收 升到 R2: - [ ] 发布 harness、全部实际使用的适配器、依赖锁定和脱敏配置模板。 - [ ] 发布冒烟输入、LongMemEval 子集生成规则及实际样本标识/校验值。 - [ ] 发布每个工具的 context、answer、judge、score 原始结果和可重算汇总脚本。 - [ ] 为每一行结果记录工具版本、LLM、embedding、reader、judge 和回答协议。 - [ ] 将不可比较协议分组展示;同一排名只包含满足同协议的参与者。 升到 R3: - [ ] 由未参与原运行的人在干净环境复跑冒烟和至少一个缩减子集。 - [ ] 记录提交、依赖、后端、命令、日志、失败重试和结果校验值。 - [ ] 预先声明非确定性容差,并同时报告一致项、漂移项和无法复跑项。 ## 阅读原则 - 具体分数视为特定时间、版本、配置、样本和协议下的快照,不作为产品永久属性。 - R1 报告适合形成 POC 假设,不足以单独支持采购、生产采用或“谁最好”的结论。 - 如果某项结论影响真实选型,应先用自己的数据和统一协议复跑;待产物升级到 R2/R3 后,再引用可审计结果。