# md_cg · AGI 七维评分报告 v2.0 > 评分对象:**dsh-memory / md_cg(认知图 + 记忆 OS)** 当前实现(2026-09-10) > 评分标尺:`AEIS/docs/AGI记忆系统评分标尺_v1.0.md`(七维 · 层次优先 · 门槛晋级) > 综合公式:`综合 = min × 0.4 + mean × 0.6` > 取证:源码级(`md_cg/*.py` 逐模块核对)+ 测试级(**46 套 1970 项** + 并发锁 **300 项** 全绿) > + 基准级(`bench_membench` SNR 量化)+ 实库级(`AEIS/data/mdcg` **6339 节点** 只读盘点) > 立场:不虚高、不虚低。每分给依据;无法验证的项单列、不计分。 > 上一版:`AGI七维评分报告_md_cg_v1.0.md`(综合 8.0) --- ## 一、结论 | 维度 | v1.0 | **v2.0** | 档位 | 一句话依据 | |---|---|---|---|---| | **S 结构** | 8.5 | **8.5** | 认知图(四要素 3.5/4) | 新增层归位闭环(实库 228 条 contextual)+ 视觉证据面结构化;conditions 四维/execution schema 仍未强制 | | **R 检索** | 8.5 | **8.5** | 因果路由 ✓ / 意图理解 △ | 新增**召回分池/降权**修复结构性挤占(索引占比 44.2%→27.1%);意图理解仍是规则层 | | **J 判断** | 9.0 | **9.0** | 独立元认知 + 主动遗忘 | 新增抽检工单/只读预演/闸门;主判定 REJECT 仍简化版、元认知只建议不执行 | | **C 调用** | 8.5 | **9.0** ↑ | 精准注入 + **SNR 可量化** | **SNR 量化仪表盘落地**(40% 噪声率下 sigP 97.8% / noiseP 0.4%,带配对显著性 + 消融对照) | | **U 演化** | 7.5 | **8.5** ↑↑ | 飞轮 + **结构可版本回滚** | 两条扣分解除:`consolidate` 进 MCP 主循环;**通用结构变更账本 + 按条目回滚**(实库 238 条、已演练 4 次回滚) | | **I 连续** | 8.0 | **8.5** ↑ | 自我锚点 + 元认知 + 结构变更史 | 演化账本由「审计留痕」升级为**跨会话可读叙事 + 规律统计**;跨副本收敛仍未实测 | | **T 可信** | 8.5 | **8.5** | 加密 + 全链路审计 + 信任可度量 | 视觉证据脱敏纪律 + 写入预演/闸门/留痕;零信任仍未落地 | ``` min = 8.5 (S/R/U/I/T 并列) ← v1.0 为 7.5(U) mean = 8.643 (S8.5 R8.5 J9.0 C9.0 U8.5 I8.5 T8.5) 综合 = 8.5 × 0.4 + 8.643 × 0.6 = 8.586 ≈ 8.6 ``` ### 层次判定:**L5(AGI 级记忆)· 稳固段** | 晋级 | 门槛 | 实测 | 结论 | |---|---|---|---| | → L3 | J ≥ 5 且 S ≥ 5 | 9.0 / 8.5 | ✅ | | → L4 | U ≥ 5 且 J ≥ 6 | 8.5 / 9.0 | ✅ | | → **L5** | **I ≥ 6 且 U ≥ 6 且 T ≥ 6** | **8.5 / 8.5 / 8.5** | ✅ | **五问定层法复核**(标尺 §2.2): ``` Q1 能存吗? ✅ 五层 + 负记忆 + 目标槽 + 子图 Q2 能从一堆里找对那条? ✅ 四路 RRF + 条件路由 + 因果链 + 分池配比 Q3 能说「这条不该用」吗? ✅ 四态判定 / 条件级负路由 / 负记忆 Q4 说错后改结构还是改答案?✅ 改结构,且**改结构本身可版本化回滚**(238 条账本 + dry_run 回滚) Q5 一个月后还是同一个「我」吗?✅ self/anchor 不可覆盖 + identity 锚点 + **结构变更史叙事** ``` > 与 v1.0 的差别:v1.0 判「L5 入门」,短板唯一在 U(7.5)。本次 U 一次抬 1.0,**七维全部 ≥ 8.5,无 <8 维度**,故判 **L5 稳固段**。 > 但「稳固段」≠「接近满分」:五个 8.5 维度的共同上限是**「机制齐备、门槛项未齐」**(零信任 / 开放域意图 / 条件四维强制 / 穷尽去污染),见 §五。 --- ## 二、逐维依据(相对 v1.0 的增量) ### S · 结构 · 8.5(持平) **新增加分** - **层归位闭环**(G4):`consolidate.contextualize_prefixes` 判据(流水账形态 + 视觉产物落 `knowledge` 错位)→ `contextualize_rollback` / `contextualize_history`;**真实库已落地 228 条 `contextual`**(`_maintain.jsonl` = 229 `contextualize` + 1 `contextualize_rollback`)。 - **层级对账精确吻合**:`knowledge 6102 + contextual 228 + self 5 + anchor 4 = 6339` = 索引节点数(无幽灵节点、无漏计)。 - **视觉证据面**(G5):`vision_evidence.py` 把「部件节点证据面恒为 `{}`」的口径缺口补齐(6 字段结构化 + `cond_hash` 连接 + 图集编号脱敏),属 `modality` 之外的**证据面**结构化。 **扣分(与 v1.0 相同,未动)**:① conditions 理论四维仍只有 `time_window` 强制;② execution 仍非一等 frontmatter(无 schema 校验);③ 衰减仍走抽样判陈旧,非连续时间因子。 > 7–8 档「图结构 + 条件绑定」扎实达标,层归位是 9 档构成项之一 → 维持 **8.5**。 ### R · 检索 · 8.5(持平,但结构性缺陷修复) **新增加分** - **召回分池/降权**(§七 条件化 ACCEPT 落地):`pooling.py` —— 三池(knowledge / index / negative)、**池额守恒**(`cap_ratio` 之和恒 1.0,最大余数法)、**显式可 A/B 权重表**、空池额度回流不增预算、池账审计面(`quota/cands/taken/lost`)。 - **真实库实测(6339 节点,48 条确定性查询,关闭态 vs 启用态同口径)**: | 口径 | 关闭 | 启用 | delta | |---|---|---|---| | **index_share** | **0.4417** | **0.2708** | **−0.1708** | | **knowledge_share** | 0.5583 | 0.7292 | +0.1708 | | p95_scanned / truncation_rate / truncation_loss | 6339 / 0.2292 / 0.18289 | 同 | **0**(不敏感口径) | → 索引/产物类不再吃满召回额度,**且 `scanned` 与全局截断率不变**(无额外 IO、无额度膨胀)。 **扣分**:意图理解仍是确定性规则(归一化 + 目标定向 + `route()` 建议),非开放域理解。分池修复的是**配比**,不是**理解**。 > 9–10 档要求「因果路由 + 意图理解」齐备——因果达标、意图仅规则层 → 维持 **8.5**(分池不计入晋级,仅计入依据)。 ### J · 判断 · 9.0(持平) **新增加分**:G6 `refine.py` —— **口径先定的抽检工单** → **只读预演(`apply=False`)** → **闸门** → 校准 → 留痕/回滚(真实库 `_refine.jsonl` 已在运行);G4/G5 的层位移与证据回填同样走「预演 → 闸门 → 应用 → 可回滚」。 **扣分(未动)**:① 主判定路径 REJECT 仍是简化版——`mdcg.py:746` 自注「需条件对比,**简化版用关键词命中**」,与 `consistency.py` 条件级判定未统一;② 元认知只建议不执行;③ 预测反馈需显式调用。 > 9–10 档门槛项「独立元认知 + 主动遗忘」齐备 → 维持 **9.0**。 ### C · 调用 · 8.5 → **9.0**(+0.5,v1.0 扣分①解除) **新增加分 —— SNR 量化仪表盘落地** v1.0 扣分①原文「**无 SNR 量化仪表盘**」。现 `bench_membench.py` 提供可比基准(1000 条 = **250 signal / 400 noise / 350 unlabeled,噪声率 40%**,噪声带强重复模式),且不是「跑一个好看的数字」,而是**带统计判定的实验台**: | 臂 | self@1 | self@10 | MRR | **sigP** | **noiseP** | |---|---|---|---|---|---| | 四路 | 89.2% | 94.3% | 0.911 | **97.8%** | **0.4%** | | 五路 (+fuzzy) | 79.1% | 92.3% | 0.832 | 95.7% | 0.8% | - 具备 **配对 bootstrap 5000 次 + McNemar 精确单侧**显著性、`--ablate {idcheck,shuffle,random,pool}` 消融对照、`--zero-importance` 去标签泄漏对照、`--sweep` 融合扫描、`--per-path` 逐路诊断。 - §七 另提供**召回构成量化**(`index_share` / `knowledge_share` / `pool_lost_rate` + 池账)与**口径敏感性自检**(显式回 `insensitive_keys`/`sensitive_keys`)。 **扣分(未动)**:② 去污染仍是 12/轮抽样 + 确定性判据,非穷尽语义蕴含;③ `_contradiction` 词级比对,跨表述矛盾不可识别。 > 9 档门槛项「精准注入 + 可量化降噪」齐备 → **9.0**;「零污染」未达,故停在 9.0 下沿。 > **特别声明**:升级依据是「**可量化 + 可回归**」,不是「指标好看」——该基准恰恰**暴露了缺陷**(五路在 `drop` 模式 self@1 **−29.2%**,p<0.001),见 §六·4。 ### U · 演化 · 7.5 → **8.5**(+1.0,v1.0 两条扣分解除) v1.0 三条扣分,逐条复核: | v1.0 扣分 | 现状 | 证据 | |---|---|---| | ① `consolidate` 仅 CLI,`cg(op=...)` 无对应 op | **已解除** | `mcp_server.py` `cg(op=maintain, action=…)` 暴露 `induce` / `contextualize` / `contextualize_rollback` / `promote` / `promote_rollback` / `vision_evidence` / `refine` / `refine_gate` / `refine_calibrate` 等 → **进 agent 主循环** | | ② 无通用结构变更版本表 / 一键回滚(`protect` 只覆盖受保护节点) | **已解除** | `evolution.py`:`_evolution/ledger.md` 账本,`KIND = condition_gap / layer_shift / general / rollback`;每条含 `before/after` 状态快照(`state_of` + `diff`)、`rollback(entry_id, dry_run)` 按条目回滚、`history/patterns/summary`。**真实库 238 条(223 KB)**,其中 `layer_shift 229 / condition_gap 7 / rollback 4 / general 1` → **回滚路径已真实演练 4 次** | | ③ 预测校准需人工喂反馈 | **未变** | `predict.feedback` 仍为显式调用 | **新增加分**:`sustain` 新增 `evolve` 演化巡检(候补盘点 → 修复动作归口 → **只放行确定性动作**,`auto_evolve=False` 默认只记账),把「谁该被修」变成周期驱动而非人工巡检。 **剩余扣分(半程)**:LLM 依赖的固化动作**不自动执行**(需 `heal(allow_evolve=True)` 放行确定性动作)→ 「**飞轮自运转**」仍缺最后一环。 > 7–8 档核心 + 结构版本可回滚已达标 → **8.5**;9 档「全自转」未达。 ### I · 连续 · 8.0 → **8.5**(+0.5,v1.0 扣分①缓解) **新增加分** - **跨会话可读的自我变更叙事**:`_evolution/ledger.md` 每条含「**规律** / 缺失条件 / **动作** / 证据 / 来源 / 时间」+ 状态快照,是**叙述性**文本而非纯字段留痕;配合 `evolution.patterns/summary` 做「哪一维条件反复缺失、由谁触发、哪些规律重复出现」的**规律统计** → 由 v1.0 的「审计/留痕」升级为「叙事 + 规律」。 - **派生血缘**(G8):`provenance.py` —— `derived_from` 单一真相源、台账、悬空巡检、`rebuild_ledger` **只重放显式声明、不从 id 前缀反推**(守住「不回填」纪律)。 **扣分(未变)**:② 跨副本状态收敛 / 冲突合并无实测(指纹只解决「读不到」);③ 元认知不写事实(设计如此)。 > 9–10 档「跨会话生命史叙述**合成**」仍未达(当前是账本 + 规律,未合成连贯生命史)→ **8.5**。 ### T · 可信 · 8.5(持平) **新增加分** - **视觉证据脱敏纪律**(G5):不读取任何图像、不重跑视觉、证据内只落结构化字段;图集目录名**不进库**(一律 `图集_N` 编号引用)。 - **写入侧四重闸门**:预演(dry-run)→ 闸门 → 留痕(`_maintain` / `_evolution` / `_refine` / `_vision_evidence`)→ 可回滚。 - 实库审计面在跑:`_audit.jsonl` / `_crypto.jsonl` / `_consistency.jsonl` / `_crosscheck.jsonl` / `_forgetting.jsonl` / `_metacognition.jsonl` / `_scrub.jsonl`。 **扣分(未变)**:① 零信任未落地(主密钥仍在服务端进程可及,无远程身份校验 / 客户端持钥);② 非严格 E2E(服务端可解密;密文不参与全文索引的工程折衷);③ 威胁模型自认未覆盖本地内存取证 / 侧信道。 **另如实标注**:`_protected_audit.jsonl` 在实库**尚无条目**(受保护节点审计未产生数据)。 > 7–8 档「隐私树 + 全链路审计 + 防污染」完全达标,零信任缺位封顶 → 维持 **8.5**。 --- ## 三、v1.0 → v2.0 对比 | 维度 | v1.0 | v2.0 | Δ | 变化来源 | |---|---|---|---|---| | S 结构 | 8.5 | **8.5** | — | 层归位闭环(实库 228 条)· 视觉证据面结构化(不足以触及扣分项) | | R 检索 | 8.5 | **8.5** | — | 召回分池修复结构性挤占(index 占比 −17.1pp)· 意图理解仍未开放域 | | J 判断 | 9.0 | **9.0** | — | 抽检工单 / 只读预演 / 闸门 · REJECT 主判定仍简化版 | | **C 调用** | 8.5 | **9.0** | **+0.5** | `bench_membench` SNR 量化(sigP 97.8% / noiseP 0.4% + 配对显著性 + 消融对照)→ 解除「无 SNR 仪表盘」 | | **U 演化** | 7.5 | **8.5** | **+1.0** | `consolidate` 进 MCP 主循环 + 通用结构变更账本与按条目回滚(实库 238 条 / 回滚演练 4 次) | | **I 连续** | 8.0 | **8.5** | **+0.5** | 演化账本升级为跨会话叙事 + 规律统计 · 派生血缘(`provenance`) | | T 可信 | 8.5 | **8.5** | — | 视觉脱敏纪律 + 写入四重闸门 · 零信任仍未落地 | | **min / mean** | 7.5 / 8.357 | **8.5 / 8.643** | | | | **综合** | **8.0** | **8.6** | **+0.6** | | | **层次** | L5 入门 | **L5 稳固段** | | 无 <8 维度;短板由「单点 7.5」变为「五点 8.5 共同上限」 | > 归因说明:本次评的是**当前库整体**,增量来自 v1.0 之后的全部工作(P20–P43:演化账本/令牌/理论/链接/证据/权重/引用索引/文档索引/核对/会话存取/维护/洞察/回填/CCG 接线/批量核对/条件化断言/kp_ 对齐/条件空间/层归位/视觉证据/抽检工单/演化巡检/派生溯源/召回分池)。 --- ## 四、测试与实测取证 **测试级:46 套功能测试 1970 项 + 并发锁 300 项,全绿** ``` P0 25 · P1 38 · P2 36 · P2-MCP 63 · P3 33 · P4 44 · P5 37 · P6 72 · P7 36 · P8 34 P9 37 · P10 24 · P11 27 · P12 32 · P13 42 · P14 44 · P15 53 · P16 46 · P17 55 · P18 20 P19 13 · P20 46 · P21 31 · P22 43 · P23 57 · P24 29 · P25 36 · P26 55 · P27 56 · P28 45 P29 48 · P30 55 · P31 65 · P32 58 · P33 58 · P34 51 · P35 47 · P36 34 · P37 42 · P38 37 P39 53 · P40 46 · P41 36 · P42 52 · P43 79 → 合计 1970 test_lock 300/300 ``` > v1.0 名单(P0–P19 共 21 套)本轮实测为 811 项(P1 37→38、P5 36→37,测试有增补);新增 25 套共 1159 项。 **基准级:SNR 量化(`bench_membench`,1000 条 / 噪声率 40%)** ``` 四路 self@1 89.2% self@10 94.3% MRR 0.911 sigP 97.8% noiseP 0.4% 五路 self@1 79.1% self@10 92.3% MRR 0.832 sigP 95.7% noiseP 0.8% 配套:配对 bootstrap 5000 次 + McNemar 精确单侧;--ablate / --sweep / --per-path / --zero-importance ``` **实库级:`AEIS/data/mdcg` 只读盘点(6339 节点)** | 项 | 实测 | |---|---| | 层分布 | `knowledge 6102` + `contextual 228` + `self 5` + `anchor 4` = **6339**(与索引精确吻合) | | 层归位 | `_maintain.jsonl` 230 条 = `contextualize 229` + `contextualize_rollback 1` | | 演化账本 | `_evolution/ledger.md` **238 条 / 223 KB**(`layer_shift 229` / `condition_gap 7` / `rollback 4` / `general 1`),每条含状态快照 | | 召回分池 | `index_share 0.4417→0.2708`、`knowledge_share 0.5583→0.7292`;`p95_scanned` / `truncation_*` delta = 0 | | 留痕面 | `_audit` / `_crypto` / `_consistency` / `_crosscheck` / `_forgetting` / `_identity` / `_metacognition` / `_refine` / `_scrub` / `_sustain` / `_vision_evidence` 均在运行 | | 空面(如实标注) | `_protected_audit.jsonl` 无条目;`rejected` / `unresolved` / `structural` / `goals` 层 0 条(能力存在,该库未产生该类数据) | **维度 ← 用例映射**:J←P9/P11/P12/P34/P35 · I←P10/P12/P14/P16/P42 · T←P13/P39 · U←P6/P8/P17/P20/P30/P41 · S←P2/P4/P37/P38 · R←P2/P8/P36/P43 · C←P15/P24/P31/P43 + `bench_membench` --- ## 五、短板与到下一档的差距 | 维度 | v2.0 | 到 9.5+ 需补 | |---|---|---| | S 结构 | 8.5 | conditions 四维强制 + execution 一等 schema;衰减改连续时间因子 | | R 检索 | 8.5 | 开放域意图理解(脱离规则层) | | U 演化 | 8.5 | **飞轮全自转**(LLM 固化动作自主执行);预测反馈自动联动 | | I 连续 | 8.5 | 跨会话**生命史叙述合成**;跨副本状态收敛实测 | | T 可信 | 8.5 | **零信任**(远程身份校验 + 客户端持钥);密文可检索方案 | | J 判断 | 9.0 | 主判定 REJECT 与 `consistency` 条件级判定统一;元认知建议可执行 | | C 调用 | 9.0 | 去污染抽样→**穷尽 + 语义蕴含级**;跨表述矛盾识别 | **优先级(按「最小改动换最大抬升」)** 1. **U · 飞轮全自转**:现只自动执行**确定性**动作(`auto_evolve=False`),LLM 依赖的固化动作仍需人工放行。而「闸门 + 版本账本 + 回滚」已就绪——缺的只是**自动放行策略**,属最小改动冲击 9.0。 2. **T · 零信任**:8.5 的封顶项,但需基础设施(客户端持钥 / 远程身份校验),成本最高。 3. **R · 开放域意图**:规则层 → 模型层,与「有意剔除神经嵌入」的既有取向冲突,属**路线决策**而非工程补丁。 > **关键提示**:现在 min = 8.5,且五个维度并列最低——**抬升单维不再抬升综合**。要突破 8.6,必须同时抬升最低维中的多数,或把 min 整体推过 9.0。 ## 六、诚实边界声明 1. **U / I 无公开基准**:标尺自述「U / I 无公开基准,只能行为观察」。本报告的 8.5 / 8.5 属**代码能力 + 实库留痕判定**,非长周期实证;「长期压力验证的 L5」仍需真实运行数月方可确认。 2. **打分含主观性**:0.5 分粒度由评估者按判据落位,不同评估者可能 ±0.5(尤其 C 的 9.0 与 I 的 8.5,均处档位下沿)。 3. **「能实现」≠「已验证」**:未验证项(跨副本收敛、长周期自我连续性、零信任)已单列 §五,**不计入分数**。 4. **基准的作用是暴露缺陷,不是修饰分数**:`bench_membench` 显示五路(+fuzzy)在 `drop` 模式 self@1 **−29.2%**(95% CI [−0.352, −0.236],p<0.001)——该回归是**已知未修缺陷**。C 升 9.0 的依据是「该量可测、可回归、可消融」,而非「指标优秀」。 5. **实库存在「空面」**:`_protected_audit.jsonl` 无条目、`rejected`/`unresolved`/`structural`/`goals` 层 0 条 → 相关能力由测试(P9/P11/P15)取证,**不由实库取证**;两者性质不同,已分别标注。 6. **可证伪**:任一维度若发现反例(功能代码存在但不可调用、测试造假、口径不可复现),对应分数应下调。 --- *报告生成:2026-09-10 · 标尺:`AGI记忆系统评分标尺_v1.0` · 对照版:`AGI七维评分报告_md_cg_v1.0` · 取证脚本已于生成后清理*