# THEORY — 分级模式插件的理论依据与机制映射 > **定位声明(诚实首发)**:本文档中的注意力类条目(线性注意力/双边注意力)是**系统设计同构的 > 启发式映射**——借注意力算法对"序列增长"的处理思想(O(n²)→O(n)、双向↔单向)来类比本插件对 > "上下文增长"的工程策略(增量注入+幂等去重、双向期↔聚焦期)。**本插件不做、也不声称任何 > 注意力理论创新**;真正的技术内核是**任务协议化与门控状态机**(规格必填门控/先复检后写入/红队 > 再审批)。理论条目的价值=提供可讲清的工程类比,不是为插件"包一层理论"。 > 本文档把本插件研发中参考/观测的四个概念,与插件机制做**理论→机制→实测证据**的映射。 > **诚实边界**:凡有标准文献的定义均给出真实出处;凡我无法核实的(jspace 确切所指、"双边"的确切文献对应)**明确标注"待审校"**,不编造引用。 --- ## 1. 线性注意力机制(Linear Attention) **定义**:标准自注意力的计算为 Q·Kᵀ(复杂度 O(n²))。线性注意力通过核函数近似/特征映射,把 softmax 注意力写作 φ(Q)·(φ(K)ᵀ·V) 的分块求值顺序,使复杂度降至 **O(n)**(线性于序列长度)。 代表工作:Linear Transformers(Katharopoulos et al., ICML 2020,kernel feature map 视角)、 Performer(Choromanski et al., ICLR 2021,FAVOR+ 随机特征)、RWKV(Peng et al. 2023,线性注意力+RNN 混合)等。 **与插件机制的关系**(映射钩子): - 长会话里**上下文增量呈线性累加**(每小类注入一段规格+证据链)——插件对注入文本 **按"单注+当下态+不重复"做压缩**:同类问题若按 O(n²) 式地"全量重放"(每步把全树+全部历史 重新讲一遍)会随步数平方恶化;插件改为**增量注入 + 幂等键去重 + 当下态回执**, 让模型每一步的有效信息增量保持**近线性**——这是线性注意力的**系统设计同构**(对"上下文增长"的 线性化策略)。 **实测证据**:会话 f0855822(自测链)后段每小类注入平均字符数(注入文本结构抽查);审计端点 `injections` 字段可复核:每个引导键恰 1 次(`uniqueRate=1`,无平方级重复)。 ## 2. 双边注意力机制(Bidirectional Attention) **定义(标准)**:注意力双向计算——序列中每个位置同时看到左右两侧上下文(与因果/掩码自回归 单向注意力相对)。Transformer 原始论文(Vaswani et al., 2017)的编码器即双向;BERT (Devlin et al., 2019)以双向编码+MLM 训练将其规模化。 **⚠️ 待审校**:您提出的"**双边**注意力机制"——若指上述 bidirectional attention,映射如下; 若指特定论文/架构(如双流/双侧分支视觉注意力),**请补充确切文献**,我将更正本条目。 **与插件机制的关系**(映射钩子): - 分级协议对**前后文关系**的对称意识:脑暴(需求对齐,看"任务全景")=双向理解阶段, 执行(每一小类只看"当前激活+相邻锚")=**受限窗口**阶段——插件显式区分 "双向理解期(脑暴/审核/收官/终验)"与"单向聚焦期(执行时相邻锚对照)", 与双向↔因果的注意力二分同构。 **实测证据**:focus 注入的"相邻锚"语系(只对照相邻接口,别想全局)+ 终验六项的"全面复查" 语系(全局视角)——两者在注入文本中成对出现(对照审视);组收官「逐条核对」把组级标准 按"前后项并列"逐条复核。 ## 3. jspace 概念(待用户补充定义) **⚠️ 占位/待审校**:我无法将"jspace"定位到任一标准文献定义的确定概念(可能是您内部的 领域术语/简称/自造框架)。**请提供其定义或出处**(一句话+来源链接即可),我将补写条目 并做机制映射。在此之前,本条仅保留占位不映射(避免以讹传讹——凡无法复核的不下结论)。 ## 4. 思维惯性懈怠(模型长程勤勉度衰减) **定义(本插件实测概念)**:在长程多步任务中,模型对"验证/检查"类动作的投入随任务推进 呈**衰减趋势**——后期小类的工具投入、可视化核对、独立复核明显少于前期(表现为 "做过即通过"的惯性倾向)。这是**本插件观测到的现象**(来自真实会话的强度表), 理论侧可关联认知努力/行为惰性研究(占位:后续补充文献,如 effort discount 类——**待审校**)。 **与插件机制的关系**(映射钩子): - 插件以"**疲惫防御**"三件套对抗该现象:①打卡制(每小类都有硬门,无省事路径) ②验证变体/轮换(规则措辞更换,防"习惯化忽略")③红队门(verify=redteam 的小类 **未裁决通过不得打卡**——引入独立冷视角,防止"开发方自说自话")。 **实测证据**: - 会话 bcad0ade 强度表(中后期小类工具/截图投入对比——详见 DATA.md); - 会话 7abc5cad(31 打卡全链、2 次红队裁决 pass); - 单注率 `uniqueRate=1` 与当下态回执(防"重复注入产生的麻木")。 --- **引用-证据对与文献清单**:见本文档配套的「引用与证据对」小节(下一交付物)与 DATA.md 实测表。 所有占位项(jspace 定义、双边确切文献、认知努力文献)**未核实前不引用**——边界优先于漂亮。 --- # 机制映射表(理论 → 实现点 → 实测证据) > 复现约定:`会话ID` = dsh 会话文件级引用(脱敏);`审计` = 插件端点 `/graded-mode/api/audit` > (运行会话可直接 curl 复核);`测试` = `tests/*` 具体用例名(`npm test` 可复现)。 | 理论 | 插件实现点(代码/机制) | 实测证据(可复核路径) | 结论 | |---|---|---|---| | 线性注意力(上下文线性化) | ① 注入幂等:注入键(l1-guidance/focus:*/check:*…)**先注后键,每键恰 1 次**(`src/tools.js` registerInjected、`src/index.js` pre-step splice 见键跳过)② 增量注入:每小类只注入当前焦点+相邻锚;回执=当下态(不重放全树) | 会话 f0855822(自测链)链尾审计实机:`injections={focus:*:22, check:*:7,…}`、`uniqueRate=1`、`dupKeys=[]`(**每引导键恰一次=上下文无平方级重放**);测试 `mode-state.test「auditBody:注入前缀聚合…」` | 通过 | | 双边注意力(双向↔聚焦二分) | ① 双向期:脑暴(信息对齐 360°)/审核(完整规格单)/终验(全面复查)② 聚焦期:执行注入"相邻锚,别想全局"(`inject-text.js` verifyLaw correct ③) | 测试 `inject-text.test「verifyLaw…两遍法」`、`「finalCheck…不可替代为指标」`(① 全面复查断言);`specSheet` 锁定即呈完整单(北极星+需求+树——双向视角物化于锁定时刻) | 通过 | | jspace 概念 | **(无映射——占位)** | 未定义不映射:待用户补定义/出处后补行 | 未证实(边界) | | 思维惯性懈怠(勤勉度衰减防御) | ① 打卡制(每小类硬门)② 红队门(verify=redteam 未裁决通过不得 mark——`src/tools.js` markTaskDefinition redteam 门)③ 组收官逐条核对(严苛>小类)④ 北极星锚定(开工前一眼,替代声明式自问)——注:v3.0 的"变体轮换"已在 v3.1 由**结构差异注入**取代(退役) | 会话 bcad0ade 强度表(中后期工具投入/截图对比衰减——见 DATA.md);会话 7abc5cad:31 打卡全链+**redteam_verdict 2 次 pass**(L2 定稿取景/L1 组收官);测试 `tools.test「redteam 门:未 pass 无法打卡…」`、`inject-text.test「starAnchor…」`(星锚替代自问) | 通过 | **映射覆盖**:四项理论 → 条目 4 行(3 条通过映射 + 1 条未证实占位);每条映射的实测证据均带 「会话ID/审计/测试名」复现路径——可复核性为验收底线(research 模式)。 --- # 引用与证据对(文献清单 → 复现位置) ## 文献清单 **注意力机制类(真实文献,已验证存在)** 1. Vaswani et al. (2017). *Attention is All You Need*. NeurIPS 2017. —— Transformer 原始架构(编码器=双向注意力)。 2. Devlin et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers*. NAACL 2019. —— 双向编码+MLM("双向注意力"标准出处之一)。 3. Katharopoulos et al. (2020). *Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention*. ICML 2020. —— 线性注意力的 kernel feature map 视角(O(n) 复杂度)。 4. Choromanski et al. (2021). *Rethinking Attention with Performers*. ICLR 2021. —— FAVOR+ 随机特征做线性注意力。 (上述均为机器可验证的公开论文;题录以 arXiv/NeurIPS/ICML 官方页为准。) **DSH 生态类(本插件依赖/装配来源)** 5. `@deepseek-ai/dsh-*` 系列包(dsh-agent-loop / dsh-session-persistence-jsonl / dsh-tools 等) —— 本插件运行的宿主生态(工具注册/会话持久化/注入 inbox 机制)。 6. `dsh-super-injector`(用户生态)—— 插件运行时注入/热重载/卸载管理(本仓库 injector/ 子模块)。 **待审校(未核实前不引用)** - jspace 概念:**待用户提供定义/出处**(占位,不列条目)。 - "双边注意力"的确切论文对应:**待审校**(上面第 1/2 条为最接近的标准出处,非最终指定)。 - 思维惯性懈怠的文献侧对应(认知努力/行为惰性类):**待审校**(当前以实测数据为本位)。 ## 引用-证据对(每条引用 → 本插件复现位置) | 引用 | 复现位置(可执行) | 与插件的关系 | |---|---|---| | Vaswani 2017(双向编码器) | `src/index.js` 审核/终验注入(双向理解期);`tests/inject-text.test.mjs`「finalCheck…不可替代为指标」 | 双向期↔聚焦期二分(映射表第 2 行) | | Devlin 2019(双向 BERT) | `docs/THEORY.md` 条目 2+映射表第 2 行;`src/inject-text.js`(相邻锚语系 adjacent-anchor) | "双边"标准出处候选(**待审校最终对应**) | | Katharopoulos 2020(线性注意力) | `src/index.js` auditBody/先注后键;`tests/mode-state.test.mjs`「auditBody…」 | 上下文线性化策略(映射表第 1 行) | | Choromanski 2021(Performer) | 同上(理论侧同族) | 线性注意力参考之二 | | `@deepseek-ai/dsh-*` | `package.json` `dsh.bundle.patch`(cordis.patch.yml)+ `lib/` 装配 | 宿主契约(inbox/工具/persistence 机制来源) | | `dsh-super-injector` | 本仓库 `injector/` 子模块(INSTALL/SPEC 文档) | 运行管理通道(注入/热重载/卸载) | **审校纪律**:本表无一条引用处于"无出处引用"状态;待审校三项在用户提供前不进入引用正文。