# SELFFEED 30 天复盘(2026-08-26 → 2026-09-14) 协议: docs/SELFFEED.md · 数据: website/evidence-ds-2026-09/(已冻结归档) ## 一、任务池执行 20 个真任务全部完成(18 个当天执行 + 2 个实质执行于前期日期的补记): | 任务 | 内容 | 执行日 | 关键产物/发现 | |---|---|---|---| | 0 | 默认脚手架审计 | day 24 | pages 参数纯增量;19 文件骨架 | | 1 | feature 模块 | day 27 | 工具参数直达,双 hap 构建 | | 2 | build_doctor | day 21 | 分类器性质澄清(绿构建短路) | | 3 | 签名+装机+启动 | day 18(补记) | 9 步全 PASS 闭环之一 | | 4 | device_test E2E | day 12 | install/launch/log-marker 全 PASS | | 5 | UI 截图+回归 | day 19 | **emulator_stop 假成功缺陷** | | 6 | API 符号核实 | day 13 | **namespace 嵌套索引盲区** | | 7 | codelinter | day 15(补记) | 0 缺陷+阳性对照 | | 8 | schema 破坏闭环 | day 26 | 双破坏全捕获+字节级恢复 | | 9 | 工具链健康 | day 17 | cjpm 仍坏(KB5124114) | | 10 | SDK 版本破坏 | day 28 | **schema 版本盲区+doctor 巧合匹配** | | 11 | 双构建对比 | day 11 | 增量稳态 1.366s 归因 | | 12 | project_profile | day 25 | 8 项抽查零漂移 | | 13 | 双子代理审计 | day 14 | compileSdkVersion 缺失发现 | | 14 | bench 逐案例 | day 20 | **bench 无留档缺口** | | 15 | 知识管线 | day 29 | **7 处硬编码路径→单实现** | | 16 | 模拟器状态 | day 22 | DevEco 探测子进程假阳性洞察 | | 17 | 三页路由 E2E | day 18 | **emulator 路径可发现性缺陷** | | 18 | API 自查 | day 30 | 相邻行不对称盲区 | | 19 | 进化元审计 | day 23 | **预算留痕缺口+晋升门无地板** | **协议自暴露的代码缺陷(全部当日修复并发布)**:预算留痕(0.12.1)、晋升质量地板(0.13.0)、emulator 路径(0.13.1)、emulator stop 假成功(0.13.2)、bench 历史留档(0.13.3)、doctor 错误码签名(0.13.4)、路径解析单实现+knowledge 接线(0.13.5)。共 7 个生产缺陷,全部来自协议运行而非外部评审。 ## 二、金丝雀判定(终局 bench --impact) **零晋升、零退役——全部 needs-data**。"诚实优于噪声"是最终口径。最接近的暴露组: hmharness-session-log-search / kaihongos-vmware-vmx-pci-fix / windows-codelinter-direct-invocation (100% vs 77% 但样本量不足)。**结论:30 天内没有一次"统计可靠"的晋升——正确行为,门在拒绝噪声。** ## 三、统计可靠 vs 噪声 - **可靠**(有真实信号):7 个缺陷修复有可执行载荷验证;readiness 稳定性条件翻转为真(0.54→0.54 双历史);bench 留档后可判定的第一个 RL 门条件。 - **噪声**(被门拒绝):全部金丝雀判定;全部 Pareto 拒绝候选(4 条)——按设计保留为种群多样性。 ## 四、RL 门现状(终局 readiness) 1/6 满足(eval-regression-stable)。其余结构性未达:1000 轨迹(~49 条)、100 案例(26)、100 人工标签(0)、版本化 workflows(无)、holdout(24 已满足)。day-23 元结论成立:**可观测性已跑赢学习信号,30 天窗口内 RL 门结构性不可达——门说"不"说对了。** ## 五、下月任务池修订方向(核心决策) 1. **提产量优先于加审计**:1000 轨迹需 ~136 条/天 vs 实际 2.6 条/天(差 50 倍)。下月池子:每天多个短任务(1-3 轮可验证)而非单一大任务,把"每会话一条轨迹"改成"每会话 N 条轻轨迹"。 2. **任务池 2.0 规则**:每个任务带 `expectedTurns` 与 `evidenceType`(build/log/device/audit);审计类任务从 8 个降到 2 个。 3. **人工标签通道**:reward-human-correlation 是第二个可解锁条件——接一个 `hmh label <1-5>` 交互,用户抽样本打分,凑满 100 条。 4. **workflows 版本化**:M9 已有 candidates/workflows 骨架,激活即解锁第五条件。 5. **保留**:缺陷修复闭环机制(每日任务 = 生产探针)继续,这是本协议最被低估的产出。 ## 六、诚实边界 - 本数据集是**机制验证**数据集,不是 RL 训练集:样本量不足以支撑任何统计结论,只有缺陷清单与门行为可复用。 - "越用越聪明"仍未被证实——被证实的是"越用越知道自己不聪明"(审计面优于信号面)。