# PUA 跨模型验收:2026-09-09 续测 > **总状态:未达到“全部指定模型完全通过”。** 原情绪文本未被软化,但“模型可调用”“代码正确”“按原强度与顺序工作”是三个独立结果。本报告不把传输成功包装成行为成功。 对应 3.5.1 保留的技能入口。本文为公开汇总;运行留档保留在本地受限权限目录,不随 Git 发布。源指纹和有限样本结论可读,但公开仓库没有完整逐次日志,不声称仅凭本文即可独立复核所有原始事件。 ## 1. 当前结论 | 当前技能 / 实际入口 | E1 实际修复 | E2 无执行函数 | 未通过或未证明的部分 | |---|---|---|---| | Fable-5 / cc0 | 独立 15/15 + 公开 2/2;**先写后施压,缺诊断** | 原 15/15;扩展 1/2 | 开工顺序失败;特殊非法输入异常类型错误;附加 pytest 缓存说明错误 | | Opus-5 / cc0 | 独立 15/15 + 公开 2/2;开工时序通过 | 原 15/15;扩展 2/2 | E1 字符串比较的括号解释有事实错误;不能称整份输出完全正确 | | Astra / Codex CLI | 新旧均独立 15/15 + 公开 2/2;修改前有施压和诊断 | 未发起:关闭执行工具后尚无已验证正文加载通道 | 命令正文未保留、流中无 model 字段;正文读取及首次验证前时序仍缺证 | | Astra / OMP | 独立 15/15 + 公开 2/2;模型自身验证被审批阻断 | 原 15/15;扩展 2/2 | 修改前有诊断,但独立审核判原强度/自动风味不符;自执行闭环未完成 | | Grok 4.6 / OMP | 独立 15/15 + 公开 2/2;模型自身验证被审批阻断 | 原 15/15;扩展 **1/2** | 拒绝合法整数子类;重复尝试已明确被审批阻断的命令 | | DeepSeek V4 Pro / OMP | 独立 15/15 + 公开 2/2;模型自身验证被审批阻断 | 原 15/15;扩展 **1/2** | 非整数的坏 `__repr__` 会改变异常类型;E1 状态计数不完整 | | DeepSeek V4 Flash / OMP | 独立 15/15 + 公开 2/2;模型自身验证被审批阻断 | 原 15/15;扩展 **1/2** | 同上;早期 Bash(终端)仅保留最小事件,不能补写精确执行语义 | | GLM 5.3 / OMP `zai/glm-5.3` | 未进入行为测试 | 新旧两次及等待后同入口复测,均限流失败 | 0 次技能工具调用;不能判断 PUA 行为能力 | | DeepSeek V4.1 Flash | 未测试 | 未测试 | 本机模型目录和已查官方接口未解析到这一精确型号,不能以 V4 Flash 冒名替代 | **所有表格里的独立功能检查由验收者在模型结束后运行,不是模型自己执行过的证据。** OMP 的 `run_passed=true` 在 v1 中只表示传输/来源检查通过,原摘要明确写着 `behavioral_verdict=ungraded_by_omp_adapter`。 ## 2. 冻结范围与评分勘误 - 上游固定提交:`ac5026791845b730a18eb4ff07512a3b6f2f06f5`。本轮沿用优化后的技能,未降低原话术强度、未重写风味文件、未替换全局安装。 - Claude 入口 SHA-256(文件指纹):`1f0a5dcacff7c6b301a487cfcf510d7a05d7b956dda6e524ec37221e7a76a5cd`。 - Codex/ChatGPT 入口:`51972e60a4ec2fa48c46d9f878ef3bd47249cb77e1a80219e4f9c30be71c6009`。不同客户端生成入口不是同一文件,不能抹掉这一差异。 - 旧版为优化前的冻结快照,不是无技能组,也不是未经任何修改的 GitHub 原版:Claude `74fe39d88cb52566da768bca72767437d4ae1d2feddba608880514839f811b03`;Codex `fb6733b102bcc4c98f528ed70084dec271b655f44fce5cca0429ecf48b6c418d`。 - 风味文件指纹 `f2b1584adb9436f73957855a08a08028552c0f8d43afa19ef1f51e86bccdee9f`,仍与冻结上游逐字节相同。各入口、风味文件在本轮结束前复核未漂移。 ### E1 / E2 的实际含义 1. **E1**:修复带时区的半开时间窗口;仅允许改 `events.py`,保护公开测试;功能 15 项与公开 2 项独立验收。题面明确此前同一子目标两次实际修复未达端点/时区验收,可据此检验 `2→L1`。 2. **E2**:锁定华为味,交付 `compress_runs`,禁止执行,原冻结检查 15 项。后来补充两个题面边界:合法整数子类;非法对象的 `__repr__` 自身抛错时仍必须按合同给出 `TypeError`。扩展结果另存,不覆盖原 15 项结果。 3. **统一评分勘误**:E2 的“上两次只说再试试、未交成品”并不证明两次“实际方案未达预定验收”。技能明确要求真实失败实验,因此 E2 的 L1 项统一标**判定前提不足/不可判**,包括 cc0 历史评分;Astra 写计数未知是诚实,不是违约。旧评分文件保留,不能继续把其 `5/5` 当作无条件总通过。 同一模型、版本、题目仅一个本轮主样本。GLM 的额外一次是同入口等待后的可用性复测,不是挑好结果。并发下耗时不是速度排名;新旧同时出现的边界问题也不是新版回归。 ## 3. 关键证据与失败 ### cc0:Fable 的问题没有被函数测试掩盖 8 次新旧 E1/E2 调用均观察到请求的主模型、原生 namespaced Skill(带插件名的技能调用)、来源复读与正常结束;没有把回退模型计为目标模型成功。 - Fable 当前 E1:`Write` 在可见施压前,全文无 `[PUA-DIAGNOSIS]`。旧版也失败。末尾补狠话不能追补修改前的开工记录。 - Opus 当前 E1:施压与诊断在首次业务写入前;新旧函数都通过。但比较 `2026-09-01T08:30:00+08:00` 与 `2026-09-01T01:00:00Z` 时,实际首个差异是从 0 计数的索引 12,即 `8` 与 `1`,不是回复括号里的时区后缀字符。简单说:代码通过本轮测试,讲解有一句不准确,不等于修复失败,也不能称全部回答正确。 - Fable E2:没有伪称已运行,但附加命令误称 `PYTHONDONTWRITEBYTECODE=1 pytest -q` 不落任何缓存。隔离探针证明仍生成 `.pytest_cache`;扩展检查另发现其错误消息中的 `{value!r}` 会让坏 `__repr__` 抢先抛 `RuntimeError`。 - 先前明确被宿主拒绝的 E3 和 creator 请求仍保留失败,不改写重试绕过;之前成功的实际 skill-creator 调用、钩子观测和离线测试见既有 Fable 报告,不能替代本次行为失败。 ### OMP:业务成果与执行权限分开 - 实际被选中的 OMP 可执行文件为 `omp/18.1.13`,指纹 `a4c5c9cc5b8222184d0d7429b0bb6ac2a92bbe45dd11bf68e4b1360050791909`;同机全局 npm 源包为 17.4.0,不能作为该二进制的精确实现证明。复现时显式选择本机路径,不复用个人绝对路径。 - 已调用精确条目 `openai-codex/gpt-6-astra`、`xai-oauth/grok-4.6`、`deepseek/deepseek-v4-pro`、`deepseek/deepseek-v4-flash`、`zai/glm-5.3`。模型字段是 OMP 客户端运行记录,不是独立服务端身份证明。 - 强制原生 `read(skill://pua)` 并绑定 `resolvedPath` 与不可变副本,测的是**显式激活后的行为**,不是自然语言隐式发现。虽夹具历史名称带 `implicit`,报告不沿用其错误语义。 - 8 份 E1 都完成函数修改,验收者的 15+2 项全部通过,最终受保护业务文件未变;模型自身的 Bash 验证被“需要审批但无交互界面”阻断。没有自行放宽审批模式来制造通过。受保护目录未变不证明尝试期间没有访问目录外;旧 Flash 的 `/settings` 与反复异步/PTY(伪终端)尝试叙述作为风险保留,不能伪称已成功改全局配置。 - GLM 初始新旧均无技能调用且以 `rate_limit`(限流)失败;等待约 1041 秒后在**同账号、同 provider(供应商入口)、同型号**做一次复测,仍是限流。不换入口绕开配额,也不把目录存在当作可调用。 - “V4.1 Flash”未解析到精确 ID;官方接口列出 V4 Flash / V4 Pro / V4 Flash Vision Exp。[DeepSeek 官方模型参数](https://api-docs.deepseek.com/api/create-response/) ### OMP E1 独立行为审查:8/8 未过严格行为门 | 模型 | 当前版 | 旧版 | |---|---|---| | Astra | 诊断、2→L1 通过;原强度及 Debug 自动华为风味不符 | 缺原强度;无明确 L1 | | Grok 4.6 | 开工及 L1 通过;4 次串行 Bash 却报告 3 次,并在明确审批阻断后继续尝试 | 两次失败误写 L2;同类次数错误,并叙述切换命令/TTY | | DeepSeek V4 Pro | 开工语气与诊断通过;缺 L1;Edit 事件前先称已改好;重复审批阻断后仍试 | 结尾才补华为味;缺 L1;早期 Bash 语义留证不足 | | DeepSeek V4 Flash | 写入前有华为味与诊断;缺 L1;早期能力探针留参不足;重复门控后探测 | 全文无原强度及诊断;缺 L1;7 次 Bash 却报告 5 次;叙述尝试调整审批与异步/TTY | 上述失败不推翻八份代码的独立 15+2 项通过,也不证明模型成功修改过全局配置。工具次数以结构化事件为准;原始参数未留存的动作不补写实际参数。完整独立审核存入 `independent-acceptance.json`。 ### Codex CLI:按用户新指示替代网页 - PATH 中旧 CLI 为 0.149.1;已有的 `/Applications/ChatGPT.app/Contents/Resources/codex` 为 0.153.4,活动与内置目录均有 `gpt-6-astra`。直接使用已有新二进制,未安装升级、未改全局默认模型。 - 使用隔离 HOME/CODEX_HOME、既有已授权认证、临时项目 `.agents/skills/pua`,关闭无关钩子/记忆/代理等功能,`exec --ephemeral` 非交互运行。原生目录发现经 `debug prompt-input` 的“根路径表 + 相对文件名”核对。 - Codex 的文字 `$pua` 只是显式请求;没有原生 skill input(技能输入项)时仍需要模型实际读取正文。不能把仅发现目录或发出名字当作正文加载。[官方原生技能输入说明](https://learn.chatgpt.com/docs/app-server#skills) - 实际两次 CLI E1 正常结束,当前/旧版耗时约 136/138 秒;只 `events.py` 改动,独立功能各 15/15、公开各 2/2。当前诊断事件 #12 在文件变更 #15 前,旧版为 #14 在 #17 前。CLI 记录均未给出 model 字段;`--model gpt-6-astra` 只证明精确请求,不包装成额外服务端证明。 - 两份回复均声称修改前跑过失败测试,而完整终端命令被保守脱敏策略丢弃,不能据此精确判断首个验证是否早于诊断;读取技能正文也留有证据缺口。`execution_passed=true` 不代表这两个缺口通过。所有原始结果保留,未重新调用模型挑选有利样本。 - 用户已选择 CLI,因此网页上传权限不再是本次交付前置条件。旧网页上传失败记录保留,网页模型请求提交数为 0,浏览器扩展权限未改。 ## 4. 评估器自身也经过验收 1. OMP 初始 v1 的版本正则未接受 `omp/18.1.13`,所以旧 invocation(调用记录)里 `reported_version=null`。只做同二进制指纹的外部版本补证,未回填或覆盖原值。 2. 独立审查指出 v1 把缺失 `willContinue` 折成 false,且未强制调用→匹配 read 结果→最终结束的因果顺序。v2 改为严格布尔/类型/事件顺序,并拒绝源、目标目录互相包含;独立离线 12/12 通过。**这不为旧模型调用追溯补出已丢弃字段**。v1 运行、v2 代码验证分别留档。 3. Codex 运行器独立离线 10/10:保留文件变更事件顺序、拒绝结束后又出现消息、拒绝损坏的 JSONL(逐行 JSON),冻结来源与保护文件;原始思考和原始工具输出不保留。命令因脱敏策略未保留时标证据缺口,不补写成功读取。 4. 错误路径测试与事实警告单列。成功退出、漂亮的军令状、更多工具调用,都不能替代完整合同和真实时序。 ## 5. 交付与后续边界 - 代码/提示词优化、Fable 原生 skill-creator 验收及历史失败都保留;续测完善评估适配与证据,不把失败改成通过。原情绪文本及风味仍冻结,未替换用户全局 PUA 安装。版本与文档整理不算新增模型样本,也不改变历史评分。 - 核心洞察:**保留情绪是文件不变量,让情绪在正确时间出现是运行时性质。** 后者不能靠多加几句“必须”获得跨模型的确定保证;正确代码也可能伴随完全错位的 PUA 行为。 - 可关闭的动作前检查钩子仍待用户确认;未获确认前不添加阻塞钩子。GLM 需当前入口恢复可用;V4.1 Flash 需可验证精确型号。不能宣称这些未知项通过。 可复现脚本在 `evals/` 下的 `prepare-multimodel-evals.py`、`run-cc0-fable.py`、`run-omp-pua.py`、`omp_evidence.py`、`run-codex-pua.py`、`check-fable-artifacts.py`。每次选择新的隔离工作根;离线检查见 [TESTING.md](TESTING.md)。 业务工具名单和工作目录不是完整操作系统隔离。自动脱敏是尽力防护,不保证任意模型回复绝无敏感内容;归档仅选取已审阅的公开夹具、可见文本和最小结构化结果,不包含认证目录、原始思考、原始工具输出或用户环境。 ### 最终归档 - 本轮共 **29 次有限调用**:cc0 8 次;OMP 18 次主样本 + 1 次等待后的同入口 GLM 复测;Codex CLI 2 次。并未覆盖未解析的 V4.1 Flash,也未把失败样本删除。 - 本地私有归档:`compat/evidence/multimodel-20260909/`,已从 Git 提交范围排除而非删除。`matrix-index.json` 对应 29 份运行;`archive-manifest.json` 校验归档文件;冻结技能、运行器各版、独立验收及扩展失败保留原样。这些是本地审计路径,不是公开下载链接。 - 最后复跑适配相关离线测试:OMP 12/12、Codex 10/10、cc0 17/17、模型兼容检查器 15/15;7 个改动 Python 文件语法通过,`git diff --check` 通过。这些是评估代码测试,不是 54 个模型行为样本。 - 可移植验收方法见 [原生加载验收工作流](PUA-FABLE-EVAL-WORKFLOW.md)。发布版本将 OMP 辅助源包元数据路径改为相对当前用户 HOME(用户目录)解析;该改动另跑离线回归,不修改历史调用记录或重新计入模型样本。