# 研究议程 本实现是未来论文的工程基线。它把运维者显式规则与有界的元数据线索结合起来, 主动判断哪些项目应保留、隔离、删除或复核,并把文件的原目录、名称、用途和处理 建议写入 `workspace-artifacts/` 元数据 catalog。每个判断都可检查、可校准;原文件 默认保持原位,只有确认,或在 `autonomousMode`(全自主模式)下同时开启 `valuePolicy.organization.moveFiles` 才执行物理组织,因此策略可以被测量,而不是一个 不透明的清理后台。核心问题是: > 长程 Agent 如何在保留可复现、可恢复证据的同时,让工作区保持高信息密度并且人类可理解? ## 候选研究维度 ### 1. 来源与归因(provenance) 观察 `write`、`edit`、shell 等文件操作工具,把产物关联到回合、工具调用、Agent 和父任务,比较来源感知选择与仅看文件名的启发式。 ### 2. 效用与保留 综合新鲜度、引用关系、可复现性、下游读取和人的标注,估计产物未来效用。当前基线 已经用有界线索主动给出建议;未来策略应加入更好的证据和校准后的不确定性,同时保留 硬约束与人工覆盖。 ### 3. 生命周期动作 比较仅更新 catalog、移动、重命名、压缩、摘要、去重和过期。每种物理动作都应有可 验证的逆操作,或有明确且经过审阅的损失预算;`to-delete` 条目还应记录确认到源文件 删除和条目移除之间的顺序。 ### 4. 成本与信息密度 测量磁盘字节、模型 token 字节、扫描延迟、对 prompt 的干扰、恢复时间和人完成任务的准确率,同时报告“每个成功任务”的成本。 ### 5. 人类可理解性 评估人能否仅凭工作区、catalog 和 manifest 回答“发生了什么、证据在哪里、怎样撤销”。 候选指标包括查找时间、路径可预测性、catalog 条目完整性和审阅者一致性。 ## 建议的基准实验 1. 建立包含编程、数据和仿真长程任务的可复现语料,记录随机种子与文件事件。 2. 随机分配到 unmanaged、heuristic-managed、provenance-managed 三组。 3. 固定模型、工具和任务预算,只改变维护策略。 4. 预注册安全失败(误移动、源文件丢失、路径逃逸),作为硬停止结果。 5. 在固定检查点测量 token/磁盘增长和最终任务质量。 6. 让盲评审者查找证据并恢复指定产物。 ## 值得检验的假设 - H1:有界的 plan/apply 协议能降低工作区字节数和 prompt 噪声,同时不降低任务成功率。 - H2:来源信号带来的精度提升高于继续堆叠文件名规则。 - H3:当计划解释原因、置信度和可逆目标时,人确认最有价值。 - H4:元数据 catalog 加外部追加式 manifest 相比埋在工作区中的日志能缩短恢复时间。 - H5:在相同价值策略下,全自主模式能降低维护交互成本,但需要更严格的边界和回滚评估。 ## 当前基线与非目标 仓库目前提供运行这些实验所需的基线:managed roots、受保护路径、有界确定性扫描、 价值分类、动作判断、metadata catalog 同步、目录/命名建议、哈希绑定计划、隔离、恢复 和紧凑结果。默认手动模式不会移动或删除源文件;全自主模式是显式的实验开关,仍受 硬保护、预算、指纹和删除许可约束。暂不学习策略、不分析语义引用、不摘要内容。