# AICoding 代码审查评测 · 2026-09-25 > 后补过程核验:[录屏时间索引与过程核验](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E5%AE%8C%E6%95%B4%E6%B5%81%E7%A8%8B%E5%BD%95%E5%B1%8F/%E5%BD%95%E5%B1%8F%E6%97%B6%E9%97%B4%E7%B4%A2%E5%BC%95%E4%B8%8E%E8%BF%87%E7%A8%8B%E6%A0%B8%E9%AA%8C.md)。包含定位点、提供者补充说明、配置与过程独立性限制;账号与邮箱按提供者要求保留;凭据检查范围和结论见说明。 **先看结论,再读原文,需要时查证据。** 这是一项针对同一提交的八方代码审查产物评测,opencode已纳入同一轮。 审查对象:[zhikuncode `0db4b049`](https://github.com/zhikunqingtao/zhikuncode/commit/0db4b0498f6cf886f862fe293883256b1c52e049)。参赛工具的模型和推理设置按实验提供者说明一致;本资料评价这一次产物,不将单题排序外推成产品总体能力。 **评审工具与模型:本轮评价、打分和排名由 Codex 使用 GPT-6 Astra 的 Ultra 推理模式完成。** [录屏截图](#评审工具与录屏截图)展示了本轮评审任务和界面中的模式标签。 ## 全程录屏与自主评分 据实验提供者说明,**本次实验全程录屏,涵盖八款 AICoding 工具执行审查、生成报告,以及随后由 Codex 评价、打分和形成排名的过程**;公开的视频从原始录屏开头完整压缩而来,未截去前段。 **审查内容与评分结果没有人工干预。尤其在打分环节,没有人为预设评价指标、维度权重、具体分数或排名顺序,全部交由 Codex 自主制定和执行。** 实验提供者提出的核心要求是:以专业、全面、准确、公平的方式评审,**排名及其依据要经得起所有人的质疑**。下文的六维指标和权重是 Codex 自主形成的评审方案,具体形成与修订过程见方法记录。 上述为实验提供者对执行过程的补充说明。“无人工干预”指没有人为修改审查内容、评分规则或结果;任务发起、材料提供与必要的权限批准另行记录。提供者此前确认,仅 opencode 和 DeepSeekHarness 获得过权限批准,没有人工重试或重启任务。八款工具的启动及模型/推理设置没有全部展示在视频中;录像可核验的范围见[录屏时间索引与过程核验](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E5%AE%8C%E6%95%B4%E6%B5%81%E7%A8%8B%E5%BD%95%E5%B1%8F/%E5%BD%95%E5%B1%8F%E6%97%B6%E9%97%B4%E7%B4%A2%E5%BC%95%E4%B8%8E%E8%BF%87%E7%A8%8B%E6%A0%B8%E9%AA%8C.md)。 ## 从哪里开始 | 你的目的 | 阅读入口 | 能看到什么 | | --- | --- | --- | | 快速了解比较结果 | [综合评测报告(冻结原文)](AICoding%E5%85%AB%E6%96%B9%E8%AF%84%E6%B5%8B_%E7%BB%BC%E5%90%88%E6%8E%92%E5%90%8D%E4%B8%8E%E8%AF%81%E6%8D%AE%E5%AE%A1%E8%AE%A1.md) | 排名、逐家评价、主要技术裁决与排名敏感性。 | | 阅读某个参赛方的完整审查 | 下面排名表中的“原报告” | 八份原报告逐字保留;不以评审摘要替代参赛方观点。 | | 核查一项结论 | [证据阅读指南](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E8%AF%81%E6%8D%AE%E9%98%85%E8%AF%BB%E6%8C%87%E5%8D%97.md) | 从评分条目追到原文、源码、探针和日志。 | | 查找附件或复算 | [附件总索引](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/README.md) | 按用途找文件;高级校验及恢复工具集中在末尾。 | ## 本题结果 以下分数来自冻结评分数据,没有因目录整理而重评。总分100,由发现30、准确20、归因15、证据15、工程覆盖12、建议与交付8组成。 | 计算序位 | 参赛方 / 原报告 | 得分 | 本次表现中的主要特点 | | --- | --- | --- | --- | | 1 | [zhikuncode](zhikuncode_commit-0db4b049-%E7%8B%AC%E7%AB%8B%E5%AE%A1%E6%9F%A5%E6%8A%A5%E5%91%8A.md) | 71.0 | 跨链路覆盖、字段契约与证据留存 | | 2 | [DeepSeekHarness](DeepSeekHarness_zhikuncode_commit-0db4b04_%E7%8B%AC%E7%AB%8B%E5%AE%A1%E6%9F%A5%E6%8A%A5%E5%91%8A.md) | 69.6 | 启动取消终态回归、对照证据 | | 3 | [opencode](opencode_commit_0db4b04_review.md) | 65.5 | 真实Request取消吞没导致请求挂起 | | 4 | [pi](pi_zhikuncode_commit-0db4b04_review.md) | 64.7 | Java取消与Python关闭恢复边界 | | 5 | [ZCode](ZCode_commit-0db4b04_%E8%BF%9B%E7%A8%8B%E4%B8%8E%E6%B5%8F%E8%A7%88%E5%99%A8%E7%94%9F%E5%91%BD%E5%91%A8%E6%9C%9F%E4%BF%AE%E5%A4%8D%E7%8B%AC%E7%AB%8B%E5%AE%A1%E6%9F%A5.md) | 62.0 | 同会话阻塞链路、动态复现实物 | | 6 | [QoderIDE](QoderIDE_zhikuncode_commit-0db4b049_%E7%8B%AC%E7%AB%8B%E4%BB%A3%E7%A0%81%E5%AE%A1%E6%9F%A5%E6%8A%A5%E5%91%8A.md) | 57.5 | 静态调用链核对与自我纠错 | | 7 | [QoderCN](QoderCN_commit-0db4b04-%E8%BF%9B%E7%A8%8B%E4%B8%8E%E6%B5%8F%E8%A7%88%E5%99%A8%E7%94%9F%E5%91%BD%E5%91%A8%E6%9C%9F%E4%BF%AE%E5%A4%8D%E5%AE%A1%E6%9F%A5.md) | 55.1 | 主要行为变化、简洁风险概括 | | 8 | [TraceCodeCn](TraceCodeCn_0db4b04_lifecycle-fix-review.md) | 55.1 | macOS进程残留的实测反例 | **不要把小数分差读成确定的能力差距。** 第一、第二接近;第三、第四接近;末两份实质并列。权重或部分条目的信用解释变化会改变一些顺序,详见综合报告的敏感性分析。主要特点一栏只帮助定位阅读,不代表该报告没有误报或遗漏。 ## 怎样理解这份评测 - **事实与评分分开。** 源码和实验用于裁决事实;评分条目与维度锚点由 Codex 按公开规则作出评审判断,分数由公开脚本计算,可被具体反证修正。 - **发现价值与报告广度同时考虑。** opencode的独有挂起发现获得完整发现信用;它不会自动补齐其他链路的遗漏。 - **不靠问题数量、篇幅或多数投票排名。** 16项统一机会、76项事实族裁决与各维度锚点均公开。 - **不把测试通过当作“零缺陷”。** 测试使用的替身、平台、父提交对照和未覆盖范围均有记录。 具体依据:[逐项评分明细](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E8%AF%84%E5%AE%A1%E7%BB%93%E6%9E%9C_20260925_v1/%E8%AF%84%E5%88%86%E6%98%8E%E7%BB%86_%E6%9C%BA%E4%BC%9A%E7%9F%A9%E9%98%B5%E4%B8%8E%E4%BA%8B%E5%AE%9E%E8%A3%81%E5%86%B3.md) · [方法与修订记录](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E8%AF%84%E5%AE%A1%E7%BB%93%E6%9E%9C_20260925_v1/%E5%A4%8D%E6%A0%B8%E8%AF%B4%E6%98%8E_%E6%96%B9%E6%B3%95%E4%BF%AE%E8%AE%A2%E4%B8%8E%E9%87%8D%E7%AE%97.md) · [Java独立核验](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E8%AF%84%E5%AE%A1%E7%BB%93%E6%9E%9C_20260925_v1/evidence/java/ground_truth_java.md) · [Python独立核验](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E8%AF%84%E5%AE%A1%E7%BB%93%E6%9E%9C_20260925_v1/evidence/python/ground_truth_python.md)。 ## 评审工具与录屏截图 以下截图由实验提供者从本次流程录屏中补充,保留原图和圈注。画面展示 Codex 中的评价任务,底部模型与推理模式标签为 **GPT-6 Astra Ultra**。 ![Codex 执行本轮评审任务,界面显示 GPT-6 Astra Ultra 模式](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E5%AE%8C%E6%95%B4%E6%B5%81%E7%A8%8B%E5%BD%95%E5%B1%8F/codex-gpt6-astra-ultra-review.png) 完整过程见[流程录屏与时间索引](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E5%AE%8C%E6%95%B4%E6%B5%81%E7%A8%8B%E5%BD%95%E5%B1%8F/%E5%BD%95%E5%B1%8F%E6%97%B6%E9%97%B4%E7%B4%A2%E5%BC%95%E4%B8%8E%E8%BF%87%E7%A8%8B%E6%A0%B8%E9%AA%8C.md)。截图用于补充评审工具与模式说明,冻结报告及评分保持不变。 ## 原件、导读与附件的关系 顶层保留**八份参赛报告、综合评测报告和本阅读首页**,其余归入“证据附件”。报告、评分和独有实验记录不因整理而删除;43份已冻结的Markdown保持原始字节。新增导读只提供说明与入口,不新增评审结论,也不冒充盲评或独立人类专家投票。 原文中的本机绝对路径按冻结要求保留。需要打开相关文件时,请用[逐文档引用导航](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E6%95%B4%E7%90%86%E8%AF%B4%E6%98%8E/%E5%86%BB%E7%BB%93%E6%96%87%E6%A1%A3%E4%B8%8E%E8%BF%87%E7%A8%8B%E6%96%87%E4%BB%B6%E5%AF%BC%E8%88%AA.md),不要把原文中的本机路径当成GitHub链接。 [缺失原件说明](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E6%95%B4%E7%90%86%E8%AF%B4%E6%98%8E/%E7%BC%BA%E5%A4%B1%E8%BF%87%E7%A8%8B%E6%96%87%E4%BB%B6%E8%AF%B4%E6%98%8E.md)保留4个已无法取得的过程路径;独立复验不冒充原实验。后补用量数据已单列、脱敏,没有用于改写本轮排名。1.82 GB原始录屏仍不上传;已补充[完整流程压缩录屏](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E5%AE%8C%E6%95%B4%E6%B5%81%E7%A8%8B%E5%BD%95%E5%B1%8F/%E9%92%89%E9%92%89%E5%BD%95%E5%B1%8F_2026-09-25%20092622_100M.mp4)(约1小时57分26秒,89.75 MiB)。据提供者说明,覆盖每个AICoding从开始到结束及完整评测流程;未据此修改冻结评分。 ## 透明性与复核 [文件来源与原件/发布SHA](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E6%A0%A1%E9%AA%8C%E4%B8%8E%E6%9D%A5%E6%BA%90/publication_manifest.json) · [目录迁移记录](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E6%A0%A1%E9%AA%8C%E4%B8%8E%E6%9D%A5%E6%BA%90/layout_manifest.json) · [最新校验结果](%E8%AF%81%E6%8D%AE%E9%99%84%E4%BB%B6/%E6%A0%A1%E9%AA%8C%E4%B8%8E%E6%9D%A5%E6%BA%90/publication_validation.json) 读者可用这些记录核查冻结原文、来源、脱敏和目录整理。没有运行成本/速度的统一日志,也没有重复任务样本,所以这里不提供性价比榜、胜率或统计置信区间。