--- title: AI 评测记录模板 description: 记录任务范围、保留样本、版本、硬性条件、失败与完整成本,支持采用、修复或撤回 AI 工作流的决定。 updated: 2026-10-03 --- # AI 评测记录模板 配合 [AI 评测与可靠性](../threads/practice/ai-evaluation.md) 使用。先填写标准,再运行案例。空表用于记录一个版本比较;示例数字不代表模型性能或通用上线门槛。 ## 可复制记录 ```markdown # AI Evaluation — 日期 / 任务 ## 范围 - 用户和要完成的动作: - 输入材料、权限和去标识方式: - 人工基线及总耗时: - 不支持的任务: ## 测试设置(运行前固定) - 当前版本 / 候选版本: - 模型、提示、检索材料、工具版本: - 运行日期、地区、记忆设置;无法固定的服务版本: - 本轮只改变什么: - 开发样本 / 未参与调优的保留样本: - 每例运行次数及时间、调用、费用上限: - 必须全部通过的条件: - 可比较的质量与人工评分说明: - 评分人 / 争议如何解决: - 相关失败场景:来源缺失 / 提示注入 / 越权 / 失控重试或重复副作用 / 转写或识图错误: ## 逐例记录(每个版本分别复制本区) - 本区版本: - ID 使用“案例编号 / 尝试序号”,例如 07 / 2;输入指向固定的案例材料。 ### 案例(每次尝试复制一份) - 案例编号 / 尝试序号: - 类型与固定输入材料位置: - 预期行为 / 判断依据: - 支持结论的原文位置 / 音视频时间段 / 图片区域: - 实际行为 / 产物位置: - 过程记录 / 工具调用 / 授权记录位置: - 最终环境结果(文件、数据库或用户可见状态): - 首次是否合格 / 硬性条件失败: - 人工修改分钟 / 修改内容: - 最终状态(失败与超时也保留): ## 汇总(每个版本单独计算,失败与超时保留在分母中) - 首次合格数 / 全部尝试数: - 必须条件失败及具体案例: - 人工修改后合格数 / 全部尝试数: - 准备、运行、核验、返工总分钟: - 工具费用及工时估值口径: - 本批总过程成本 / 最终合格数量: - 证据限制与不支持的推断: ## 决定与后续 - 采用 / 维持现状 / 修复复测 / 停止: - 支持这个决定的案例: - 新增回归案例及重跑范围: - 模型、资料、工具或记忆变化后的复测触发;上次合格版本: - 允许使用范围 / 人工接管 / 撤回触发: - 换供应商、关闭记忆或断开工具后的退出演练结果: - 负责人、复查日期、记录位置: ``` 若最终合格数量为零,每份合格结果成本写“无法计算”,保留已经发生的总支出,不用零替代。 ## 填写示例:公开资料比较表 以下是假设案例,与章节示例一致:十条案例各运行一次,当前版本 A 首次合格 8 条,候选 B 首次合格 9 条;两版经人工修订后各合格 10 条。 | 字段 | 示例填写 | | --- | --- | | 本轮改变 | 只修改提取提示,材料与工具相同 | | 必须条件 | 关键数字有出处;缺失价格不得推断 | | 失败记录 B-07 | 原文未提供价格;B 写成“免费”;人工改回“未提供” | | A 的成本 | 总工时 120 分钟,按 60 元/小时估值,工具 6 元;共 126 元 | | B 的成本 | 总工时 100 分钟,同样估值,工具 8 元;共 108 元 | | 决定 | 保留当前范围;B 先修复,不扩大使用 | | 下一步 | 加入缺价、价格过期、价格冲突案例,同时重跑此前合格案例 | | 证据限制 | 小样本且每例一次;不能推断线上错误率;修订后正确不等于自主可靠 | 把实际结果保存在可复查的文件中。记录“已完成”时,附上文件、测试输出或系统状态,而不只贴模型的完成声明。 ## 从记录到行动 一轮只修复一个主要错误模式,并检查旧案例是否退步。流程仍不清楚时回到 [AI 任务简报](ai-task-brief.md);项目准备对外服务时,再填写 [创业实验卡](startup-experiment.md),分别验证结果质量与真实需求。