# PatentRadar 评估报告 **以"已认定侵权的真实竞品"为黄金集,度量系统的召回 / 判定 / 证据质量** ![Hit@5](https://img.shields.io/badge/Hit@5-96.2%25-2E7D32) ![Hit@1](https://img.shields.io/badge/Hit@1-65.4%25-1565C0) ![MRR](https://img.shields.io/badge/MRR-0.749-1565C0) ![URL可达率](https://img.shields.io/badge/URL可达率-95.8%25-6A1B9A) ![URL准确率](https://img.shields.io/badge/URL准确率-93.8%25-6A1B9A)
--- - **黄金集**:[`测试集.xlsx`](测试集.xlsx),已跑共计**26 个专利** → 已认定侵权竞品。 - **口径**:以专利为单位,命中该专利**任一**真竞品即算命中;位次按 `total_score` 并列排名(同分并列)。 ## 评估指标 | 维度 | 指标 | 数值 | 含义 | |---|---|:---:|---| | **召回** | Hit@5 | **96.2%** (25/26) | 真竞品进入系统 Top-5 的专利占比 | | | Hit@3 | 80.8% (21/26) | 真竞品分数排名进前 3 | | | Hit@1 | 65.4% (17/26) | 真竞品分数排名第 1 | | | MRR | **0.749** | 平均倒数排名,综合"命中且靠前" | | **判定** | 证据充足率 | **44.0%** (11/25) | 命中专利中,得分 ≥ 80(竞品证据已充足)的占比 | | **证据** | URL 可达率 | **95.8%** (454/474) | 报告引用的证据链接有效比例 | | | URL 准确率 | **93.8%** (380/405) | 链接页面正文确实含对应竞品型号/品牌,非模型编造 | ## 结论 - **召回强**:Hit@5 96.2%,能稳定找出已知侵权方。 - **证据充足率低的原因**:召回到真竞品后只有 44% 的得分 >=80 —— 公司提供的测试集中大部分专利保护的是**内部结构、控制器逻辑等技术要求**,这类特征需要电路图、内部结构图才能证明,公开资料极少、大多存在于公司内部数据库;公开渠道无法凑齐逐特征证据,是当前真竞品证据不足的主要限制(并非系统判定能力本身的缺陷)。这也是拖累Hit@1的主要原因。 - **证据真实可追溯**:URL 95.8% 可达,且 93.8% 的链接页面正文确实含对应竞品标识,模型基本未编造证据链接。 --- 附注: 1) **各指标分子 / 分母**(召回类分母统一为 26 = 黄金集专利数(全部已跑);命中位次按 `total_score` 并列排名) **Hit@5** = 命中专利 / 已跑专利 = 25 / 26(命中 = 该专利任一真竞品进入 Top-5)
**Hit@3** = 最佳命中位次 ≤ 3 的专利 / 26 = 21 / 26
**Hit@1** = 最佳命中位次 = 1 的专利 / 26 = 17 / 26
**MRR** = Σ(每个专利的 1 / 最佳命中位次) / 26,未命中记 0 = 0.749
**证据充足率** = 得分 ≥ 80 的专利 / 命中真竞品的专利 = 11 / 25(分母 25 而非 26:未命中专利系统未找到真竞品,无从评判,不计入)
**URL 可达率** = HTTP 可访问 URL / 全部唯一证据 URL = 454 / 474
**URL 准确率** = 页面正文含对应竞品标识的 URL / 可判定 URL = 380 / 405(排除 52 个 PDF / 动态渲染 / 抓取失败的 URL) 2) **复现方式** · uv run python evaluate/eval.py(召回/判定)· uv run python evaluate/check_urls.py(可达率)· uv run python evaluate/check_evidence.py(准确率)|明细:eval_result.csv