# PatentRadar 评估报告
**以"已认定侵权的真实竞品"为黄金集,度量系统的召回 / 判定 / 证据质量**





---
- **黄金集**:[`测试集.xlsx`](测试集.xlsx),已跑共计**26 个专利** → 已认定侵权竞品。
- **口径**:以专利为单位,命中该专利**任一**真竞品即算命中;位次按 `total_score` 并列排名(同分并列)。
## 评估指标
| 维度 | 指标 | 数值 | 含义 |
|---|---|:---:|---|
| **召回** | Hit@5 | **96.2%** (25/26) | 真竞品进入系统 Top-5 的专利占比 |
| | Hit@3 | 80.8% (21/26) | 真竞品分数排名进前 3 |
| | Hit@1 | 65.4% (17/26) | 真竞品分数排名第 1 |
| | MRR | **0.749** | 平均倒数排名,综合"命中且靠前" |
| **判定** | 证据充足率 | **44.0%** (11/25) | 命中专利中,得分 ≥ 80(竞品证据已充足)的占比 |
| **证据** | URL 可达率 | **95.8%** (454/474) | 报告引用的证据链接有效比例 |
| | URL 准确率 | **93.8%** (380/405) | 链接页面正文确实含对应竞品型号/品牌,非模型编造 |
## 结论
- **召回强**:Hit@5 96.2%,能稳定找出已知侵权方。
- **证据充足率低的原因**:召回到真竞品后只有 44% 的得分 >=80 —— 公司提供的测试集中大部分专利保护的是**内部结构、控制器逻辑等技术要求**,这类特征需要电路图、内部结构图才能证明,公开资料极少、大多存在于公司内部数据库;公开渠道无法凑齐逐特征证据,是当前真竞品证据不足的主要限制(并非系统判定能力本身的缺陷)。这也是拖累Hit@1的主要原因。
- **证据真实可追溯**:URL 95.8% 可达,且 93.8% 的链接页面正文确实含对应竞品标识,模型基本未编造证据链接。
---
附注:
1) **各指标分子 / 分母**(召回类分母统一为 26 = 黄金集专利数(全部已跑);命中位次按 `total_score` 并列排名)
**Hit@5** = 命中专利 / 已跑专利 = 25 / 26(命中 = 该专利任一真竞品进入 Top-5)
**Hit@3** = 最佳命中位次 ≤ 3 的专利 / 26 = 21 / 26
**Hit@1** = 最佳命中位次 = 1 的专利 / 26 = 17 / 26
**MRR** = Σ(每个专利的 1 / 最佳命中位次) / 26,未命中记 0 = 0.749
**证据充足率** = 得分 ≥ 80 的专利 / 命中真竞品的专利 = 11 / 25(分母 25 而非 26:未命中专利系统未找到真竞品,无从评判,不计入)
**URL 可达率** = HTTP 可访问 URL / 全部唯一证据 URL = 454 / 474
**URL 准确率** = 页面正文含对应竞品标识的 URL / 可判定 URL = 380 / 405(排除 52 个 PDF / 动态渲染 / 抓取失败的 URL)
2) **复现方式** · uv run python evaluate/eval.py(召回/判定)· uv run python evaluate/check_urls.py(可达率)· uv run python evaluate/check_evidence.py(准确率)|明细:eval_result.csv