PatentRadar 评估报告
June 3, 2026 · View on GitHub
- 黄金集:
测试集.xlsx,已跑共计26 个专利 → 已认定侵权竞品。 - 口径:以专利为单位,命中该专利任一真竞品即算命中;位次按
total_score并列排名(同分并列)。
评估指标
| 维度 | 指标 | 数值 | 含义 |
|---|---|---|---|
| 召回 | Hit@5 | 96.2% (25/26) | 真竞品进入系统 Top-5 的专利占比 |
| Hit@3 | 80.8% (21/26) | 真竞品分数排名进前 3 | |
| Hit@1 | 65.4% (17/26) | 真竞品分数排名第 1 | |
| MRR | 0.749 | 平均倒数排名,综合"命中且靠前" | |
| 判定 | 证据充足率 | 44.0% (11/25) | 命中专利中,得分 ≥ 80(竞品证据已充足)的占比 |
| 证据 | URL 可达率 | 95.8% (454/474) | 报告引用的证据链接有效比例 |
| URL 准确率 | 93.8% (380/405) | 链接页面正文确实含对应竞品型号/品牌,非模型编造 |
结论
- 召回强:Hit@5 96.2%,能稳定找出已知侵权方。
- 证据充足率低的原因:召回到真竞品后只有 44% 的得分 >=80 —— 公司提供的测试集中大部分专利保护的是内部结构、控制器逻辑等技术要求,这类特征需要电路图、内部结构图才能证明,公开资料极少、大多存在于公司内部数据库;公开渠道无法凑齐逐特征证据,是当前真竞品证据不足的主要限制(并非系统判定能力本身的缺陷)。这也是拖累Hit@1的主要原因。
- 证据真实可追溯:URL 95.8% 可达,且 93.8% 的链接页面正文确实含对应竞品标识,模型基本未编造证据链接。
附注:
1) 各指标分子 / 分母(召回类分母统一为 26 = 黄金集专利数(全部已跑);命中位次按 total_score 并列排名)
Hit@5 = 命中专利 / 已跑专利 = 25 / 26(命中 = 该专利任一真竞品进入 Top-5)
Hit@3 = 最佳命中位次 ≤ 3 的专利 / 26 = 21 / 26
Hit@1 = 最佳命中位次 = 1 的专利 / 26 = 17 / 26
MRR = Σ(每个专利的 1 / 最佳命中位次) / 26,未命中记 0 = 0.749
证据充足率 = 得分 ≥ 80 的专利 / 命中真竞品的专利 = 11 / 25(分母 25 而非 26:未命中专利系统未找到真竞品,无从评判,不计入)
URL 可达率 = HTTP 可访问 URL / 全部唯一证据 URL = 454 / 474
URL 准确率 = 页面正文含对应竞品标识的 URL / 可判定 URL = 380 / 405(排除 52 个 PDF / 动态渲染 / 抓取失败的 URL)
2) 复现方式 · uv run python evaluate/eval.py(召回/判定)· uv run python evaluate/check_urls.py(可达率)· uv run python evaluate/check_evidence.py(准确率)|明细:eval_result.csv