PatentRadar 评估报告

June 3, 2026 · View on GitHub

PatentRadar 评估报告

以"已认定侵权的真实竞品"为黄金集,度量系统的召回 / 判定 / 证据质量

Hit@5 Hit@1 MRR URL可达率 URL准确率


  • 黄金集测试集.xlsx,已跑共计26 个专利 → 已认定侵权竞品。
  • 口径:以专利为单位,命中该专利任一真竞品即算命中;位次按 total_score 并列排名(同分并列)。

评估指标

维度指标数值含义
召回Hit@596.2% (25/26)真竞品进入系统 Top-5 的专利占比
Hit@380.8% (21/26)真竞品分数排名进前 3
Hit@165.4% (17/26)真竞品分数排名第 1
MRR0.749平均倒数排名,综合"命中且靠前"
判定证据充足率44.0% (11/25)命中专利中,得分 ≥ 80(竞品证据已充足)的占比
证据URL 可达率95.8% (454/474)报告引用的证据链接有效比例
URL 准确率93.8% (380/405)链接页面正文确实含对应竞品型号/品牌,非模型编造

结论

  • 召回强:Hit@5 96.2%,能稳定找出已知侵权方。
  • 证据充足率低的原因:召回到真竞品后只有 44% 的得分 >=80 —— 公司提供的测试集中大部分专利保护的是内部结构、控制器逻辑等技术要求,这类特征需要电路图、内部结构图才能证明,公开资料极少、大多存在于公司内部数据库;公开渠道无法凑齐逐特征证据,是当前真竞品证据不足的主要限制(并非系统判定能力本身的缺陷)。这也是拖累Hit@1的主要原因。
  • 证据真实可追溯:URL 95.8% 可达,且 93.8% 的链接页面正文确实含对应竞品标识,模型基本未编造证据链接。

附注:

1) 各指标分子 / 分母(召回类分母统一为 26 = 黄金集专利数(全部已跑);命中位次按 total_score 并列排名)

Hit@5 = 命中专利 / 已跑专利 = 25 / 26(命中 = 该专利任一真竞品进入 Top-5)
Hit@3 = 最佳命中位次 ≤ 3 的专利 / 26 = 21 / 26
Hit@1 = 最佳命中位次 = 1 的专利 / 26 = 17 / 26
MRR = Σ(每个专利的 1 / 最佳命中位次) / 26,未命中记 0 = 0.749
证据充足率 = 得分 ≥ 80 的专利 / 命中真竞品的专利 = 11 / 25(分母 25 而非 26:未命中专利系统未找到真竞品,无从评判,不计入)
URL 可达率 = HTTP 可访问 URL / 全部唯一证据 URL = 454 / 474
URL 准确率 = 页面正文含对应竞品标识的 URL / 可判定 URL = 380 / 405(排除 52 个 PDF / 动态渲染 / 抓取失败的 URL)

2) 复现方式 · uv run python evaluate/eval.py(召回/判定)· uv run python evaluate/check_urls.py(可达率)· uv run python evaluate/check_evidence.py(准确率)|明细:eval_result.csv