contextweaver
July 12, 2026 · View on GitHub
Auto-generated by
make trend. Do not edit by hand. Source:benchmarks/results/history/*.json(one snapshot per release).
Release-over-release view of the deterministic benchmark metrics. Latency
is excluded — it is environment-dependent and not comparable across release
machines. This page is visibility only; PR-time regression gating lives in
benchmarks/gating.yaml + scripts/benchmark_gate.py (#491).
Releases recorded: 2 (0.16.0 … 0.17.0).
Routing recall@k by catalog size
| release | size=50 | size=83 | size=1000 |
|---|---|---|---|
0.16.0 | 0.5649 | 0.3825 | 0.1475 |
0.17.0 | 0.5649 | 0.3825 | 0.1475 |
Routing MRR by catalog size
| release | size=50 | size=83 | size=1000 |
|---|---|---|---|
0.16.0 | 0.4978 | 0.3242 | 0.1456 |
0.17.0 | 0.4978 | 0.3242 | 0.1456 |
Routing precision@k by catalog size
| release | size=50 | size=83 | size=1000 |
|---|---|---|---|
0.16.0 | 0.1191 | 0.0800 | 0.0310 |
0.17.0 | 0.1191 | 0.0800 | 0.0310 |
Context pipeline quality
| release | mean token reduction | items dropped | dedup removed |
|---|---|---|---|
0.16.0 | 64.31% | 7 | 4 |
0.17.0 | 65.01% | 11 | 4 |
Capturing a release snapshot
make benchmark # refresh benchmarks/results/latest.json
python scripts/render_trend.py --snapshot <version> \
--from benchmarks/results/latest.json
make trend # re-render benchmarks/trend.md