News archive
August 31, 2026 ยท View on GitHub
The five most recent items live in the README. Everything else is here; the full engineering change history is in CHANGELOG.md.
2026
- [2026.08.20] โ ๐ Our paper has been accepted to EMNLP 2026 Findings.
- [2026.08.16] โ Released RewardHarness, our self-evolving agentic reward framework: 47.4% on EditReward-Bench from just 100 preference demos, with no reward-model training. Details โ
- [2026.08.03] โ Added Browserbase as a remote browser runtime for ClawBench. Details โ
- [2026.07.30] โ v0.8.0 released: Gemini-as-judge, random-click baseline harness, EdgeBench/SForge adapter, remote-browser CDP support. Details โ
- [2026.07.25] โ ๐ Our paper has been accepted by COLM 2026 WAB.
- [2026.06.22] โ v0.7.0 released: Harbor-adapter task export; action recording moved into the CDP server. Details โ
- [2026.05.20] โ V2 is now the default corpus + lenient judge + 6 first-class harnesses. Details โ
- [2026.05.16] โ Added Claw-Eval suite: 19 browser-research tasks with final-answer submission. Details โ
- [2026.05.12] โ Canonical leaderboard moved to the TIGER-Lab/ClawBench Gradio Space. Details โ
- [2026.05.11] โ V2 leaderboard ships: top so far
glm-5.1 / hermesat 18.5% reward / 48.5% intercepted. Details โ - [2026.05.09] โ Inline LLM judge added as a second scoring stage; runs now auto-produce pass/fail. Details โ
- [2026.05.09] โ
clawbench-evalpublished to PyPI for one-command install. Details โ - [2026.05.09] โ Released ClawBenchV1Trace: full 5-layer execution trace for every V1 run. Details โ
- [2026.04.25] โ Added support for the hermes harness. Details โ
- [2026.04.18] โ Added support for the browser-use harness. Details โ
- [2026.04.11] โ Paper released on arXiv (2604.08523); #3 HuggingFace Paper of the Day. Details โ