News archive

August 31, 2026 ยท View on GitHub

The five most recent items live in the README. Everything else is here; the full engineering change history is in CHANGELOG.md.

2026

  • [2026.08.20] โ€” ๐Ÿ† Our paper has been accepted to EMNLP 2026 Findings.
  • [2026.08.16] โ€” Released RewardHarness, our self-evolving agentic reward framework: 47.4% on EditReward-Bench from just 100 preference demos, with no reward-model training. Details โ†’
  • [2026.08.03] โ€” Added Browserbase as a remote browser runtime for ClawBench. Details โ†’
  • [2026.07.30] โ€” v0.8.0 released: Gemini-as-judge, random-click baseline harness, EdgeBench/SForge adapter, remote-browser CDP support. Details โ†’
  • [2026.07.25] โ€” ๐Ÿ† Our paper has been accepted by COLM 2026 WAB.
  • [2026.06.22] โ€” v0.7.0 released: Harbor-adapter task export; action recording moved into the CDP server. Details โ†’
  • [2026.05.20] โ€” V2 is now the default corpus + lenient judge + 6 first-class harnesses. Details โ†’
  • [2026.05.16] โ€” Added Claw-Eval suite: 19 browser-research tasks with final-answer submission. Details โ†’
  • [2026.05.12] โ€” Canonical leaderboard moved to the TIGER-Lab/ClawBench Gradio Space. Details โ†’
  • [2026.05.11] โ€” V2 leaderboard ships: top so far glm-5.1 / hermes at 18.5% reward / 48.5% intercepted. Details โ†’
  • [2026.05.09] โ€” Inline LLM judge added as a second scoring stage; runs now auto-produce pass/fail. Details โ†’
  • [2026.05.09] โ€” clawbench-eval published to PyPI for one-command install. Details โ†’
  • [2026.05.09] โ€” Released ClawBenchV1Trace: full 5-layer execution trace for every V1 run. Details โ†’
  • [2026.04.25] โ€” Added support for the hermes harness. Details โ†’
  • [2026.04.18] โ€” Added support for the browser-use harness. Details โ†’
  • [2026.04.11] โ€” Paper released on arXiv (2604.08523); #3 HuggingFace Paper of the Day. Details โ†’