Project2 模型测评
August 5, 2026 · View on GitHub
状态: 正式冻结(事实冻结 / de facto frozen)
冻结日期: 2026-07-23
冻结基线: V4.1b(project2-v4.1b)
评分面冻结(在先): 2026-07-19,见 evaluator/reports/v4.1b_freeze_manifest.md
本项目到此为止。V4.1b 已经完成了它唯一的目的——在真实渠道、成本与可用额度约束下,为个人开发/选型提供一份参考台账(非面向社区的公开 benchmark)。结论已经稳定,不再迭代、不启动 V5、不为区分 95–99 增加题目或改评分。
这个冻结是主动设立的硬性边界,用来防止项目继续膨胀成无止境的自我优化。它不是"没做完",而是"到站了"。
1. 「冻结」具体指什么
不再改动(硬性边界):
- 不改评分逻辑与规则面:
evaluator/scoring/score_model.py、rubric.md、reviewer_prompt.md、item_registry.json,以及evaluator/tests/hidden/下的隐藏测试。这些已于 07-19 以 SHA-256 冻结。 - 不新增 / 删改评分族(F1–F12)、cascade 规则、Ship/Class 阈值或 trust cap。
- 不开发 V4.1c,不开发 V5;「新鲜度 / 显式 session / QEMU / HIL」等题源保持远期备忘,不进现行评测。
- 不用 V4.1b 规则重算 V4.0 / V4.1a 的历史正式成绩。
仍然允许(唯一的例外):
- 当真的有选型需要时,对某个新模型跑一遍现成流程,并在
v4.1b_scoreboard.md追加一行观测、在evaluator/reviews/放一份对应评审。 - 仅此而已。
越界判断(一句话): 一旦你开始编辑
score_model.py/item_registry.json/rubric.md,或新开一个设计文档——就是越回去了,停。测新模型的节制线: 只有"真的要为某个选择去测"时才测,而不是"出了个新模型、手痒了"就测。别让"有模型就测"变成又一个需要不停填的数字面板。
2. 现行权威结果(看这些就够)
| 文件 | 用途 |
|---|---|
evaluator/reports/v4.1b_scoreboard.md | 现行成绩榜:全部已测模型(20+ 渠道组合)、多跑区间与样本索引 |
docs/v4.1/FINAL_ASSESSMENT_20260719.md | 使用阈值、局限与 V5 决策 |
docs/v4.1/ROUND_SUMMARY_20260719.md | 轮次事实终稿 |
evaluator/reports/v4.1_efficiency_board.md | 成本/时间副榜(不进 Ability) |
evaluator/reports/v4.1b_freeze_manifest.md | 评分面与锚点 summary 的冻结哈希 |
evaluator/reports/README.md | 全部报告清单(现行 / 历史分层) |
核心结论(摘自 FINAL_ASSESSMENT):
- Ability ≥ 95 且无严重 Ship blocker = 当前日常项目的可靠完成档。
- Ability ≥ 90 = 可用执行档,需结合 Ship 与失败 family 决定是否需要强模型终审。
- 90 / 95 是本项目、本题面、本工具环境下的经验阈值,不是跨项目通用认证。
- 本轮最可靠的结论是"尺子进步了",不是"所有模型都升级了";harness/渠道差异是选型现实的一部分,已全部标注。
最后一次追加观测: Claude-Sonnet-4.6 @ Antigravity(20260723_171033),本日并入后冻结。
3. 与既有冻结 / 归档纪律的关系
- 07-19 的评分面冻结(
v4.1b_freeze_manifest.md)继续有效;本文件是其上的项目级收尾声明。 - 历史归档与结果按
archives/禁止删除_评测结果和归档.md保护:archives/各 round、evaluator/results/、evaluator/reviews/、v4_gold不得删除或搬动。 - 本次冻结只新增 / 整理说明文档(本文件 + 报告索引 + 根 README 横幅),未触碰任何 result / review / 归档 / 评分文件。
4. 将来若要测一个新模型(最小流程)
python evaluator\make_broken_project.py
# 模型只改 workspace\project2_task
python evaluator\run_full_eval.py workspace\project2_task `
--model NAME --channel CH --harness H `
--require-meta --include-espidf-build `
--run-group-id GROUP --run-index 1 --thinking-level high
# 下一模型前再 make_broken_project
跑完:按 worst-of-n 规则在 v4.1b_scoreboard.md 加一行,写一份对应 evaluator/reviews/ 评审。其余一概不改。
V4.1b 完成了它该完成的事。项目安静地停在这里。