《发明 RLHF 的人,这次做了个不会说话的模型》执行简报(冻结)
September 17, 2026 · View on GitHub
本文件是全部子任务的唯一合同。每个子智能体开工先读它,再读自己任务里指定的文件。不得凭记忆改动这里的决定;发现矛盾就在报告里指出,不擅自改。
一、已冻结的决定
| 项 | 决定 |
|---|---|
| 交付物 | 付费 PDF 报告(A4 竖版,模式 A),附可拆条截图的数据卡片页 |
| 读者 | 泛自媒体读者:关心 AI 但没有工程背景,要用这份报告做真实决定(要不要试、值不值得关注、能不能接进自己的工作流) |
| 原型 | huashu-report 科普型三幕骨架(huashu-report/references/科普.md) |
| 主标题 | 发明 RLHF 的人,这次做了个不会说话的模型 |
| 副标题 | 两千多万人围观的 Jev,我用中文测了 50 条 |
| 封面配文 | 便宜 200 倍,代价是什么 |
| 一句话 | Jev 是第一个把"判断"从大模型里剥出来单卖的商品:在能拆成选择、是否、打分的任务上,它用两个数量级的成本和速度优势换来与中档前沿模型持平的准确率,代价是不生成、不解释、不算数。 |
| 尾声落点 | 拿它反复做"要不要、选哪个、打几分、下一步干什么";真正需要生成代码、写文章和复杂推理时,再交给传统大模型。 |
| 视觉方向 | 7 杂志专题(huashu-report/references/视觉方向库.md) |
| 版式动作 | 幕间分隔页、大数字行、pull quote;末尾一页数据速查页 |
| 篇幅 | 实际成书 52 页 A4,图 10 张(原定 34 到 40 页;十四章加三附录的体量装配后定稿为 52 页,2026-09-17 终审记录) |
| 语言 | 简体中文;产品名、模型名、仓库名保留英文 |
| 中文表达门禁 | 作者私有的中文表达门禁文档 voice.md(未随仓库发布,规则的可执行版见 WRITING.md 第三节)("Voice 一致性门禁"一节及全文规则)。写作端自查,终稿另有门禁审查,只改命中句 |
| 时效 | 资料快照 2026-09-17;TypeSafe 2026-09-15 发布;报告必须在数日内收口 |
二、原料位置(只读)
Scratchpad 根:<资料快照目录,未随仓库发布>/
| 路径 | 内容 |
|---|---|
llms.txt | docs.typesafe.ai 全站索引 |
ts/*.md | 概念页快照:introduction、quickstart、state、primitives、choice/score/noul、confidence、ML primer、patterns 四页、agent-skill、legal、migrating-to-v1 |
ts/cb/*.md | 15 个 cookbook 全文;另有 SKILL.md(官方 agent skill) |
launch.html、home.html | 官方启动博文与主页原始 HTML(含 Doom/Wikiracing 演示说明、FAQ 标题、evals 链接) |
evals.html、evals/*.html、evals/viewer.js | evals.typesafe.ai 总览与四个工作流页 |
hn.json | HN 主帖 49717558 全部评论(1831 分,482 评论;CEO 账号 CompleteSkeptic) |
cases/*.md | 14 个开发者案例仓库的 README |
huashu-report/ | 报告规范(勿改) |
| 已知外部文章(只在本简报里摘要,正文引用须回源核) | Every(every.to,Mike Taylor 777 判断 / Dan Shipper 6/7 vs 7/7,0.35s vs 8.83s,成本约 1/580);Near Here(96% 48/50 vs Mistral Small 4 84% vs Gemini 3.5 Flash-Lite 86%,0.59s,~5×/8.6×,被 Cloudflare 挡,只能转引);Good Start Labs(91.5% 一致率,1.6× 成本优势,转引);DSPy fork(15.9% 快、30.1% 省,转引);agentpedia.codes 中文对照;新浪《2400万人围观》;The Register;SiliconANGLE($40M 种子、DCVC 领投、估值 $2 亿 Forbes、2024 年创立) |
| Claude 官方价(claude-api skill 缓存 2026-06-24) | Fable 5.1 $10/$50;Opus 5 $5/$25;Sonnet 5 $2/$10;Haiku 4.5 $1/$5 每百万 token 输入/输出 |
| 其他外部基准 | Cohere Rerank 3.5 $2/千次搜索;BGE reranker 自托管约 $0.18 到 0.35/千次;GPT-5.6 Terra $2/$12(The Register 转引) |
| API key | scratchpad/.typesafe_env(TYPESAFE_API_KEY=…,600 权限)。只能 source 后用环境变量,任何输出、日志、文件里不得出现 key 明文 |
三、三幕骨架 v3(章号固定,写作按此分配)
封面(书名 + 副题 + 封面配文)
序章 2026-09-16,Every 的评测负责人把 37 篇文章丢给一个模型,21 个问题,0.7 秒 777 个判断,不到半美分。悬念:代价是什么。预告三幕。
目录
第 1 幕 建立:所有人为什么都觉得它对
1 起源 发明 RLHF 的人问了四年"聊天超人了,自动化在哪";stealth 两年;\$40M;"造 prod 不造 God"
2 关键区分 先让读者猜"不生成文字的 AI 还能干什么";咖啡师打勾的承重比喻;三原语;状态;置信度。侧栏:价格与延迟口径
钩子:这么便宜这么快,HN 上 482 条评论为什么一半在吵
第 2 幕 推翻:有人去查了
3 谁去查的、怎么查的 厂商评测方法(GPT-6 Astra + Fable 5.1 共识当标准答案意味着什么)、四份独立测试、社区拆解、本报告 50 条中文实测的设计
4 第一个坏消息 444.6 倍是厂商峰值,独立实测 5 到 25 倍;"零幻觉"只是零类型错误,Every 漏了 1/7;准确率"持平中档"不是"超越"。每个数字配身体尺度翻译
5 更难的那个 它到底是什么:假说一新架构新训练法 / 假说二精调 encoder 换壳(HN 有人直指 DeBERTa 零样本);CEO 拒绝公开架构;校准是群体性质;中文实测结果与"98% 压在 technical"的过度自信案例
钩子:清算完还站着的,比你想的多
第 3 幕 剩下什么
6 真正有证据的五件事 重排、技能路由、LLM 门卫、引文核对、特征抽取,每件配数字与口径侧栏
7 十四个人已经拿它干了什么 六组:判断下一步 / 路由分流 / 过滤与门卫 / 寻路 / 接入层 / 金融影子。每个案例一句话、一个核过的数字、一个必须写的限定
8 你自己的处境 分人群:泛自媒体读者与内容创作者(排第一)、独立开发者、有 RAG 的团队、做 agent 的、企业采购
9 正在发生的事 hermes-agent 提案、DSPy 分支、开源复现(Qwen 并行约束解码 5.6 倍)、速率限制"动态调整"、\$40M 之后
10 工具箱 五个不需要专业知识的问题;"看到这个 / 它意味着什么"红旗清单;一周接入清单;50 条中文测试脚本说明
尾声 回到序章的 777 个判断,收到"要不要、选哪个、打几分、下一步干什么"那句话
附录一 词汇表
附录二 文献(一条来源一行,不超过正文 10%)
附录三 把这一页发给你的智能体(读者三段 + 一个给智能体的六步指令框:装技能、自己申请 key 并放环境变量、冒烟、找三个判断点、边界、报告;同时作为免费样章分发)
数据速查页(全书关键数字一页)
四、数据表契约(data/数据表.json)
{"id": "E12", "value": "18%",
"basis": "CLERC 法律判例集 40 条查询,BM25 召回 30 条后用 Jev 重排,正确段落排第一的查询占比(重排前 5%)",
"n": "40 条查询,3,565 段判例",
"src": "docs.typesafe.ai/cookbooks/rerank_typesafe(jev-1.12)",
"date": "2026-09-17 快照", "tier": "厂商", "verified": true}
tier取值:厂商文档/厂商评测/独立测试/社区/本报告实测/公开新闻verified=true的唯一条件:填表者在本机原料文件里亲眼读到该数字。转引(如 Near Here)一律false,并在src写明"转引自 X"- 口径写不出完整一句话的数字不入表;不入表的数字不进正文
- 正文引用写作
[[E12]],生成器转成上标并校验 id 存在
五、写作端 markdown 方言(生成器只认这些,其他块抛异常)
## 1 章标题 (章号 + 空格 + 标题,一章一个)
钩子:一句话 (紧跟章标题的下一行,渲染到章首页标题下方;序章/尾声/附录可省)
### 小节标题
普通段落(空行分隔)
- 列表项
> 引文段(渲染为 pull quote,全书总量不超过 8 处)
:::侧栏 标题
侧栏正文(口径、样本量、"这个数字从哪来")
:::
{{fig:F3}} (图占位,图的标题/数据/来源在 data/figures.json)
{{bignum:E12|一句口径}} (大数字行元素,最多 3 到 4 个并排,写在同一段)
[[E12]] (数据引用,紧跟数字之后)
**加粗** (一章不超过 4 处)
| 表格 | 用 GFM 表格 |
```代码块``` (三反引号围栏,原样等宽渲染,不做行内处理;只在附录三使用)
不支持:# 一级标题、####、HTML 标签、脚注语法、图片语法。章首第一段避免以"一、二、三、十"或数字开头(首字下沉)。
六、视觉方向 7 的参数(写进 base.css 变量,全程只从变量取值)
- 纸色纯白(模式 A 不能用暖纸);正文近黑
#231f20;次级灰#6b6b6b - 单一强调色:信号红
#d62828,只用于章号、大数字、图表焦点、pull quote 左侧色条;正文字符占比目标 < 5% - 字体双轨:标题
--font-head= 衬线('Songti SC','Source Han Serif SC',Georgia,serif);正文与所有数据--font-body= 无衬线('Helvetica Neue','PingFang SC',sans-serif);表格与图表标签tabular-nums - 章首:章号 40pt 以上衬线红色,标题 26pt,下方一句钩子;每章第一段首字下沉(由生成器
can_drop()判定) - 幕间页:整页居中,只有"第 N 幕"、幕名、一句话
- 正文 10.5pt / 1.80;侧栏 9pt 浅灰底 + 左侧红色 2px 色条;图注 7.8pt
- 图表:灰阶承载背景数据,红色只标焦点;分类色不超过 6;直接标注不用图例;Y 轴从零
- 书眉:浅灰小字,不加通栏横线,下方留 11 到 12mm
- 数据卡片页:为拆条截图设计,一页一图一句结论一行来源
七、批次
- 数据层(并行):A 数据表 + 文献表;B 50 条中文实测;C 厂商评测原始数据核对
- 写作层:按幕分给三个写作者,共享本简报 + 数据表 + 写作风格摘录;每章交
draft/NN-标题.md - 装配层:
build.py(方言解析、组件、图表)→render.py渲染与自检 - 门禁与审查:voice 门禁逐章审查只改命中句;主智能体逐页看图后终审
每批完成的验收点:批 1 数据表无 verified 缺失字段、实测有原始 JSON;批 2 每章过方言校验且引用 id 全部存在;批 3 机械自检零报警;批 4 门禁报告 + 逐页 PNG 已看。