终局设想:替你记着,替你挡着

August 9, 2026 · View on GitHub

文档状态:愿景。用于判断长期方向,不表示当前已实现,也不构成路线图或版本承诺;当前能力见功能规格

写于 2026-07-25。这是方向的锚,不是路线图;blueprint.mdbutler-usability-framework.md同样只保留历史规划与评价框架。

本文回答一个问题:当每个切片都做对了,最终会长成什么? 以后每个功能都可以对着它问一句: 「这一步是在往那个终局走,还是只是在原地加功能?」

一、一句话

别的工具帮你处理信息,管家替你记着该记的、替你挡着不值得的。

用户可见的实体只有一个,就叫管家(决策 10 已定,不再新增任何别名或第二身份)。 本文标题不是另起一个称呼,而是它的职责描述:记着的是承诺,挡着的是打扰—— 正好是 GTD 与注意力保护两根支柱各自的白话版。

所有 IM 的本质是承诺交换——「我周五给你」「等你确认」「这个我来」。飞书和 Slack 把消息当消息存, 承诺蒸发在滚动的聊天流里。这个产品把消息当承诺的载体:一条消息进来,系统问的不是 「要不要通知你」,而是「这改变了谁欠谁什么吗」。

台账因此是产品的脊椎,聊天只是最大的那个入口。IM、Azure DevOps、构建、代码都只是输入源。

二、为什么是「管家」,不是「贾维斯」

贾维斯是个好参照,但直接照抄会做出一个灾难产品。

该借的三条:它是一个实体而不是一堆工具的菜单;它常驻并知道上下文,你不必先描述背景; 它真的动手,不只给建议。这三条正是「唯一管家入口」「指着说」「草稿即结论的终点」在做的事。

必须拒的三条

  1. 贾维斯话太多。 电影里他随时插话,那是叙事需要;现实里那是打断机器。 本产品的灵魂是「决定不报什么」(ai-design.md 对账员)。
  2. 贾维斯有无限权限。 我们的铁律是大脑有知识工具、没有手:只读沙箱、不授仓库路径, 副作用必须过确认卡。信任模型正好相反。
  3. 电影从不演贾维斯出错。 不演它误报一次之后托尼再也不信它。而误报的代价 (警报疲劳不可逆)恰恰是我们全部设计的出发点。

更准的比喻是一个老练的参谋长:进你办公室之前先想清楚「这事值不值得占你三分钟」, 替你把该做的做到草稿,然后闭嘴。Horvitz 1999 年那篇混合主动界面的奠基论文里, 描述理想系统用的词就是 "an intuitive, courteous butler"。

二·五、四条不可让步的原则(2026-07-25 用户定)

它们不是愿望清单,是每个切片的验收标尺

  1. 易用性优先。 不能把能力卡在权限和层层确认里。安全要靠结构成立 (例如"路径必须来自系统文件选择器"这类不变量),而不是靠多点几次确认。 同一件事确认两遍不会更安全,只会更烦。
  2. 自我学习与成长。 管家要越用越懂你——而且学习过程本身要能被看见, 不是黑箱里悄悄变聪明。
  3. 透明、可控。 它知道什么、为什么这么判断,用户随时能看、能改、能撤。
  4. 记忆与 SOUL(人设)都是用户可以看到、可以修改的。 这是第 3 条最硬的落点: 不给这个页面的 AI 产品,本质上是在要求用户无条件信任。

当前差距(2026-07-25 核实):人设与性格轴已可看可改(AiSettings.tsx); 记忆与技能在界面层零引用——管家学到的东西,用户看不见也改不了。 这是原则 3、4 的直接违反,也是「管家学到了什么」面板要补的洞。

三、那一天长什么样

8:50 打开应用。不是未读红点,是一屏「今天这三件」。第一条:

张三答应的压测报告今天到期,他昨晚 23:40 在群里说「可能要延」——但没直接跟你说。 要不要我替你问一句?〔草稿已备好〕

价值在于它把没发生的事变成了信息。飞书不会告诉你「某人没回复你」,因为它不知道你在等什么。

10:20 构建红了。管家没有弹通知,桌面上多了一行:

payments 流水线挂了,是 #4821 那个改动引入的空指针。我在 fix/npe-payments 上写好了修复, 跑过了本地测试。要看看吗?〔查看差异〕〔丢弃〕

这是 Slack 与飞书结构上做不到的——它们没有你的代码。本地 Codex + 执行间让「知道」变成「做好了」。 诊断与起草归它,审阅与拍板归你。

14:00 你在写方案,群里 47 条消息。管家一次没打断你。

17:30 合上电脑前:

今天你被打断 2 次,我压下了 31 条。你新欠 1 件(答应李四明天给接口文档),销掉 2 件。 有件事我拿不准:王五说「这个我看看」算不算承诺?〔算〕〔不算,以后这类也别问〕

最后那一问是灵魂——它在公开地学,并且把学习的成本压到一次点击。

四、三个结构性赌注

赌注一:注意力可以被预算

界面上有一个显式的注意力账本:今天被打断几次、压下多少、误报几条(你点过「没用」)。 把打扰做成有成本的行为,让管家自己心疼。

没有哪个 SaaS 敢这么做——它们的 KPI 是 DAU;这个产品的 KPI 应该是 「我今天没被打扰,但什么也没漏」。这是自用产品才有的自由。

赌注二:本地 agent 让「知道」变成「做好了」

云端 AI 只能告诉你怎么做。这个客户端里跑着能读仓库、能跑测试、能起草 PR 的 agent。

终局是所有结论的终点都是一个草稿:回复的草稿、待办的草稿、修复分支的草稿、周报的草稿。 你的工作从「生产」变成「审阅」。已交付的结论级一键动作是这条路的第一米。

赌注三:可信度靠可审计,不靠嘴

每条结论追得到原文,每个动作留得下审计,每条记忆看得见、撤得掉,数据不出你的机器。

终局包含一个「管家学到了什么」页面:它对你的全部认知——别名、偏好、承诺、判断规则—— 列成清单,可编辑可删除。这是 AI 产品普遍不敢给的那个页面。

五、明确不做

  • 不做又一个带 AI 侧边栏的聊天软件。 侧边栏是最没想象力的答案。
  • 不做全能 agent。 它不写你的方案、不替你做决定、不参加你的会。只守承诺与注意力。
  • 不做通知瀑布。 宁可漏报不可错报——错报一次,后面一百条真警报都白搭。
  • 不做多人协作平台。 一旦要伺候团队,记忆、主动性、本地权限全部得阉割(Slack AI 的天花板正在这里)。 单用户是护城河,不是局限。

六、从今天到那里,最短的三步

  1. 让台账成为脊椎(近)。今天承诺是从消息里「提取」出来的一次性结论;下一步是让每条承诺有生命周期: 记账 → 到期 → 兑现/爽约 → 沉淀成对这个人的认知(「张三的『下周』通常意味着两周」)。 这才是「越用越懂你」的实处。
  2. 让草稿成为结论的默认终点(中)。从「记为待办/等待跟进」推进到「帮我催一句」「帮我修一下」—— 全部草稿态、全部过确认卡。执行间已经在那儿了。
  3. 让注意力账本可见(中)。把 L4 的反馈数据摊开:它既是产品价值的证明,也是你调教它的方向盘。

七、判断标准

这个产品的天花板不在模型能力,而在信任积累的速度

管家每一次误报都在花你的信任,每一次「它替我省了一次翻记录」都在挣。已交付的六个交互环节 (指着说 / 玻璃盒 / 带链接的结论 / 一键动手 / 可撤销的调教 / 上回说到)全都是在提高挣信任的速率

因此每个新切片的自检问题是:

  • 它是让管家多说了一句,还是让它更值得被信一次
  • 它把用户的工作往「审阅」推了,还是又添了一件要「生产」的事?
  • 出错时,用户能不能一眼看出错在哪、并把它撤掉?
  • 它新增的安全性,是靠结构成立的,还是靠让用户多点两次确认?(§2.5 原则 1)
  • 它让管家学到的新东西,用户看得见吗、改得动吗?(§2.5 原则 3、4)