OpenBitFun 可配置开发体验看护指标规格

September 4, 2026 · View on GitHub

上游文档:product-requirements.mdimplementation-plan.md 用途:把实施计划中的看护指标转成可采样、可解释、可用于阶段评审的指标规格,避免指标停留在口号层。

1. 指标治理原则

  • 每个指标必须有负责人、分母、采样窗口、数据来源和适用阶段。
  • P0/P1 先收集基线,不用指标直接阻塞交付。
  • 指标用于趋势、校准和阶段退出判断;具体决策仍引用证据包、事件和评测卡。
  • 体验、安全、质量和成本联合解释策略效果。
  • 与质量或安全相关的指标必须能追溯到证据包、LifecycleEvent、策略版本或评测卡。
  • 指标口径变化必须记录版本,并保留兼容读取或重新计算策略。
  • 核心体验指标必须按用户画像、任务风险、内部策略画像、用户可见视图、入口平台和受管状态切片,避免平均值掩盖局部人群摩擦。

2. P0/P1 核心体验与安全指标

指标公式负责人数据来源窗口用途
首次有用动作耗时项目打开或任务启动到首次可见有用结果的 P50/P95 耗时产品体验task.started、首个用户可见 tool.completed 或 UI result、task.completed每周判断快速路径是否真实低摩擦
低风险任务完成率完成的低风险任务数 / 低风险任务总数配置化策略policy.decidedtask.completed每周防止低风险场景被强流程拖慢
用户打断率每个任务的确认、强提示和阻断次数,按安全/质量/团队分组产品体验security.decidedpolicy.decided、用户界面事件每周降低提示噪音
弹窗触发率模态确认或阻断次数 / 任务数,排除用户主动打开详情产品体验用户界面事件、security.decided每周防止确认打断泛化
安全提示接受率用户接受安全提示建议的次数 / 安全提示总数安全边界security.decided、用户响应每周判断提示是否有价值
应急放行率和范围应急放行次数按范围/风险聚合 / 安全提示总数安全边界security.decideduser.override.recorded每周发现安全策略过紧或真实绕行需求
信心摘要覆盖率生成摘要的完成任务数 / 完成任务总数交付物与证据层confidence.summary.generated每周确保任务结果可解释
关键用例验收覆盖率已有回放用例或截图预期的关键体验用例数 / PRD 定义关键体验用例总数产品体验用例验收记录、界面事件、回放用例每两周验证主要体验变化是否落到可检查交互和用户收益
P0 事件载荷预算命中率符合事件大小、采样、保留和脱敏预算的 P0 事件数 / P0 事件总数质量数据面LifecycleEvent 注册表、事件采样、导出审计每两周控制 QDP、证据和评测数据膨胀
沙箱降级率无法按目标沙箱等级组合执行的动作数 / 请求沙箱动作总数安全边界security.decidedsandbox.capability.evaluated每周防止把权限确认误展示成系统级隔离
Harness 主动配置未解决率未确认 Harness 主动配置关联任务数 / 含 Harness 主动配置任务总数项目画像Harness 审核事件、安全事件每周判断 Harness 自有审核是否阻塞体验
远程不可支持状态恢复率用户按替代路径继续完成的不可支持状态数 / 不可支持状态总数远程适配不可支持状态事件、任务完成事件每周验证远程能力缺口是否可恢复
阶段收益达成率达到阶段用户收益验收的回放任务数 / 阶段验收任务总数产品体验stage.outcome.evaluated、界面事件、task.completed每两周P1+ 防止阶段只完成后台技术而没有用户收益
质量一致性缺口率同一任务中需求、开发、验证、审查或发布强度明显不匹配的抽样任务数 / 抽样任务总数产品体验 + 配置化策略quality.consistency.sampledpolicy.decidedverification.completed、PR 视图每两周P1+ 发现阶段内质量要求强弱断层
阶段性能回退率超过阶段性能预算的回放或真实任务数 / 阶段抽样任务总数产品体验 + 运行时performance.budget.evaluated、工具耗时、用户界面事件、成本事件每两周P1+ 防止新治理能力拖慢默认开发路径
重复提示抑制率被合并或延后的同类提示数 / 同类提示候选总数产品体验policy.decided、用户界面事件每周验证弱提示降噪是否生效
误升级率人工或后验判定无必要的模式升级数 / 模式升级总数配置化策略policy.decided、覆盖、反馈每两周校准配置化策略
跨入口语义一致率保留任务状态、安全范围、验证摘要的跨入口任务数 / 跨入口任务总数产品体验投影事件、任务摘要每两周验证桌面、命令行、远程和 PR 入口表达一致

P0 最小采集口径:

  • P0 只要求 P50/P95 基线、样本量和缺数原因,不用指标阻塞交付;P1 以后才用阶段预算判定回退。
  • 每个 P0 指标至少需要 20 个回放或真实任务样本;样本不足时只能标记为 insufficient_sample,不能声明趋势改善。
  • 首次有用动作必须记录开始时间、首个用户可见结果时间、任务类型和是否远程/受管;缺少 UI 时间戳时只进入命令行或回放样本。
  • 阶段预算必须同时给出 P50、P95、事件载荷上限和采样窗口;没有预算时指标只能作为基线。

口径说明:

  • 低风险任务由风险与策略分类器给出,并需排除已触发安全高风险动作的任务。
  • 打断必须区分安全提示、质量建议、审查建议、强制策略和用户主动进入关键流程。
  • 弹窗触发率需要排除用户主动打开的详情页、设置页和 PR 就绪度面板。
  • 重复提示抑制率只统计同一任务、同一原因、同一作用范围内的提示候选。
  • 应急放行用于发现策略和真实工作之间的张力,需要结合风险等级、范围和后验结果解释。
  • Harness 主动配置未解决率上升时,需要区分恶意/未知配置、实现缺口和用户主动禁用。OpenCode/MCP 等外部 owner 的 policy-limiteddeniedunavailable 诊断单独统计,不进入该指标分母。
  • 关键用例验收覆盖率只统计用户可见入口、默认状态、触发条件、主要交互和用户收益均明确的用例;纯文字概念不计入。
  • 阶段收益达成率只统计用户能实际感知的收益,例如更快完成任务、更清楚理解风险、更容易准备 PR;只完成 API、迁移或空实现不计入分子。
  • 质量一致性缺口率需要按场景解释:低风险任务可以轻量,但必须说明未验证项;受管路径可以严格,但需求、开发、验证和审查强度需要相互匹配。
  • 阶段性能回退率以阶段基线为比较对象;P0 建立基线,P1 以后任一默认路径能力超过预算都要标记为回退候选。
  • 事件载荷预算命中率需要同时看字段必要性、隐私分级、保留周期、采样策略和导出范围;不服务用户收益或风险解释的字段应删除或降采样。

3. P1/P2 上下文信心与团队治理指标

指标公式负责人数据来源窗口用途
推荐检查执行率被用户执行、本地验证覆盖或 CI 覆盖的推荐检查 / 推荐检查总数风险分类器就绪度、验证事件、recommended_check.outcome每两周P1+ 判断建议是否有行动价值
强制检查精度人工或后验确认有价值的强制检查 / 强制检查总数风险分类器门禁结果、覆盖、审查反馈每两周P2+ 校准路径矩阵,减少低价值检查
强制检查漏报率后验发现应运行但未推荐的检查 / 后验确认需要的检查总数风险分类器CI 失败、审查阻塞项、合入后缺陷每两周P2+ 降低错误就绪风险
PR 就绪度采用率使用就绪度摘要的 PR 数 / OpenBitFun 准备的 PR 总数变更就绪度readiness.generated、PR 视图每周P2+ 衡量 PR/CI 适配接入后的 PR 体验价值
门禁降级率degraded 门禁数 / 门禁投影总数变更就绪度gate.projected每周发现模式、证据、工具或信任模型缺口
严格审查价值率产生有效问题或避免缺陷的严格审查数 / 严格审查总数审查系统审查事件、反馈每两周防止高成本审查泛化
风险接受审计覆盖率有操作者/原因/范围/残余风险的风险接受数 / 风险接受总数变更就绪度风险接受事件每周确保人工放行可追踪

4. P3/P4 复杂生命周期与评测指标

指标公式负责人数据来源窗口用途
已确认链接占比已确认图谱边 / 未过期图谱边交付物图谱图谱边状态每两周衡量图谱是否可信
链接过期率过期图谱边 / 全部图谱边交付物图谱图谱边状态、文件/检查/审查变更每两周判断图谱刷新是否跟上变更
影响候选精度被确认有效的影响候选 / 影响候选总数需求影响分析确认队列、审查反馈每两周降低低价值候选
影响召回代理指标后验发现遗漏影响项 / 后验确认影响项总数需求影响分析审查阻塞项、事故、人工补充每月发现高风险漏报
评测卡覆盖率有评测卡的决策任务集 / 用于决策的任务集总数智能体评测评测注册表每月防止无血缘评测进入决策
保留集污染率标记污染的保留集任务 / 保留集任务总数智能体评测评测血缘、prompt/导出日志每月防止评测集失效
回放可复现率可在固定环境复现的回放运行数 / 回放运行总数智能体评测轨迹回放结果每月判断评估基础设施稳定性
事故到回归延迟事故确认到回归候选/测试/规则入库的中位耗时生命周期上下文事故、图谱、评测待办每月衡量右移反馈闭环

5. 阶段退出建议

这些阈值作为阶段评审参考。每个目标项目可以在项目画像或团队策略中覆盖阈值。

阶段建议观察条件
P-1 -> P0配置化策略、安全边界、LifecycleEvent、证据展示层级和指标规格均有负责人与版本
P0 -> P1首次有用动作耗时、低风险任务完成率、用户打断率、弹窗触发率、安全提示响应、沙箱降级率、信心摘要覆盖率、关键用例验收覆盖率和 P0 事件载荷预算命中率有基线
P1 -> P2风险和远程状态收益可回放;误升级可归类;推荐检查执行率有本地或人工标注样本;PR 就绪度可以 shadow/advisory 方式演示,不要求真实 PR 采用
P2 -> P3PR/团队规则收益可回放;强制检查精度有人工反馈;风险接受审计接近完整;Harness 主动配置未解决不再由实现缺口主导
P3 -> P4影响精度/召回代理指标可采样;发布/事故证据可回写图谱;评测卡覆盖率接近完整

6. 指标解释边界

  • 单次基准测试分数只代表指定任务集表现,产品质量需要结合真实任务、缺陷、审查反馈和用户体验。
  • PR 周期需要和错误就绪、错误阻断、审查反馈、缺陷和用户打断一起解释。
  • token 成本需要和质量、风险等级、用户接受度一起优化。
  • 模型生成的“风险摘要数量”属于提示量指标,真实问题密度以确认问题和后验结果为准。
  • 未确认图谱边进入候选链接,不计入已确认链接占比。
  • 应急放行按风险等级、范围、后验结果和组织策略共同判断。