OpenBitFun 可配置开发体验看护指标规格
September 4, 2026 · View on GitHub
上游文档:product-requirements.md、implementation-plan.md 用途:把实施计划中的看护指标转成可采样、可解释、可用于阶段评审的指标规格,避免指标停留在口号层。
1. 指标治理原则
- 每个指标必须有负责人、分母、采样窗口、数据来源和适用阶段。
- P0/P1 先收集基线,不用指标直接阻塞交付。
- 指标用于趋势、校准和阶段退出判断;具体决策仍引用证据包、事件和评测卡。
- 体验、安全、质量和成本联合解释策略效果。
- 与质量或安全相关的指标必须能追溯到证据包、LifecycleEvent、策略版本或评测卡。
- 指标口径变化必须记录版本,并保留兼容读取或重新计算策略。
- 核心体验指标必须按用户画像、任务风险、内部策略画像、用户可见视图、入口平台和受管状态切片,避免平均值掩盖局部人群摩擦。
2. P0/P1 核心体验与安全指标
| 指标 | 公式 | 负责人 | 数据来源 | 窗口 | 用途 |
|---|---|---|---|---|---|
| 首次有用动作耗时 | 项目打开或任务启动到首次可见有用结果的 P50/P95 耗时 | 产品体验 | task.started、首个用户可见 tool.completed 或 UI result、task.completed | 每周 | 判断快速路径是否真实低摩擦 |
| 低风险任务完成率 | 完成的低风险任务数 / 低风险任务总数 | 配置化策略 | policy.decided、task.completed | 每周 | 防止低风险场景被强流程拖慢 |
| 用户打断率 | 每个任务的确认、强提示和阻断次数,按安全/质量/团队分组 | 产品体验 | security.decided、policy.decided、用户界面事件 | 每周 | 降低提示噪音 |
| 弹窗触发率 | 模态确认或阻断次数 / 任务数,排除用户主动打开详情 | 产品体验 | 用户界面事件、security.decided | 每周 | 防止确认打断泛化 |
| 安全提示接受率 | 用户接受安全提示建议的次数 / 安全提示总数 | 安全边界 | security.decided、用户响应 | 每周 | 判断提示是否有价值 |
| 应急放行率和范围 | 应急放行次数按范围/风险聚合 / 安全提示总数 | 安全边界 | security.decided、user.override.recorded | 每周 | 发现安全策略过紧或真实绕行需求 |
| 信心摘要覆盖率 | 生成摘要的完成任务数 / 完成任务总数 | 交付物与证据层 | confidence.summary.generated | 每周 | 确保任务结果可解释 |
| 关键用例验收覆盖率 | 已有回放用例或截图预期的关键体验用例数 / PRD 定义关键体验用例总数 | 产品体验 | 用例验收记录、界面事件、回放用例 | 每两周 | 验证主要体验变化是否落到可检查交互和用户收益 |
| P0 事件载荷预算命中率 | 符合事件大小、采样、保留和脱敏预算的 P0 事件数 / P0 事件总数 | 质量数据面 | LifecycleEvent 注册表、事件采样、导出审计 | 每两周 | 控制 QDP、证据和评测数据膨胀 |
| 沙箱降级率 | 无法按目标沙箱等级组合执行的动作数 / 请求沙箱动作总数 | 安全边界 | security.decided、sandbox.capability.evaluated | 每周 | 防止把权限确认误展示成系统级隔离 |
| Harness 主动配置未解决率 | 未确认 Harness 主动配置关联任务数 / 含 Harness 主动配置任务总数 | 项目画像 | Harness 审核事件、安全事件 | 每周 | 判断 Harness 自有审核是否阻塞体验 |
| 远程不可支持状态恢复率 | 用户按替代路径继续完成的不可支持状态数 / 不可支持状态总数 | 远程适配 | 不可支持状态事件、任务完成事件 | 每周 | 验证远程能力缺口是否可恢复 |
| 阶段收益达成率 | 达到阶段用户收益验收的回放任务数 / 阶段验收任务总数 | 产品体验 | stage.outcome.evaluated、界面事件、task.completed | 每两周 | P1+ 防止阶段只完成后台技术而没有用户收益 |
| 质量一致性缺口率 | 同一任务中需求、开发、验证、审查或发布强度明显不匹配的抽样任务数 / 抽样任务总数 | 产品体验 + 配置化策略 | quality.consistency.sampled、policy.decided、verification.completed、PR 视图 | 每两周 | P1+ 发现阶段内质量要求强弱断层 |
| 阶段性能回退率 | 超过阶段性能预算的回放或真实任务数 / 阶段抽样任务总数 | 产品体验 + 运行时 | performance.budget.evaluated、工具耗时、用户界面事件、成本事件 | 每两周 | P1+ 防止新治理能力拖慢默认开发路径 |
| 重复提示抑制率 | 被合并或延后的同类提示数 / 同类提示候选总数 | 产品体验 | policy.decided、用户界面事件 | 每周 | 验证弱提示降噪是否生效 |
| 误升级率 | 人工或后验判定无必要的模式升级数 / 模式升级总数 | 配置化策略 | policy.decided、覆盖、反馈 | 每两周 | 校准配置化策略 |
| 跨入口语义一致率 | 保留任务状态、安全范围、验证摘要的跨入口任务数 / 跨入口任务总数 | 产品体验 | 投影事件、任务摘要 | 每两周 | 验证桌面、命令行、远程和 PR 入口表达一致 |
P0 最小采集口径:
- P0 只要求 P50/P95 基线、样本量和缺数原因,不用指标阻塞交付;P1 以后才用阶段预算判定回退。
- 每个 P0 指标至少需要 20 个回放或真实任务样本;样本不足时只能标记为
insufficient_sample,不能声明趋势改善。 - 首次有用动作必须记录开始时间、首个用户可见结果时间、任务类型和是否远程/受管;缺少 UI 时间戳时只进入命令行或回放样本。
- 阶段预算必须同时给出 P50、P95、事件载荷上限和采样窗口;没有预算时指标只能作为基线。
口径说明:
- 低风险任务由风险与策略分类器给出,并需排除已触发安全高风险动作的任务。
- 打断必须区分安全提示、质量建议、审查建议、强制策略和用户主动进入关键流程。
- 弹窗触发率需要排除用户主动打开的详情页、设置页和 PR 就绪度面板。
- 重复提示抑制率只统计同一任务、同一原因、同一作用范围内的提示候选。
- 应急放行用于发现策略和真实工作之间的张力,需要结合风险等级、范围和后验结果解释。
- Harness 主动配置未解决率上升时,需要区分恶意/未知配置、实现缺口和用户主动禁用。OpenCode/MCP 等外部
owner 的
policy-limited、denied或unavailable诊断单独统计,不进入该指标分母。 - 关键用例验收覆盖率只统计用户可见入口、默认状态、触发条件、主要交互和用户收益均明确的用例;纯文字概念不计入。
- 阶段收益达成率只统计用户能实际感知的收益,例如更快完成任务、更清楚理解风险、更容易准备 PR;只完成 API、迁移或空实现不计入分子。
- 质量一致性缺口率需要按场景解释:低风险任务可以轻量,但必须说明未验证项;受管路径可以严格,但需求、开发、验证和审查强度需要相互匹配。
- 阶段性能回退率以阶段基线为比较对象;P0 建立基线,P1 以后任一默认路径能力超过预算都要标记为回退候选。
- 事件载荷预算命中率需要同时看字段必要性、隐私分级、保留周期、采样策略和导出范围;不服务用户收益或风险解释的字段应删除或降采样。
3. P1/P2 上下文信心与团队治理指标
| 指标 | 公式 | 负责人 | 数据来源 | 窗口 | 用途 |
|---|---|---|---|---|---|
| 推荐检查执行率 | 被用户执行、本地验证覆盖或 CI 覆盖的推荐检查 / 推荐检查总数 | 风险分类器 | 就绪度、验证事件、recommended_check.outcome | 每两周 | P1+ 判断建议是否有行动价值 |
| 强制检查精度 | 人工或后验确认有价值的强制检查 / 强制检查总数 | 风险分类器 | 门禁结果、覆盖、审查反馈 | 每两周 | P2+ 校准路径矩阵,减少低价值检查 |
| 强制检查漏报率 | 后验发现应运行但未推荐的检查 / 后验确认需要的检查总数 | 风险分类器 | CI 失败、审查阻塞项、合入后缺陷 | 每两周 | P2+ 降低错误就绪风险 |
| PR 就绪度采用率 | 使用就绪度摘要的 PR 数 / OpenBitFun 准备的 PR 总数 | 变更就绪度 | readiness.generated、PR 视图 | 每周 | P2+ 衡量 PR/CI 适配接入后的 PR 体验价值 |
| 门禁降级率 | degraded 门禁数 / 门禁投影总数 | 变更就绪度 | gate.projected | 每周 | 发现模式、证据、工具或信任模型缺口 |
| 严格审查价值率 | 产生有效问题或避免缺陷的严格审查数 / 严格审查总数 | 审查系统 | 审查事件、反馈 | 每两周 | 防止高成本审查泛化 |
| 风险接受审计覆盖率 | 有操作者/原因/范围/残余风险的风险接受数 / 风险接受总数 | 变更就绪度 | 风险接受事件 | 每周 | 确保人工放行可追踪 |
4. P3/P4 复杂生命周期与评测指标
| 指标 | 公式 | 负责人 | 数据来源 | 窗口 | 用途 |
|---|---|---|---|---|---|
| 已确认链接占比 | 已确认图谱边 / 未过期图谱边 | 交付物图谱 | 图谱边状态 | 每两周 | 衡量图谱是否可信 |
| 链接过期率 | 过期图谱边 / 全部图谱边 | 交付物图谱 | 图谱边状态、文件/检查/审查变更 | 每两周 | 判断图谱刷新是否跟上变更 |
| 影响候选精度 | 被确认有效的影响候选 / 影响候选总数 | 需求影响分析 | 确认队列、审查反馈 | 每两周 | 降低低价值候选 |
| 影响召回代理指标 | 后验发现遗漏影响项 / 后验确认影响项总数 | 需求影响分析 | 审查阻塞项、事故、人工补充 | 每月 | 发现高风险漏报 |
| 评测卡覆盖率 | 有评测卡的决策任务集 / 用于决策的任务集总数 | 智能体评测 | 评测注册表 | 每月 | 防止无血缘评测进入决策 |
| 保留集污染率 | 标记污染的保留集任务 / 保留集任务总数 | 智能体评测 | 评测血缘、prompt/导出日志 | 每月 | 防止评测集失效 |
| 回放可复现率 | 可在固定环境复现的回放运行数 / 回放运行总数 | 智能体评测 | 轨迹回放结果 | 每月 | 判断评估基础设施稳定性 |
| 事故到回归延迟 | 事故确认到回归候选/测试/规则入库的中位耗时 | 生命周期上下文 | 事故、图谱、评测待办 | 每月 | 衡量右移反馈闭环 |
5. 阶段退出建议
这些阈值作为阶段评审参考。每个目标项目可以在项目画像或团队策略中覆盖阈值。
| 阶段 | 建议观察条件 |
|---|---|
| P-1 -> P0 | 配置化策略、安全边界、LifecycleEvent、证据展示层级和指标规格均有负责人与版本 |
| P0 -> P1 | 首次有用动作耗时、低风险任务完成率、用户打断率、弹窗触发率、安全提示响应、沙箱降级率、信心摘要覆盖率、关键用例验收覆盖率和 P0 事件载荷预算命中率有基线 |
| P1 -> P2 | 风险和远程状态收益可回放;误升级可归类;推荐检查执行率有本地或人工标注样本;PR 就绪度可以 shadow/advisory 方式演示,不要求真实 PR 采用 |
| P2 -> P3 | PR/团队规则收益可回放;强制检查精度有人工反馈;风险接受审计接近完整;Harness 主动配置未解决不再由实现缺口主导 |
| P3 -> P4 | 影响精度/召回代理指标可采样;发布/事故证据可回写图谱;评测卡覆盖率接近完整 |
6. 指标解释边界
- 单次基准测试分数只代表指定任务集表现,产品质量需要结合真实任务、缺陷、审查反馈和用户体验。
- PR 周期需要和错误就绪、错误阻断、审查反馈、缺陷和用户打断一起解释。
- token 成本需要和质量、风险等级、用户接受度一起优化。
- 模型生成的“风险摘要数量”属于提示量指标,真实问题密度以确认问题和后验结果为准。
- 未确认图谱边进入候选链接,不计入已确认链接占比。
- 应急放行按风险等级、范围、后验结果和组织策略共同判断。