验证记录
September 19, 2026 · View on GitHub
日期:2026-09-19。版本 0.1.0。模型 jev-1.13.0。
离线功能测试
python3 -I -B tests/test_suggest.py:25 项通过。覆盖:
- 普通、引号、折叠描述和重复字段;同名技能拥有不同 ID。
- 符号链接、FIFO、疑似凭证、explicit-only、自身递归排除。
- 用户显式选择不发请求、不绕过排除列表;local 不伪装成 Jev。
- 两阶段选择、无需技能、绝对适配不足、低置信度、第二次调用失败。
- 推理期间正文或调用策略变化导致结果失效。
- 缓存重放零调用;任务变化、正文片段以外的变化使缓存失效;非法缓存不复用。
- 输出不覆盖已有文件且权限 0600;未知 allow 项报错;目录 path 字段不进入模型请求。
- 分组后每项技能均被覆盖且请求满足大小限制。
这些是功能和边界测试,不证明语义准确率或完整安全性。
真实 Jev 测试
使用本机的两个明确目录:用户 Codex 技能目录与本项目工作区 .agents/skills。扫描到 24 个技能文件,其中 1 个仅允许显式调用,实际语义候选为 23 个。目录没有读取警告。没有自动扫描插件缓存;因此不是当前会话所有插件技能的全量评估。
16 个任务由开发宿主编写并在推理前标注,涵盖中文、英文、有匹配技能与无匹配技能。它们未由外部标注员独立审核,也未证明在真实流量上的准确率。阈值和问题未因这轮结果而修改;没有重跑选择更好的答案。
| 任务 | 期望/结果 |
|---|---|
| 公众号只排版、不发布 | wechat-editorial-studio,符合 |
| 发布技术文章到掘金 | article-platform-publisher,符合 |
| Jev 检查本地 MCP 外传风险 | jev-security-scan,符合 |
| Jev 改写并检查原意 | jev-humanize-writing,符合 |
| 创建可复用 Codex skill | skill-creator,符合 |
| 阅读登录后的 Reddit Home | reddit-home-feed-research,符合 |
| 在 iTerm 中启动交互 Claude Code | interactive-claude-iterm,符合 |
| Claude Code 项目接入准备 | claude-code-project-onboarding,符合 |
| 编写 Codex /goal 命令 | goal-prompt-builder,符合 |
| 英文 MOBI 翻译中文 | translate-mobi-zh-minimax,符合 |
| 只读查阅 TypeSafe 文档 | typesafe-ai,符合;未因只读被过滤 |
| 只读查阅 Codex 模型与价格 | openai-docs,符合 |
| 简单乘法 | none,符合 |
| 翻译一句话 | none,符合 |
| 两句话解释递归 | none,符合 |
| Trello 专用操作流程 | 预期 none,实际 uncertain;未推荐任何技能 |
最后一例保留了模型的真实混淆:它在 dynamic-workflow-prompt-builder、skill-creator 和 none 间分配概率。最高候选概率 0.48,Choice confidence 0.29,最高适配 Noul 0.41;没有达到推荐门槛。不能把这例写成正确识别了“无需技能”,也不能把“零错误推荐”写成“100% 准确率”。
- 预期完整结果:15/16。
- 正样例推荐预设技能:12/12。
- 负样例明确 none:3/4;另 1 例 uncertain。
- 错误地给出最终推荐:0/16。
- 真实 HTTP 请求:45;失败:0;重试:0。
- 输入 230,067 tokens;输出 12,639 tokens。
- 按评估时采用的输入价格 $0.042/百万 tokens 估算:$0.009662814,不是账单核对结果。价格
- 每任务总耗时中位数:5,052.875 ms,包含本机目录读取、串行请求和网络。24 个入口被分为两组;有匹配的任务通常需要两次初筛和一次复核,普通无需技能的任务两次初筛后结束。
- 首个任务真实缓存重放:3 次缓存命中,0 次新增 HTTP 调用,当前运行计费输入 tokens 为 0。
公开证据见 16 个案例的脱敏摘要:保留任务、期望、结果、分数、时延、tokens 和每次调用的计数信息;最终 Choice 的不透明 ID 转为候选名称。省略本机路径、完整技能目录、描述、正文片段、请求及输入哈希。该文件不是原始 API 响应或完整 CLI 输出。
完整请求与客户端校验后的响应保留在开发者本地,不进入公开仓库。启动前 manifest 中的运行代码与任务样例 SHA-256 已保留到公开摘要,并与发布文件逐一比对。其他人可以运行相同程序,但没有原始私有目录时无法精确复现这次输入,也不能把这些记录视作独立审计。
独立离线前向测试
按 skill-creator 的前向测试步骤,由独立子 Agent 阅读本 Skill,执行现实任务。仅允许离线 CLI,不允许 API、凭证、安装或代码修改。
8 个建议流程检查通过,验证了公众号任务的关键词候选和人工入口核对、真实同名技能歧义、精确 ID 选择、被排除及不存在技能的 unavailable。全部为 0 API 调用;未验证 Jev 语义质量。
发现并修复了一项说明问题:早期文档中的“添加 --root/--skill-file”容易被理解为追加,而 CLI 实际替代默认源。现在文档明确解释替代语义,并给出完整列举默认目录与项目目录的命令。独立 Agent 重新阅读后确认歧义已消除。完整检查记录含本机路径,留在开发者本地;公开仓库提供此项流程及结果摘要。
采用边界
适合在新任务开始、目标变化、相邻技能难分时调用;不宜每轮消息都运行。没有对照“宿主直接选技能”的任务成功率、总 token 和总耗时,不能宣称它已降低整体成本或提高完成率。
本轮任务多有清楚的用途描述,难度有限。尚未系统测试所有插件技能、大型目录、真实多步骤任务、恶意技能描述和语言混合。提示注入依然可能影响判断;推荐与安全审核、可用性及执行权限分开处理。
该 Skill 没有安装全局 hook、修改 Codex 设置或自动执行候选。宿主仍保留原有技能列表,并在读取完整入口后作最终决定。