验证记录

September 19, 2026 · View on GitHub

English · 返回 README

日期:2026-09-19。版本 0.1.0。模型 jev-1.13.0

离线功能测试

python3 -I -B tests/test_suggest.py:25 项通过。覆盖:

  • 普通、引号、折叠描述和重复字段;同名技能拥有不同 ID。
  • 符号链接、FIFO、疑似凭证、explicit-only、自身递归排除。
  • 用户显式选择不发请求、不绕过排除列表;local 不伪装成 Jev。
  • 两阶段选择、无需技能、绝对适配不足、低置信度、第二次调用失败。
  • 推理期间正文或调用策略变化导致结果失效。
  • 缓存重放零调用;任务变化、正文片段以外的变化使缓存失效;非法缓存不复用。
  • 输出不覆盖已有文件且权限 0600;未知 allow 项报错;目录 path 字段不进入模型请求。
  • 分组后每项技能均被覆盖且请求满足大小限制。

这些是功能和边界测试,不证明语义准确率或完整安全性。

真实 Jev 测试

使用本机的两个明确目录:用户 Codex 技能目录与本项目工作区 .agents/skills。扫描到 24 个技能文件,其中 1 个仅允许显式调用,实际语义候选为 23 个。目录没有读取警告。没有自动扫描插件缓存;因此不是当前会话所有插件技能的全量评估。

16 个任务由开发宿主编写并在推理前标注,涵盖中文、英文、有匹配技能与无匹配技能。它们未由外部标注员独立审核,也未证明在真实流量上的准确率。阈值和问题未因这轮结果而修改;没有重跑选择更好的答案。

任务期望/结果
公众号只排版、不发布wechat-editorial-studio,符合
发布技术文章到掘金article-platform-publisher,符合
Jev 检查本地 MCP 外传风险jev-security-scan,符合
Jev 改写并检查原意jev-humanize-writing,符合
创建可复用 Codex skillskill-creator,符合
阅读登录后的 Reddit Homereddit-home-feed-research,符合
在 iTerm 中启动交互 Claude Codeinteractive-claude-iterm,符合
Claude Code 项目接入准备claude-code-project-onboarding,符合
编写 Codex /goal 命令goal-prompt-builder,符合
英文 MOBI 翻译中文translate-mobi-zh-minimax,符合
只读查阅 TypeSafe 文档typesafe-ai,符合;未因只读被过滤
只读查阅 Codex 模型与价格openai-docs,符合
简单乘法none,符合
翻译一句话none,符合
两句话解释递归none,符合
Trello 专用操作流程预期 none,实际 uncertain;未推荐任何技能

最后一例保留了模型的真实混淆:它在 dynamic-workflow-prompt-builderskill-creatornone 间分配概率。最高候选概率 0.48,Choice confidence 0.29,最高适配 Noul 0.41;没有达到推荐门槛。不能把这例写成正确识别了“无需技能”,也不能把“零错误推荐”写成“100% 准确率”。

  • 预期完整结果:15/16。
  • 正样例推荐预设技能:12/12。
  • 负样例明确 none:3/4;另 1 例 uncertain。
  • 错误地给出最终推荐:0/16。
  • 真实 HTTP 请求:45;失败:0;重试:0。
  • 输入 230,067 tokens;输出 12,639 tokens。
  • 按评估时采用的输入价格 $0.042/百万 tokens 估算:$0.009662814,不是账单核对结果。价格
  • 每任务总耗时中位数:5,052.875 ms,包含本机目录读取、串行请求和网络。24 个入口被分为两组;有匹配的任务通常需要两次初筛和一次复核,普通无需技能的任务两次初筛后结束。
  • 首个任务真实缓存重放:3 次缓存命中,0 次新增 HTTP 调用,当前运行计费输入 tokens 为 0。

公开证据见 16 个案例的脱敏摘要:保留任务、期望、结果、分数、时延、tokens 和每次调用的计数信息;最终 Choice 的不透明 ID 转为候选名称。省略本机路径、完整技能目录、描述、正文片段、请求及输入哈希。该文件不是原始 API 响应或完整 CLI 输出。

完整请求与客户端校验后的响应保留在开发者本地,不进入公开仓库。启动前 manifest 中的运行代码与任务样例 SHA-256 已保留到公开摘要,并与发布文件逐一比对。其他人可以运行相同程序,但没有原始私有目录时无法精确复现这次输入,也不能把这些记录视作独立审计。

独立离线前向测试

按 skill-creator 的前向测试步骤,由独立子 Agent 阅读本 Skill,执行现实任务。仅允许离线 CLI,不允许 API、凭证、安装或代码修改。

8 个建议流程检查通过,验证了公众号任务的关键词候选和人工入口核对、真实同名技能歧义、精确 ID 选择、被排除及不存在技能的 unavailable。全部为 0 API 调用;未验证 Jev 语义质量。

发现并修复了一项说明问题:早期文档中的“添加 --root/--skill-file”容易被理解为追加,而 CLI 实际替代默认源。现在文档明确解释替代语义,并给出完整列举默认目录与项目目录的命令。独立 Agent 重新阅读后确认歧义已消除。完整检查记录含本机路径,留在开发者本地;公开仓库提供此项流程及结果摘要。

采用边界

适合在新任务开始、目标变化、相邻技能难分时调用;不宜每轮消息都运行。没有对照“宿主直接选技能”的任务成功率、总 token 和总耗时,不能宣称它已降低整体成本或提高完成率。

本轮任务多有清楚的用途描述,难度有限。尚未系统测试所有插件技能、大型目录、真实多步骤任务、恶意技能描述和语言混合。提示注入依然可能影响判断;推荐与安全审核、可用性及执行权限分开处理。

该 Skill 没有安装全局 hook、修改 Codex 设置或自动执行候选。宿主仍保留原有技能列表,并在读取完整入口后作最终决定。