实验结果与验证范围
September 20, 2026 · View on GitHub
行知已经能运行真实模型调用、物理交互和视觉输入。下面把不同输入、控制方式和模型的结果分开列出,方便判断每项结果说明了什么。
Jev 分层 XYZ 试跑
两局本地开发实验使用 jev-1.13.0、搬运 seed 7、仿真坐标与接触输入:分别 89 / 88 步、178 / 176 次请求、72.43 / 79.71 秒,最终满足物理成功条件。两局下放时都失抓落入托盘,随后张爪和撤离,尚不是稳定精确放置。没有给 Jev 发送图像,也没有规则代选。
结果摘要与限制 · 带真实概率的 8 倍速动图。本次公开结果与媒体,实验控制器和完整原始轨迹仍保留本地。
逐步视觉规划
这一组使用 GPT-6 Astra、双相机原始图像、搬运任务 seed 7。模型逐轮选择 XYZ 短步,不接收物体或目标坐标。
| 回合 | 结果 | 动作 / API 调用 |
|---|---|---|
| 正常搬运 | 完成抓取、放置和撤离 | 32 / 32 |
| 中途移动托盘 | 出现接触丢失后重新抓取,调整到新目标并完成 | 43 / 43 |
| 最初目标说明不完整 | 放入盘后撤离高度不足,停止 | 32 / 32 |
| 两次 API 失败 | 请求超时,未完成 | 2 / 3、0 / 1 |
最初失败后补充了最终撤离高度要求;目标条件修订前后不作为相同设置统计。这里只有同一个场景的少量开发回合,不合并计算成功率。
同一短步接口还有一局手写规则对照,使用仿真坐标,在托盘移动后以 40 步完成,模型调用为 0。它与图像输入的模型回合不是严格同输入对照。
预设技能与状态输入
这些实验由模型选择程序提供的技能。技能内部目标由代码生成,和上面的逐步视觉规划不同。
| 输入 | 模型 / 策略 | 已有结果 | 详细记录 |
|---|---|---|---|
| 仿真坐标 | GPT-6 Astra | 3 任务 × 3 种子,9/9;每局 8 动作、13 次调用 | 九局实验 |
| 仿真坐标 | 规则基线 | 9/9;每局 8 动作,零模型调用 | 基线数据 |
| RGB-D 估计,单外部相机 | GPT-6 Astra | 搬运 1/1;8 动作、13 次调用 | 视觉估计+GPT |
| RGB-D 估计,双相机 | 规则基线 | 3 任务各 seed 0,3/3;每局 8 动作,零模型调用 | 回归数据 |
| 仿真坐标 | MiniCPM5-2B FP16 | 最近一组 0/3;两局停滞、一局预算耗尽 | MiniCPM 记录 |
MiniCPM 在 Apple M2 / 16 GB 上通过 MPS、FP16 跑过真实推理,目前还不能可靠完成这三个任务。Jev、Claude 的接口有模拟响应测试,尚无同设置的完整真实对照。不能把接口已接通当作模型任务已成功。
功能检查
逐步规划与相机配置版本通过 401 项 Python 测试、27 项浏览器测试,前端构建通过;对应 CI也已通过。
测试覆盖动作执行、安全检查、暂停和停止、输入脱敏、图像请求格式、相机选择、缓存、扰动、轨迹回放及界面操作。自动化模型与浏览器相机用例使用模拟响应;真实像素变化、模型动作和物理结果由上面的独立实验检查。
读这些结果时要注意什么?
- 成功是仿真中的成功。 物体需要在目标上稳定、夹爪松开、末端撤离;尚未验证真实机器人。
- 回放不是推理计时。 动图和时间轴省略等待,延迟要看导出的实际耗时。
- 不同设置不能直接排名。 技能与短步、坐标与图像、模型与规则应分别报告。
- 小样本不能代表泛化。 尚缺不同相机组合、移除图像、未知物体和未调试布局的成对实验。
- 合理的文字解释不是证明。 要对照输入图像、所选动作和执行后的变化。
找原始文件
docs/results/ 中保留汇总 JSON、压缩轨迹以及视觉回合的相机 ZIP。汇总内的文件名和哈希可以核对原始数据;导出不包含 Key 或私有接口地址。
需要追查旧版本的调试过程、提示词修订和 CI 问题,可看历史开发记录。日常使用以本页和对应功能指南为准。