实验结果与验证范围

September 20, 2026 · View on GitHub

行知已经能运行真实模型调用、物理交互和视觉输入。下面把不同输入、控制方式和模型的结果分开列出,方便判断每项结果说明了什么。

观看演示 · 逐步规划指南

Jev 分层 XYZ 试跑

两局本地开发实验使用 jev-1.13.0、搬运 seed 7、仿真坐标与接触输入:分别 89 / 88 步、178 / 176 次请求、72.43 / 79.71 秒,最终满足物理成功条件。两局下放时都失抓落入托盘,随后张爪和撤离,尚不是稳定精确放置。没有给 Jev 发送图像,也没有规则代选。

结果摘要与限制 · 带真实概率的 8 倍速动图。本次公开结果与媒体,实验控制器和完整原始轨迹仍保留本地。

逐步视觉规划

这一组使用 GPT-6 Astra、双相机原始图像、搬运任务 seed 7。模型逐轮选择 XYZ 短步,不接收物体或目标坐标。

回合结果动作 / API 调用
正常搬运完成抓取、放置和撤离32 / 32
中途移动托盘出现接触丢失后重新抓取,调整到新目标并完成43 / 43
最初目标说明不完整放入盘后撤离高度不足,停止32 / 32
两次 API 失败请求超时,未完成2 / 3、0 / 1

最初失败后补充了最终撤离高度要求;目标条件修订前后不作为相同设置统计。这里只有同一个场景的少量开发回合,不合并计算成功率。

同一短步接口还有一局手写规则对照,使用仿真坐标,在托盘移动后以 40 步完成,模型调用为 0。它与图像输入的模型回合不是严格同输入对照。

完整说明 · 设置、轨迹与相机文件索引

预设技能与状态输入

这些实验由模型选择程序提供的技能。技能内部目标由代码生成,和上面的逐步视觉规划不同。

输入模型 / 策略已有结果详细记录
仿真坐标GPT-6 Astra3 任务 × 3 种子,9/9;每局 8 动作、13 次调用九局实验
仿真坐标规则基线9/9;每局 8 动作,零模型调用基线数据
RGB-D 估计,单外部相机GPT-6 Astra搬运 1/1;8 动作、13 次调用视觉估计+GPT
RGB-D 估计,双相机规则基线3 任务各 seed 0,3/3;每局 8 动作,零模型调用回归数据
仿真坐标MiniCPM5-2B FP16最近一组 0/3;两局停滞、一局预算耗尽MiniCPM 记录

MiniCPM 在 Apple M2 / 16 GB 上通过 MPS、FP16 跑过真实推理,目前还不能可靠完成这三个任务。Jev、Claude 的接口有模拟响应测试,尚无同设置的完整真实对照。不能把接口已接通当作模型任务已成功。

功能检查

逐步规划与相机配置版本通过 401 项 Python 测试、27 项浏览器测试,前端构建通过;对应 CI也已通过。

测试覆盖动作执行、安全检查、暂停和停止、输入脱敏、图像请求格式、相机选择、缓存、扰动、轨迹回放及界面操作。自动化模型与浏览器相机用例使用模拟响应;真实像素变化、模型动作和物理结果由上面的独立实验检查。

读这些结果时要注意什么?

  • 成功是仿真中的成功。 物体需要在目标上稳定、夹爪松开、末端撤离;尚未验证真实机器人。
  • 回放不是推理计时。 动图和时间轴省略等待,延迟要看导出的实际耗时。
  • 不同设置不能直接排名。 技能与短步、坐标与图像、模型与规则应分别报告。
  • 小样本不能代表泛化。 尚缺不同相机组合、移除图像、未知物体和未调试布局的成对实验。
  • 合理的文字解释不是证明。 要对照输入图像、所选动作和执行后的变化。

找原始文件

docs/results/ 中保留汇总 JSON、压缩轨迹以及视觉回合的相机 ZIP。汇总内的文件名和哈希可以核对原始数据;导出不包含 Key 或私有接口地址。

需要追查旧版本的调试过程、提示词修订和 CI 问题,可看历史开发记录。日常使用以本页和对应功能指南为准。