原理
从机器人工位到签名报告的六层,以及系统强制执行的规则。
服务谁
我有机器人。我想知道我的策略行不行,但不想自己建一套评测。
看他的终端 → ROLE B 评测方 · 买方我没有机器人,也不想买三台回来试。我要一个能拿去交代的结论。
看他的下单表 → ROLE C Judge API一次调用进来之后,机器里到底发生了什么。
看七步流水线 →策略在人类操作员旁只读运行;我们量它在哪里分歧,以及分歧怎样随本体变化。
进入影子模式 →一件仪器,不是一个榜单
测的不是"谁最强",是"这一台、这一次、在什么条件下、表现如何"。i
rc-eval 开源 · 免费
协议与 harness,任何人在自己的机器上跑。i
Judge API 按次计量
托管判分器,版本化,按次计费。i
RC Verified 不自助
RC 的 operator、RC 的格子、含私有 B 档题,出一份可被引用的签名结果。
六层
L0物理层 · CELL桌面 + 臂 + 手 + 三路相机 + 本地 GPU + 急停 + 复位夹具机队是真的 · 格子还没建
L1采集 · RC-RUNNER驻场 agent,同步录制,产出不可变 bundle零件都在 · 真实录制 0 份
组件 i
| rc-runner(把格子绑成一次 run) | 新建 | 4 |
| 机器人驱动(9 个遥操 agent) | 复用 | 0.5 |
| 传感器 agent(7 RGBD + 4 LiDAR) | 复用 | 0.5 |
| 时间基 ts_ns + ts_mono_ns | 复用 | 0 |
| bundle 写入与封存 | 新建 | 2 |
| t=0 的权利与归因字段 | 新建 | 0.5 |
| operator 与复位计时 | 新建 | 0.5 |
| 边缘安装 / 自启动 | 复用 | 0.5 |
已列工作约 8.5 人周
现在的样子
- 时间基、机器人 agent、传感器 agent 都已存在,可 --mock 运行。
- 影子模式采集按 obs / pred / div 契约落盘(PROTOCOL.md v1–v9)。
- 磁盘上 6 个会话,全部合成。真实录制:0。
- rc-runner 和 bundle 写入器还没做。
L2记录 · RUN BUNDLEGCS,内容哈希,可证明未被修改有规格 · 9 段真实录像
L3判分 · JUDGE + OPERATOR CONSOLE每一次判分器与 operator 的分歧都被记录判分器已做 · 人的上限未知
组件 i
| judge-svc(版本化 VLM 判分器) | 新建 | 5 |
| VLM 后端路由 + 故障切换 | 复用 | 0.5 |
| 单次调用计费 | 复用 | 0.2 |
| 判分器版本登记 | 扩展 | 1.5 |
| Operator 控制台(提交前盲) | 扩展 | 5 |
| 分歧账 | 新建 | 1.5 |
| 历史重判任务 | 新建 | 2 |
| 回避制(数据库约束) | 新建 | 1 |
已列工作约 16.7 人周
现在的样子
- 判分器运行时已做,变异测试 37/37。
- 实测成本:每次判分 $0.0697(gpt-4o,三模型集成,6 次调用)。
- 900 条盲标落在 900 个不同的 run 上,没有一条被两人标过,所以任何 κ 都没法解读。原因:rci_review_next() 只分发没标过的 run。
- Operator 控制台目前是演示页。
L4账本 · 系数表 + RCSN 档案只增不改演示账本在线 · 真实行 0
L5产品 · 报告 / 背书 / 查询 / 直播只有 A 档 run 能进直播就是这个站 · 评测收入 $0
组件 i
| 报告渲染 | 复用 | 3 |
| 背书签名 / 校验 | 扩展 | 3 |
| 背书交付(分享链接) | 复用 | 0.5 |
| 公开 A 档榜 | 扩展 | 2 |
| 查询 API | 新建 | 2 |
| 7×24 A 档直播 | 扩展 | 4 |
| rc-eval 开源 harness | 新建 | 4 |
| CLI / MCP | 扩展 | 1.5 |
| 预约 → 付款 | 复用 | 1.5 |
| Judge API 计量 → 收费 | 扩展 | 2.5 |
已列工作约 24 人周
现在的样子
- 就是这个站,含一份用真实 evalsvc 输出、合成输入渲染的影子报告。
- 评测收入:$0。计量已有,但只做估算,不收钱。
- 直播、背书签名、公开查询 API 都还没做。
六条铁律
结构约束,由系统强制,不是政策。
- 01B 档题内容不经由任何接口对任何人开放 i
- 02看过某道 B 档题的人,不参与给该题打分(回避制,系统强制)
- 03
attempt与success永不合并成一个分数 - 04不计策略分的判据是
counts_against_policy == false,查分类法,永不硬编码 id i - 05买方付验收的钱;厂商可付 VOC / 兼容 / 支持的钱,但不能付钱买结论
- 06公开报告默认对本体匿名 i
演示账本 · 实时
账本今天记下了什么。下面每个数都是从种子生成的演示 run 里实时聚合的。
DEMO 数据 从线上库现读;分数是种子生成的。
各本体 · 成功率 vs 尝试率
success_rate
attempt_rate
跨本体标准差 σ · 同一策略换身体 i
σ success
σ attempt
任务参考录像
每个任务的人类参考录像,按场景 › 环境归档。不是这些 run 的录像;每段下面一行写的是它实际拍到了什么,点一下打开系数表里对应的任务行。
展开录像墙
最新 run
展开最近 12 条 run
还没变的零
人形 / 臂 / 手60+ · 89 · 41
Eval 收入$0
系数表行数0
真实 run0
致谢论文0
M0 规模 i480 runs
M0 工时2 人周 + 3 操作日