SIM模拟数据。本站所有分数、比率与价格均为示意。
Instrument
EN 联系

原理

从机器人工位到签名报告的六层,以及系统强制执行的规则。

服务谁

ROLE A 数据产生者

我有机器人。我想知道我的策略行不行,但不想自己建一套评测。

看他的终端 →
ROLE B 评测方 · 买方

我没有机器人,也不想买三台回来试。我要一个能拿去交代的结论。

看他的下单表 →
ROLE C Judge API

一次调用进来之后,机器里到底发生了什么。

看七步流水线 →
SECTION · SHADOW MODE 影子模式

策略在人类操作员旁只读运行;我们量它在哪里分歧,以及分歧怎样随本体变化。

进入影子模式 →

一件仪器,不是一个榜单

测的不是"谁最强",是"这一台、这一次、在什么条件下、表现如何"。i

rc-eval 开源 · 免费

协议与 harness,任何人在自己的机器上跑。i

Judge API 按次计量

托管判分器,版本化,按次计费。i

RC Verified 不自助

RC 的 operator、RC 的格子、含私有 B 档题,出一份可被引用的签名结果。

六层

L0物理层 · CELL桌面 + 臂 + 手 + 三路相机 + 本地 GPU + 急停 + 复位夹具机队是真的 · 格子还没建
组件 i
评测格子(硬件)新建每格约 1 周
格子清单 + 能力契约扩展1.5
序列号级机队登记(RCSN)新建1.5
急停(API)复用0
已列工作约 3 人周
现在的样子
  • 机队是真的:60+ 人形、89 支臂、41 只手。
  • 还没有搭出任何一个评测格子。
  • 只有 xArm 有硬件急停输入;Piper / YAM / OpenArm 没有。
  • 代码里没有序列号级登记。ERP 里有序列号,但大部分从未扫码。
L1采集 · RC-RUNNER驻场 agent,同步录制,产出不可变 bundle零件都在 · 真实录制 0 份
组件 i
rc-runner(把格子绑成一次 run)新建4
机器人驱动(9 个遥操 agent)复用0.5
传感器 agent(7 RGBD + 4 LiDAR)复用0.5
时间基 ts_ns + ts_mono_ns复用0
bundle 写入与封存新建2
t=0 的权利与归因字段新建0.5
operator 与复位计时新建0.5
边缘安装 / 自启动复用0.5
已列工作约 8.5 人周
现在的样子
  • 时间基、机器人 agent、传感器 agent 都已存在,可 --mock 运行。
  • 影子模式采集按 obs / pred / div 契约落盘(PROTOCOL.md v1–v9)。
  • 磁盘上 6 个会话,全部合成。真实录制:0。
  • rc-runner 和 bundle 写入器还没做。
L2记录 · RUN BUNDLEGCS,内容哈希,可证明未被修改有规格 · 9 段真实录像
组件 i
bundle 上传(可续传)扩展1.5
对象存储(GCS 桶 + 权限)扩展0.5
bundle 校验(哈希 / 封存 / 时钟健康)新建1.5
入库任务复用1
run 索引(Postgres)新建随表结构一起做
已列工作约 4.5 人周
现在的样子
  • bundle 格式已写进 run-bundle.md。
  • 9 段真实任务录像已打成 bundle,dry-run 全通。
  • 平台流水线仍写 /tmp 而不是 GCS,还不是端到端。
  • 校验器和 run 索引还没做。
L3判分 · JUDGE + OPERATOR CONSOLE每一次判分器与 operator 的分歧都被记录判分器已做 · 人的上限未知
组件 i
judge-svc(版本化 VLM 判分器)新建5
VLM 后端路由 + 故障切换复用0.5
单次调用计费复用0.2
判分器版本登记扩展1.5
Operator 控制台(提交前盲)扩展5
分歧账新建1.5
历史重判任务新建2
回避制(数据库约束)新建1
已列工作约 16.7 人周
现在的样子
  • 判分器运行时已做,变异测试 37/37。
  • 实测成本:每次判分 $0.0697(gpt-4o,三模型集成,6 次调用)。
  • 900 条盲标落在 900 个不同的 run 上,没有一条被两人标过,所以任何 κ 都没法解读。原因:rci_review_next() 只分发没标过的 run。
  • Operator 控制台目前是演示页。
L4账本 · 系数表 + RCSN 档案只增不改演示账本在线 · 真实行 0
组件 i
系数表(只增不改)新建2
RCSN 设备档案新建3
合规字段(中国 29 位码 / FCC / Covered List)新建1 + 法务审阅
故障 → 档案写入新建1
已列工作约 6 人周
现在的样子
  • 演示账本跑在 Supabase 上,1,979 条演示 run,每条都标了 is_demo。
  • 系数表真实行数:0。
  • 档案表及其 7 条不变量已存在,跑在演示数据上。
L5产品 · 报告 / 背书 / 查询 / 直播只有 A 档 run 能进直播就是这个站 · 评测收入 $0
组件 i
报告渲染复用3
背书签名 / 校验扩展3
背书交付(分享链接)复用0.5
公开 A 档榜扩展2
查询 API新建2
7×24 A 档直播扩展4
rc-eval 开源 harness新建4
CLI / MCP扩展1.5
预约 → 付款复用1.5
Judge API 计量 → 收费扩展2.5
已列工作约 24 人周
现在的样子
  • 就是这个站,含一份用真实 evalsvc 输出、合成输入渲染的影子报告。
  • 评测收入:$0。计量已有,但只做估算,不收钱。
  • 直播、背书签名、公开查询 API 都还没做。

六条铁律

结构约束,由系统强制,不是政策。

  1. 01B 档题内容不经由任何接口对任何人开放 i
  2. 02看过某道 B 档题的人,不参与给该题打分(回避制,系统强制)
  3. 03attempt 与 success 永不合并成一个分数
  4. 04不计策略分的判据是 counts_against_policy == false,查分类法,永不硬编码 id i
  5. 05买方付验收的钱;厂商可付 VOC / 兼容 / 支持的钱,但不能付钱买结论
  6. 06公开报告默认对本体匿名 i

演示账本 · 实时

账本今天记下了什么。下面每个数都是从种子生成的演示 run 里实时聚合的。

DEMO 数据 从线上库现读;分数是种子生成的。

各本体 · 成功率 vs 尝试率

success_rate attempt_rate

跨本体标准差 σ · 同一策略换身体 i

σ success σ attempt

任务参考录像

每个任务的人类参考录像,按场景 › 环境归档。不是这些 run 的录像;每段下面一行写的是它实际拍到了什么,点一下打开系数表里对应的任务行。

展开录像墙

最新 run

展开最近 12 条 run

还没变的零

人形 / 臂 / 手60+ · 89 · 41
Eval 收入$0
系数表行数0
真实 run0
致谢论文0
M0 规模 i480 runs
M0 工时2 人周 + 3 操作日