RPent 排行榜#

LIBERO-PRO

方法 / 模型成功率
Codex / GPT-6 Astra / low / reasoning92.63%
Claude Code / Opus-4.7 / max.reasoning82.4%
RPent Flash Mode72.63%
Codex / GPT-5.5 / xhigh / reasoning72.1%
ASPIRE61.36%
π_RLinf50.0%
π0.511.0%
AtomVLA6.3%
X-VLA3.8%
MolmoAct1.5%
π00.3%

GPT-6 Astra: 92.63% (741/800). RPent Flash Mode / Molmo2-8B: 72.63% (581/800).

完整方法与分项成绩

方法 / 模型总体Spatial TaskSpatial SwapObject TaskObject SwapGoal TaskGoal SwapLong TaskLong Swap
GPT-6 Astra92.63%100%98%100%99%88%99%85%72%
Opus-4.7 / max.reasoning82.4%
RPent Flash Mode / Molmo2-8B72.63%79.00%70.00%86.00%93.00%74.00%65.00%60.00%54.00%
GPT-5.572.1%81.0%69.0%94.0%91.0%75.0%66.0%52.0%49.0%
ASPIRE61.36%60.0%51.0%95.0%98.0%45.0%81.0%38.3%22.6%
π_RLinf50.0%42.0%59.0%71.0%78.0%45.0%42.0%49.0%14.0%
π0.511.0%1.0%20.0%1.0%17.0%2.0%38.0%1.0%8.0%
AtomVLA6.3%1.0%16.0%0.0%10.0%11.0%2.0%9.0%1.0%
X-VLA3.8%0.0%0.0%8.0%2.0%9.0%1.0%10.0%0.0%
MolmoAct1.5%0.0%0.0%0.0%6.0%0.0%0.0%6.0%0.0%
π00.3%0.0%0.0%0.0%2.0%0.0%0.0%0.0%0.0%
Cap-X14.0%12.0%18.0%22.0%17.0%26.0%
RATS31.0%29.0%63.0%61.0%36.0%43.0%

ASPIRE:Long Task 和 Long Swap 使用 LIBERO-90 技能库进行 zero-shot 迁移。

GPT-6 Astra:Long Task/Swap 与其余六套件使用各自探索后冻结的 memory 文件快照,评测期间不更新。Overall 合并两个不重叠批次:Long 157/200,加上其余套件 584/600,得到 741/800(92.63%);并非全部回合共享同一份 memory 快照。

LIBERO

方法 / 模型成功率
AtomVLA97.0%
Claude Code / Opus-4.7 / max.reasoning96.0%
π_RLinf95.3%
π094.2%
NORA79.5%
OpenVLA76.5%

RoboCasa365 · Target50

方法 / 模型成功率
Codex / GPT-6 Astra / low / reasoning59.20%
Xiaomi-Robotics-157.4%
Codex / GPT-5.5 / xhigh / reasoning57.1%
Claude Code / Opus-4.7 / max.reasoning48.6%
WorldDreamer35.3%
RLDX-130.0%
π0.516.9%
π014.8%

RoboCasa365 · Target50 · 完整方法与分项成绩

方法 / 模型总体Atomic-SeenComposite-SeenComposite-Unseen
GPT-6 Astra59.20%87.78%43.75%42.50%
Xiaomi-Robotics-157.4%80.2%57.1%32.1%
GPT-5.557.1%92.0%61.0%13.8%
Opus-4.7 / max.reasoning48.6%79.4%47.5%15.0%
WorldDreamer35.3%66.3%26.7%9.0%
RLDX-130.0%60.0%21.3%5.0%
π0.516.9%39.6%7.1%1.2%
π014.8%34.6%6.1%1.1%

RoboTwin

方法 / 模型成功率
Codex / GPT-5.5 / xhigh / reasoning62.4%
Claude Code / Opus-4.7 / max.reasoning58.4%
LingBot-VLA50.4%
π0.547.9%
GR00T-N1.720.7%
StarVLA10.6%