RubiksCubesInBin은 complex인데 100%, LargerObjectRaisinBoxInBin은 simple인데 0%.| 태스크 | 성공 | % | 95% CI | 난이도 | 태그 | 길이 |
|---|---|---|---|---|---|---|
RubiksCubeOrBananaTask | 10/10 | 100% | [78.3–100.0] | simple | conjunction | 30s |
RubiksCubesInBinTask | 10/10 | 100% | [78.3–100.0] | complex | sorting | 120s |
BananaInBowlTask | 10/10 | 100% | [78.3–100.0] | simple | semantics | 50s |
BananasInBinOneMoreTask | 10/10 | 100% | [78.3–100.0] | moderate | semanticscounting | 60s |
RubiksCubeLeftOfBowlTask | 9/10 | 90% | [61.9–98.9] | moderate | spatial | 30s |
MarkerInMugTask | 5/10 | 50% | [22.4–77.6] | moderate | affordance | 40s |
ReorientJugTask | 3/10 | 30% | [9.3–60.6] | moderate | semanticsreorientationaffordance | 60s |
BlockStackingOrderAgnosticTask | 3/10 | 30% | [9.3–60.6] | complex | stacking | 90s |
Stack3RubiksCubeTask | 1/10 | 10% | [1.1–38.1] | moderate | stacking | 60s |
PickUpBluePitcherTask | 1/10 | 10% | [1.1–38.1] | moderate | coloraffordance | 30s |
RedItemsInBinTask | 1/10 | 10% | [1.1–38.1] | moderate | colorsorting | 60s |
CookingPickPastaToolTask | 0/10 | 0% | [0.0–21.7] | simple | spatialvaguecolor | 60s |
LargerObjectRaisinBoxInBinTask | 0/10 | 0% | [0.0–21.7] | simple | size | 30s |
ReorientAllMugsTask | 0/10 | 0% | [0.0–21.7] | complex | reorientation | 90s |
BlockStackingSpecifiedOrderTask | 0/10 | 0% | [0.0–21.7] | complex | stackingcolor | 90s |
BlockStackingOrderAgnostic 30% vs
BlockStackingSpecifiedOrder 0%. 같은 씬·같은 블록에 순서 지정만 추가된 차이라,
"쌓기는 가끔 되지만 지정된 색 순서는 따르지 못한다"로 읽을 수 있다.| 난이도 | 성공 | % | 태스크 수 |
|---|---|---|---|
simple | 20/40 | 50% | 4개 |
moderate | 30/70 | 43% | 7개 |
complex | 13/40 | 32% | 4개 |
| 스킬 태그 | 성공 | % | 태스크 수 |
|---|---|---|---|
conjunction | 10/10 | 100% | 1개 |
counting | 10/10 | 100% | 1개 |
semantics | 23/30 | 77% | 3개 |
sorting | 11/20 | 55% | 2개 |
spatial | 9/20 | 45% | 2개 |
affordance | 9/30 | 30% | 3개 |
reorientation | 3/20 | 15% | 2개 |
stacking | 4/30 | 13% | 3개 |
color | 2/40 | 5% | 4개 |
vague | 0/10 | 0% | 1개 |
size | 0/10 | 0% | 1개 |
color가 5%로 낮지만 해당 태스크 4개가 전부 stacking·sorting·vague 같은
다른 어려운 축을 함께 갖는다. size·vague·conjunction·counting은
태스크가 1개뿐이라 사실상 그 태스크 하나의 결과다. 스킬 축을 분리하려면 축마다 통제된 쌍이 필요하다.Cosmos3는 action과 video를 함께 denoise하는 world-action model이라, 서버가 "모델이 예상한 미래"를 같이 돌려준다. 아래 영상은 왼쪽 = 모델의 상상, 오른쪽 = 같은 시각의 실제 렌더를 같은 시간축으로 붙인 것이다. 실패가 상상이 틀린 것인지 상상은 맞았는데 팔이 못 따라간 것인지 구분하는 데 쓴다.
· 궤적 플롯에서 commanded를 achieved가 잘 따라가는데도 실패 → 제어가 아니라 인식·예측 문제
· 그리퍼 achieved 값이 파지 성공의 무료 지표: 0.37 부근에서 멈추면 물체를 문 것, 1.0까지 닫히면 허공을 잡은 것
· 상상은 청크 시작 관측 하나로 만든 2.1초 예측이라 뒤로 갈수록 벌어지는 게 정상이다. 판단 기준은 "얼마나 닮았나"가 아니라 의도한 접촉·파지가 예측에 나타나는가이다.
같은 씬, 같은 블록. 차이는 쌓는 순서를 지정했는가 뿐이다. 쌓기 동작 자체는 가끔 성공하지만(30%), 색 순서가 걸리면 10번 모두 실패한다(0%). 두 태스크가 최소 차이라 이 비교만은 교란 없이 읽을 수 있다.
실패가 있는 태스크는 실패 사례를, 100% 태스크는 성공 사례를 실었다.
전체 113개 비교 영상은 각 run 디렉토리의 _comparison/에 있다.















| 항목 | 값 |
|---|---|
| 정책 | nvidia/Cosmos3-Nano-Policy-DROID (16B, UniPC 4 steps, chunk 32×8D) |
| 시뮬 | RoboLab @ IsaacSim 5.0 / IsaacLab 2.2.0, 카메라 WRIST_LEFT_RIGHT_HEAD |
| 태스크 세트 | SUITE_STANDARD 15개 (11개 스킬 태그 전부 커버, 난이도 4/7/4) |
| 표본 | 태스크당 10 에피소드 (--num-envs 10, num-runs 1) |
| 실행 | 2 GPU × 3 job 병렬 (server GPU0 / sim GPU1), --qos=own |
| 소요 | 2:06 / 2:12 / 1:37 (병렬 → 실질 2시간 12분) |
| 저장 | 원본 4.5GB + 비교 영상 1.6GB. 실패 87건 전부 보존, 성공은 태스크당 2건 |
| 재현 | SUITE=standard NUM_ENVS=10 RECORD_IMAGINATION=1 bash scripts/run_robolab_eval.sh |
| 런북 | scripts/README.md (다른 모델 적용 절차 포함) |
--num-episodes-adaptive 200이 필요하다.
또한 이 15개는 120개 벤치마크의 부분집합이므로 전체 성공률 42%를 벤치마크 전체 점수로 읽으면 안 된다.