← Index
2026-07-22 — Experiment

Cosmos3-Nano-Policy-DROID — RoboLab 표준 15태스크 평가

job 51235 / 51236 / 51237 · 2×B200 ×3 병렬 · num-envs 10 · 에피소드 150건

TL;DR

42.0%
전체 성공률
63/150
에피소드
4
100% 태스크
4
0% 태스크
15
태스크

1 태스크별 성공률

태스크성공%95% CI난이도태그길이
RubiksCubeOrBananaTask10/10100%[78.3–100.0]simpleconjunction30s
RubiksCubesInBinTask10/10100%[78.3–100.0]complexsorting120s
BananaInBowlTask10/10100%[78.3–100.0]simplesemantics50s
BananasInBinOneMoreTask10/10100%[78.3–100.0]moderatesemanticscounting60s
RubiksCubeLeftOfBowlTask9/1090%[61.9–98.9]moderatespatial30s
MarkerInMugTask5/1050%[22.4–77.6]moderateaffordance40s
ReorientJugTask3/1030%[9.3–60.6]moderatesemanticsreorientationaffordance60s
BlockStackingOrderAgnosticTask3/1030%[9.3–60.6]complexstacking90s
Stack3RubiksCubeTask1/1010%[1.1–38.1]moderatestacking60s
PickUpBluePitcherTask1/1010%[1.1–38.1]moderatecoloraffordance30s
RedItemsInBinTask1/1010%[1.1–38.1]moderatecolorsorting60s
CookingPickPastaToolTask0/100%[0.0–21.7]simplespatialvaguecolor60s
LargerObjectRaisinBoxInBinTask0/100%[0.0–21.7]simplesize30s
ReorientAllMugsTask0/100%[0.0–21.7]complexreorientation90s
BlockStackingSpecifiedOrderTask0/100%[0.0–21.7]complexstackingcolor90s
통제된 쌍: BlockStackingOrderAgnostic 30% vs BlockStackingSpecifiedOrder 0%. 같은 씬·같은 블록에 순서 지정만 추가된 차이라, "쌓기는 가끔 되지만 지정된 색 순서는 따르지 못한다"로 읽을 수 있다.

2 난이도별 / 태그별 집계

난이도성공%태스크 수
simple20/4050%4개
moderate30/7043%7개
complex13/4032%4개
스킬 태그성공%태스크 수
conjunction10/10100%1개
counting10/10100%1개
semantics23/3077%3개
sorting11/2055%2개
spatial9/2045%2개
affordance9/3030%3개
reorientation3/2015%2개
stacking4/3013%3개
color2/405%4개
vague0/100%1개
size0/100%1개
태그 집계는 결론이 아니라 가설이다. 태그당 태스크가 1~4개뿐이고 서로 교란돼 있다. color가 5%로 낮지만 해당 태스크 4개가 전부 stacking·sorting·vague 같은 다른 어려운 축을 함께 갖는다. size·vague·conjunction·counting은 태스크가 1개뿐이라 사실상 그 태스크 하나의 결과다. 스킬 축을 분리하려면 축마다 통제된 쌍이 필요하다.

3 상상 vs 실제 — 비교 영상

Cosmos3는 action과 video를 함께 denoise하는 world-action model이라, 서버가 "모델이 예상한 미래"를 같이 돌려준다. 아래 영상은 왼쪽 = 모델의 상상, 오른쪽 = 같은 시각의 실제 렌더를 같은 시간축으로 붙인 것이다. 실패가 상상이 틀린 것인지 상상은 맞았는데 팔이 못 따라간 것인지 구분하는 데 쓴다.

읽는 법

· 궤적 플롯에서 commanded를 achieved가 잘 따라가는데도 실패 → 제어가 아니라 인식·예측 문제

· 그리퍼 achieved 값이 파지 성공의 무료 지표: 0.37 부근에서 멈추면 물체를 문 것, 1.0까지 닫히면 허공을 잡은 것

· 상상은 청크 시작 관측 하나로 만든 2.1초 예측이라 뒤로 갈수록 벌어지는 게 정상이다. 판단 기준은 "얼마나 닮았나"가 아니라 의도한 접촉·파지가 예측에 나타나는가이다.

통제된 쌍 — 순서 지정 여부만 다른 두 태스크

같은 씬, 같은 블록. 차이는 쌓는 순서를 지정했는가 뿐이다. 쌓기 동작 자체는 가끔 성공하지만(30%), 색 순서가 걸리면 10번 모두 실패한다(0%). 두 태스크가 최소 차이라 이 비교만은 교란 없이 읽을 수 있다.

OrderAgnostic — 성공 3/10 (30%)
"블록을 쌓아라" · 상상과 실제가 거의 일치
SpecifiedOrder — 실패 0/10 (0%)
"빨강→파랑→초록→노랑 순서로" · 상상에서 블록이 사라지는 구간 발생

태스크별 대표 사례

실패가 있는 태스크는 실패 사례를, 100% 태스크는 성공 사례를 실었다. 전체 113개 비교 영상은 각 run 디렉토리의 _comparison/에 있다.

RubiksCubeOrBananaTask  10/10 (100%)
성공 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
RubiksCubesInBinTask  10/10 (100%)
성공 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
BananaInBowlTask  10/10 (100%)
성공 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
BananasInBinOneMoreTask  10/10 (100%)
성공 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
RubiksCubeLeftOfBowlTask  9/10 (90%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
MarkerInMugTask  5/10 (50%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
ReorientJugTask  3/10 (30%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
BlockStackingOrderAgnosticTask  3/10 (30%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
Stack3RubiksCubeTask  1/10 (10%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
PickUpBluePitcherTask  1/10 (10%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
RedItemsInBinTask  1/10 (10%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
CookingPickPastaToolTask  0/10 (0%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
LargerObjectRaisinBoxInBinTask  0/10 (0%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
ReorientAllMugsTask  0/10 (0%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기
BlockStackingSpecifiedOrderTask  0/10 (0%)
실패 사례 · 좌=모델의 상상 / 우=실제 렌더
commanded vs achieved 궤적 보기

4 실험 조건 / 재현

항목
정책nvidia/Cosmos3-Nano-Policy-DROID (16B, UniPC 4 steps, chunk 32×8D)
시뮬RoboLab @ IsaacSim 5.0 / IsaacLab 2.2.0, 카메라 WRIST_LEFT_RIGHT_HEAD
태스크 세트SUITE_STANDARD 15개 (11개 스킬 태그 전부 커버, 난이도 4/7/4)
표본태스크당 10 에피소드 (--num-envs 10, num-runs 1)
실행2 GPU × 3 job 병렬 (server GPU0 / sim GPU1), --qos=own
소요2:06 / 2:12 / 1:37 (병렬 → 실질 2시간 12분)
저장원본 4.5GB + 비교 영상 1.6GB. 실패 87건 전부 보존, 성공은 태스크당 2건
재현SUITE=standard NUM_ENVS=10 RECORD_IMAGINATION=1 bash scripts/run_robolab_eval.sh
런북scripts/README.md (다른 모델 적용 절차 포함)
한계 — 태스크당 n=10이라 개별 태스크 CI는 여전히 폭이 20~30%p다. 모델 간 순위를 다투는 비교라면 --num-episodes-adaptive 200이 필요하다. 또한 이 15개는 120개 벤치마크의 부분집합이므로 전체 성공률 42%를 벤치마크 전체 점수로 읽으면 안 된다.