← Index
2026-07-22 — Experiment

X-WAM — RoboLab 표준 15태스크 평가 (vs Cosmos3)

job 52609 / 52610 / 52611 · pretrained + DroidRelIK action · num-envs 10 · 12/15 태스크 (g2 preempt)

TL;DR

0%
X-WAM 성공률
42%
Cosmos3
0/120
에피소드
12
0% 태스크
12/15
태스크(g2 preempt)

1 태스크별 성공률 (X-WAM vs Cosmos3)

태스크X-WAM 성공%95% CI난이도길이Cosmos3
BananaInBowlTask0/100%[0–28]simple50s10/10 (100%)
BananasInBinOneMoreTask0/100%[0–28]moderate60s10/10 (100%)
BlockStackingOrderAgnosticTask0/100%[0–28]complex90s3/10 (30%)
BlockStackingSpecifiedOrderTask0/100%[0–28]complex90s0/10 (0%)
CookingPickPastaToolTask0/100%[0–28]simple60s0/10 (0%)
LargerObjectRaisinBoxInBinTask0/100%[0–28]simple30s0/10 (0%)
MarkerInMugTask0/100%[0–28]moderate40s5/10 (50%)
PickUpBluePitcherTask0/100%[0–28]moderate30s1/10 (10%)
RedItemsInBinTask0/100%[0–28]moderate60s1/10 (10%)
ReorientAllMugsTask0/100%[0–28]complex90s0/10 (0%)
ReorientJugTask0/100%[0–28]moderate60s3/10 (30%)
RubiksCubeLeftOfBowlTask0/100%[0–28]moderate30s9/10 (90%)
모든 태스크 0%. 난이도·태그와 무관하게 균일한 0%는 "특정 태스크가 어렵다"가 아니라 공통 요인(액션 브릿지)이 실패했음을 뜻한다. cosmos가 42%인 동일 조건에서 나온 값이라 sim/등록/카메라 문제도 아니다.

2 상상 vs 실제 — 비교 영상

X-WAM은 action과 video+depth를 함께 생성하는 4D world-action model이라 서버가 "모델이 예상한 미래"를 같이 준다. 아래는 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth를 같은 시간축으로 붙인 것이다.

읽는 법

· 상상(중·우)이 그럴듯하게 팔·물체·테이블을 그리는데 실제(좌)에서 과제가 안 되면 → 인식·생성이 아니라 제어(액션) 문제.

· depth(우)에 팔 실루엣과 근/원 구조가 나오는 것으로 4D 생성 자체는 살아있음을 확인.

태스크별 대표 사례 (전부 실패)

BananaInBowlTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
BananasInBinOneMoreTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
BlockStackingOrderAgnosticTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
BlockStackingSpecifiedOrderTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
CookingPickPastaToolTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
LargerObjectRaisinBoxInBinTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
MarkerInMugTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
PickUpBluePitcherTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
RedItemsInBinTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
ReorientAllMugsTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
ReorientJugTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth
RubiksCubeLeftOfBowlTask  0/10 (0%)
실패 사례 · 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth

3 실험 조건 / 재현

항목
정책X-WAM pretrained (Wan2.2-TI2V-5B, 5,800h; DroidRelIK 7D action, decouple 10 step)
시뮬RoboLab @ IsaacSim 5.0 / IsaacLab 2.2.0, 카메라 WRIST_LEFT_RIGHT_HEAD
태스크 세트SUITE_STANDARD 15개 (cosmos와 byte-identical; g2 3개 preempt로 12개 집계)
표본태스크당 10 에피소드 (--num-envs 10)
실행2 GPU × 3 job, --qos=extra (own은 cosmos full-120이 점유), server GPU0 / sim GPU1
액션 브릿지X-WAM 정규화 액션 → metric delta: POS_SCALE 0.05m / ROT_SCALE 0.10rad (튜닝값), proprio=zeros
재현SUITE=standard NUM_ENVS=10 RECORD_IMAGINATION=1 bash scripts/run_robolab_eval.sh
다음 — 0%는 모델 한계가 아니라 액션 브릿지일 가능성이 크다. 성공을 보려면 (1) DROID delta 정규화 stats 확보 또는 스케일 스윕, (2) proprio를 실제 eef_pos/eef_quat로, (3) 프레임/부호 정렬 점검이 선행돼야 한다.