| 태스크 | X-WAM 성공 | % | 95% CI | 난이도 | 길이 | Cosmos3 |
|---|---|---|---|---|---|---|
BananaInBowlTask | 0/10 | 0% | [0–28] | simple | 50s | 10/10 (100%) |
BananasInBinOneMoreTask | 0/10 | 0% | [0–28] | moderate | 60s | 10/10 (100%) |
BlockStackingOrderAgnosticTask | 0/10 | 0% | [0–28] | complex | 90s | 3/10 (30%) |
BlockStackingSpecifiedOrderTask | 0/10 | 0% | [0–28] | complex | 90s | 0/10 (0%) |
CookingPickPastaToolTask | 0/10 | 0% | [0–28] | simple | 60s | 0/10 (0%) |
LargerObjectRaisinBoxInBinTask | 0/10 | 0% | [0–28] | simple | 30s | 0/10 (0%) |
MarkerInMugTask | 0/10 | 0% | [0–28] | moderate | 40s | 5/10 (50%) |
PickUpBluePitcherTask | 0/10 | 0% | [0–28] | moderate | 30s | 1/10 (10%) |
RedItemsInBinTask | 0/10 | 0% | [0–28] | moderate | 60s | 1/10 (10%) |
ReorientAllMugsTask | 0/10 | 0% | [0–28] | complex | 90s | 0/10 (0%) |
ReorientJugTask | 0/10 | 0% | [0–28] | moderate | 60s | 3/10 (30%) |
RubiksCubeLeftOfBowlTask | 0/10 | 0% | [0–28] | moderate | 30s | 9/10 (90%) |
X-WAM은 action과 video+depth를 함께 생성하는 4D world-action model이라 서버가 "모델이 예상한 미래"를 같이 준다. 아래는 좌=실제 렌더 / 중=X-WAM 상상 RGB / 우=상상 depth를 같은 시간축으로 붙인 것이다.
· 상상(중·우)이 그럴듯하게 팔·물체·테이블을 그리는데 실제(좌)에서 과제가 안 되면 → 인식·생성이 아니라 제어(액션) 문제.
· depth(우)에 팔 실루엣과 근/원 구조가 나오는 것으로 4D 생성 자체는 살아있음을 확인.
| 항목 | 값 |
|---|---|
| 정책 | X-WAM pretrained (Wan2.2-TI2V-5B, 5,800h; DroidRelIK 7D action, decouple 10 step) |
| 시뮬 | RoboLab @ IsaacSim 5.0 / IsaacLab 2.2.0, 카메라 WRIST_LEFT_RIGHT_HEAD |
| 태스크 세트 | SUITE_STANDARD 15개 (cosmos와 byte-identical; g2 3개 preempt로 12개 집계) |
| 표본 | 태스크당 10 에피소드 (--num-envs 10) |
| 실행 | 2 GPU × 3 job, --qos=extra (own은 cosmos full-120이 점유), server GPU0 / sim GPU1 |
| 액션 브릿지 | X-WAM 정규화 액션 → metric delta: POS_SCALE 0.05m / ROT_SCALE 0.10rad (튜닝값), proprio=zeros |
| 재현 | SUITE=standard NUM_ENVS=10 RECORD_IMAGINATION=1 bash scripts/run_robolab_eval.sh |