vanilla_repro 11.0%의 원인은 init이 아니라 batch/epochAGRA(xpeng-robotics)가 WAM에 REPA를 적용해 성과를 냈다는 것을 계기로, X-WAM에 REPA 계열 방법론을 적용하는 연구가 가능한가를 판단하기 위한 조사. 검토한 후보 3개:
AGRA(2606.12217), Spatial Forcing(2510.12276), Geometry Forcing(2507.07982), REPA(2410.06940), MECo-WAM(2607.05468), GEM-4D(2605.22882), GeoAlign(2606.03240), PAIWorld(2606.18375), FLARE(2505.15659), FRAPPE(2602.17259), 3D-IDE(2604.03296), MVISTA-4D(2602.09878), "What Makes Video World Model Latents Action-Relevant"(2606.07687), RynnWorld-4D(2607.06559)
| 항목 | 값 | 근거 |
|---|---|---|
| 백본 | Wan2.2-TI2V-5B — dim 3072 / ffn 14336 / 30 blocks / 24 heads | config.json |
| 블록당 파라미터 | ≈163.6M (self 37.75 + cross 37.75 + ffn 88.08) | 계산 |
| 트렁크 | 30 × 163.6M ≈ 4.91B | 계산 |
| depth branch | ≈1.64B (num_extra_layers=10, 트렁크의 +33%) | 계산 |
| fork 지점 | block 20 / 30 (깊이 67%) | num_layers - num_extra_layers |
| 시퀀스 구조 | [video T·V·H·W | action Ta | proprio Tp] — 단일 시퀀스, action expert 없음 (MoT 아님) | _forward_single L610 |
| depth loss | (depth_pred - gt_depth_latents).pow(2).mean() = clean latent x0 회귀(video/action/proprio는 velocity 회귀) | xwam_runner.py:234 |
| 정책 추론 시 depth | 실행 안 함 — generate(..., run_depth=False) | policy_server.py:206 |
| 설정 | SR | Latency | 초기화 |
|---|---|---|---|
| no depth | 63.0% | 1033ms | Wan2.2 base |
| sequence concat | 68.7% | 1888ms | Wan2.2 base |
| channel concat | 64.2% | 1266ms | Wan2.2 base |
| interleaved (ours) | 67.8% | 1033ms | Wan2.2 base |
| 헤드라인 | 79.2% | — | + 5,800h pretrain |
vanilla_repro(SR 11.0%)가 낮았던 이유를 "pretrained init 누락이 지배적"으로 추정했으나 틀렸다. 그 세팅(Wan2.2 base + RoboCasa only)은 논문 기준 63%가 목표치이므로, 11%의 원인은 global batch 4 (32 대비 1/8) + 데이터 노출 0.27 epoch이다. 연구실 교차검증: dohyunlee의 fastwam-joint RoboCasa = 61%로 같은 밴드.| 후보 | 선점 논문 | 수치 | 상태 |
|---|---|---|---|
| ① WAM에 semantic REPA | AGRA 2606.12217 (6월) Cosmos-Predict-2.5-2B layer 8/28 + DINOv2 cosine | RoboCasa GR1 66.4% (GR00T 대비 +18.8pp) 실기 34→80%, OOD +27~32% | 직격 선점 L8>L15, DINOv2>SigLIP, single>multi-layer까지 ablation 완료 |
| ② WAM에 geometry REPA | MECo-WAM 2607.05468 (7월) — Wan2.2-TI2V-5B(동일 백본)+VGGT PAIWorld 2606.18375 — 멀티뷰 3D-REPA GEM-4D 2605.22882 — geometry DiT 브랜치 | RoboTwin 91.83→92.62 (+0.79) MEt3R 16.84→14.20 (CVA+REPA) DROID 61→81% | 선점 |
| ③ VLA에 video latent REPA | FLARE 2505.15659 (GR00T N1.5) FRAPPE 2602.17259, DINO-WM, VPP | RoboCasa 70.1% | 선점 + 인프라 비용 큼 |
| 논문 | fork 지점 | teacher | loss / weight |
|---|---|---|---|
| REPA (원본) | DiT/SiT 중간층 | DINOv2 | cosine, projector = 3-layer MLP |
| Spatial Forcing | layer 24 / 32 | VGGT | cosine, α=0.5 (α=0→73.2 / 0.5→93.6 / 2.5→86.6) |
| Geometry Forcing | layer 3 / 7 (U-ViT 중간) | VGGT | λ_angular=0.5, λ_scale=0.05 |
| AGRA | layer 8 / 28 (1/3 깊이) | DINOv2 | cosine, λ 미공개 |
| PAIWorld | 선택된 DiT 층들 | Depth Anything 3 | λ=0.5, SmoothL1, token relation distillation |
| MECo-WAM | final-layer 토큰 | VGGT-1B | relational (pairwise distance), action-weighted |
| Spatial Forcing teacher 비교: VGGT 96.9% > DINOv2 94.1% > SigLIP 94.0% | |||
| 진영 | 논문 | 측정하는 것 | 측정 안 하는 것 |
|---|---|---|---|
| 3D 일관성 진영 | PAIWorld, Geometry Forcing, GEM-4D, MVISTA-4D | MEt3R, FVD, SSIM, 3D accuracy | SR = 0편 |
| 표현 정렬 진영 | AGRA, Spatial Forcing, MECo-WAM, GeoAlign, FLARE | Success Rate | 3D 정확도 = 0편 |
논문·프로젝트 페이지 전수 확인 결과 성공률 숫자 0개. action은 입력(action map concat)이지 출력이 아니고 action head도 없다. 코드 미공개("soon").
Future work 3번: "Coupling world model with World Action Model (WAM)"
AbsRel/Chamfer 없음. DPT probe 정성 그림(Fig.4)만 있고 정량 3D 재구성 지표는 보고하지 않음. 멀티뷰 논의도 없음.
gain도 +0.79pp로 노이즈 수준.
| 사실 | 수치 | 출처 |
|---|---|---|
| X-WAM depth 타깃이 기하학적으로 무의미 에피소드×뷰별 min-max, metric 복원 불가, 뷰 간 gain 1.87× | — | claude/260731, 260803 |
| 그런데 SR을 올린다 | +4.8pp (63.0 → 67.8) | X-WAM Table 4a |
| 연구실 Cosmos Policy (고정 [0.05,3.0]m, well-posed) | +7.5pp (60.8 → 68.3) | 내부 EVAL_RESULTS |
이 질문을 물으려면 베이스가 ①액션 출력 ②탈착 가능한 명시적 기하 브랜치 ③멀티뷰 ④공개 + 시뮬 SR을 동시에 갖춰야 한다.
| 후보 | ① 액션 | ② 기하 브랜치 | ③ 멀티뷰 | ④ 공개+시뮬 SR |
|---|---|---|---|---|
| X-WAM | ✅ | ✅ block 20 fork, 추론 시 off | ✅ 3뷰 | ✅ RoboCasa / RoboTwin |
| RynnWorld-4D (2607.06559, 7/7 공개, 동일 Wan2.2) | ✅ IDM head | ✅ RGB-D-Flow | ❌ 단일뷰 | ⚠️ 실기 bimanual |
| TesserAct (CogVideoX-5B) | ⚠️ 별도 IDM | ✅ RGB-D-N | ❌ | ⚠️ |
| Cosmos Policy + depth (연구실 내부) | ✅ | ✅ 6 depth slot | ✅ 동일 3뷰 | ⚠️ 미공개 |
| PAIWorld / Geometry Forcing / GEM-4D | ❌ | ✅ | 일부 | ❌ |
| GR00T / OpenVLA / π0 / Fast-WAM | ✅ | ❌ | 일부 | ✅ |
야생에 이미 3점 사다리가 존재(외적 타당성 팔로 활용 가능):
| 모델 | 백본 | depth 정규화 | metric 복원 | 양자화 |
|---|---|---|---|---|
| X-WAM | Wan2.2-TI2V-5B | 에피소드 × 뷰별 min-max | 불가 | ~6mm |
| Cosmos Policy + depth | Cosmos | 고정 전역 [0.05, 3.0] m | 가능 | 11.5mm |
| RynnWorld-4D | 동일 Wan2.2 | 고정 전역 [0, 5.0] m | 가능 | 19.6mm |
X-WAM ↔ Cosmos Policy는 RoboCasa 동일 3뷰 + 동일 pseudo-RGB VAE 인코딩이고 정규화만 다르다 — 통제변수 정합이 극단적으로 좋은 짝.
후보 3개는 전부 선점됐지만, 선점 논문들이 공통으로 회피한 질문이 남았다: 3D 일관성 진영은 정책이 없어서 SR을 못 재고, 표현 정렬 진영은 기하 GT가 없어서 3D를 못 잰다. 둘 다 가진 곳이 이 프로젝트다 — GT-anchored metric 3D 오차 하네스(DROID)와 RoboCasa 24-task closed-loop SR이 이미 구축돼 있다.
그리고 X-WAM은 연구 대상이 아니라 다이얼이다: 기하 브랜치가 격리·탈착 가능하고, 타깃이 사다리 최하단이라 올릴 방향이 하나뿐이며, 코드·데이터·재현 baseline이 손에 있다. PAIWorld가 아이디어를 가져간 게 아니라 질문의 앞쪽 절반을 대신 풀어준 것에 가깝다 — 그쪽은 "3D 일관성을 어떻게 올리는가"를 풀었고, 자기 손으로는 "그게 control에 쓸모가 있는가"를 물을 수 없다.
| Run | 설정 | 목표 SR | 근거 |
|---|---|---|---|
| A | pretrained_checkpoint: null + use_depth: false8 GPU, global batch 32, 20k step | 61~63% | 논문 63.0 / dohyunlee 61 |
| B | 동일 + use_depth: true | ~67.8% | 논문 Table 4a interleaved |
판정: A가 58~65% → 진행. 50% 미만 → 레시피 진단 우선(REPA는 그 다음).
pretrained ckpt 불필요(교란변수 하나 제거). depth를 끄면 extra_blocks 1.64B가 통째로 빠져 학습 가속 + ckpt 축소.
use_depth: false 경로는 실행 이력이 없다. 로그인 100-step 스모크 필요. 코드상 num_modalities=1이면 extra_blocks/extra_heads가 빈 리스트가 되고 copy_weights_to_extra_blocks는 no-op이 되므로 논리적으로는 안전하나 미검증.