Index
2026-08-05 — Research

WAM에 REPA를 적용할 수 있는가 — 경쟁 지형 조사와 살아남은 빈칸

X-WAM | 논문 14편 조사 + 코드 실측 | 방향 결정용

TL;DR

14
논문 조사
3/3
후보 선점
1.64B
depth branch
+4.8pp
depth의 SR 기여
0편
3D↔SR 동시측정

1 배경 / 목적

AGRA(xpeng-robotics)가 WAM에 REPA를 적용해 성과를 냈다는 것을 계기로, X-WAM에 REPA 계열 방법론을 적용하는 연구가 가능한가를 판단하기 위한 조사. 검토한 후보 3개:

후보 ①
WAM에 semantic REPA
→ 3D consistency 향상
후보 ②
Action 쪽에 REPA
→ action이 중요하므로
후보 ③
VLA에 video latent REPA
→ GR00T-N1.7 등
판단 기준: 각 후보가 이미 선점됐는지 확인하고, 선점됐다면 무엇이 남았는지를 특정한다. 추정 대신 arXiv HTML 전문 + 코드 실측으로만 근거를 세운다.

2 작업 내용

A. X-WAM 코드 실측 (추정 배제)

modules/wan_model.py — 아키텍처, depth branch fork 지점, 시퀀스 구조 runners/xwam_runner.py — 4개 loss의 실제 형태 evaluation/policy_server.py — 정책 추론 시 depth branch 실행 여부 checkpoints/wan22_5b/config.json — 실제 dim/layer (Python 기본 인자와 다름)

B. 논문 조사 — arXiv HTML 전문 기준 14편

AGRA(2606.12217), Spatial Forcing(2510.12276), Geometry Forcing(2507.07982), REPA(2410.06940), MECo-WAM(2607.05468), GEM-4D(2605.22882), GeoAlign(2606.03240), PAIWorld(2606.18375), FLARE(2505.15659), FRAPPE(2602.17259), 3D-IDE(2604.03296), MVISTA-4D(2602.09878), "What Makes Video World Model Latents Action-Relevant"(2606.07687), RynnWorld-4D(2607.06559)

3 결과

3-1. X-WAM 코드에서 확정한 사실

항목근거
백본Wan2.2-TI2V-5B — dim 3072 / ffn 14336 / 30 blocks / 24 headsconfig.json
블록당 파라미터≈163.6M (self 37.75 + cross 37.75 + ffn 88.08)계산
트렁크30 × 163.6M ≈ 4.91B계산
depth branch≈1.64B (num_extra_layers=10, 트렁크의 +33%)계산
fork 지점block 20 / 30 (깊이 67%)num_layers - num_extra_layers
시퀀스 구조[video T·V·H·W | action Ta | proprio Tp]단일 시퀀스, action expert 없음 (MoT 아님)_forward_single L610
depth loss(depth_pred - gt_depth_latents).pow(2).mean() = clean latent x0 회귀
(video/action/proprio는 velocity 회귀)
xwam_runner.py:234
정책 추론 시 depth실행 안 함generate(..., run_depth=False)policy_server.py:206
핵심 함의: X-WAM의 depth branch는 배포 시 꺼지는 1.64B짜리 training-time-only auxiliary head이고, loss 형태가 생성이 아니라 표현 probing 회귀다. 구조적으로 REPA와 같은 자리에 있으며 차이는 세 가지뿐 — (i) projector가 3-layer MLP 대신 1.64B DiT, (ii) 타깃이 foundation feature 대신 ill-posed depth의 VAE latent, (iii) loss가 cosine 대신 latent MSE. X-WAM은 이미 REPA를 하고 있는데 가장 비싼 방식으로 하고 있다.

3-2. X-WAM 논문 ablation 세팅 확정 260804 정정

"Due to computational constraints, all ablation variants are fine-tuned directly from the Wan2.2-TI2V-5B weights on the benchmark data without the large-scale pretraining stage." — X-WAM (arXiv 2604.26694)
설정SRLatency초기화
no depth63.0%1033msWan2.2 base
sequence concat68.7%1888msWan2.2 base
channel concat64.2%1266msWan2.2 base
interleaved (ours)67.8%1033msWan2.2 base
헤드라인79.2%+ 5,800h pretrain
260804 추정 정정: vanilla_repro(SR 11.0%)가 낮았던 이유를 "pretrained init 누락이 지배적"으로 추정했으나 틀렸다. 그 세팅(Wan2.2 base + RoboCasa only)은 논문 기준 63%가 목표치이므로, 11%의 원인은 global batch 4 (32 대비 1/8) + 데이터 노출 0.27 epoch이다. 연구실 교차검증: dohyunlee의 fastwam-joint RoboCasa = 61%로 같은 밴드.

3-3. 후보 3개의 선점 현황 — 전부 2026년

후보선점 논문수치상태
① WAM에 semantic REPAAGRA 2606.12217 (6월)
Cosmos-Predict-2.5-2B layer 8/28 + DINOv2 cosine
RoboCasa GR1 66.4% (GR00T 대비 +18.8pp)
실기 34→80%, OOD +27~32%
직격 선점
L8>L15, DINOv2>SigLIP,
single>multi-layer까지 ablation 완료
② WAM에 geometry REPAMECo-WAM 2607.05468 (7월)
Wan2.2-TI2V-5B(동일 백본)+VGGT
PAIWorld 2606.18375 — 멀티뷰 3D-REPA
GEM-4D 2605.22882 — geometry DiT 브랜치
RoboTwin 91.83→92.62 (+0.79)
MEt3R 16.84→14.20 (CVA+REPA)
DROID 61→81%
선점
③ VLA에 video latent REPAFLARE 2505.15659 (GR00T N1.5)
FRAPPE 2602.17259, DINO-WM, VPP
RoboCasa 70.1%선점 + 인프라 비용 큼

3-4. 재현 시 출발점이 될 하이퍼파라미터

논문fork 지점teacherloss / weight
REPA (원본)DiT/SiT 중간층DINOv2cosine, projector = 3-layer MLP
Spatial Forcinglayer 24 / 32VGGTcosine, α=0.5 (α=0→73.2 / 0.5→93.6 / 2.5→86.6)
Geometry Forcinglayer 3 / 7 (U-ViT 중간)VGGTλ_angular=0.5, λ_scale=0.05
AGRAlayer 8 / 28 (1/3 깊이)DINOv2cosine, λ 미공개
PAIWorld선택된 DiT 층들Depth Anything 3λ=0.5, SmoothL1, token relation distillation
MECo-WAMfinal-layer 토큰VGGT-1Brelational (pairwise distance), action-weighted
Spatial Forcing teacher 비교: VGGT 96.9% > DINOv2 94.1% > SigLIP 94.0%
설계 신호: PAIWorld와 MECo-WAM이 독립적으로 둘 다 relational alignment(similarity/distance matrix)를 선택했다. video-DiT feature에 직접 cosine REPA를 거는 것이 불안정하거나 약할 가능성을 시사.

3-5. 살아남은 빈칸 — 지형이 두 진영으로 갈라져 있고 다리가 없다

진영논문측정하는 것측정 안 하는 것
3D 일관성 진영PAIWorld, Geometry Forcing,
GEM-4D, MVISTA-4D
MEt3R, FVD, SSIM, 3D accuracySR = 0편
표현 정렬 진영AGRA, Spatial Forcing, MECo-WAM,
GeoAlign, FLARE
Success Rate3D 정확도 = 0편

PAIWorld에는 정책이 없다

논문·프로젝트 페이지 전수 확인 결과 성공률 숫자 0개. action은 입력(action map concat)이지 출력이 아니고 action head도 없다. 코드 미공개("soon").

Future work 3번: "Coupling world model with World Action Model (WAM)"

MECo-WAM은 3D를 안 잰다

AbsRel/Chamfer 없음. DPT probe 정성 그림(Fig.4)만 있고 정량 3D 재구성 지표는 보고하지 않음. 멀티뷰 논의도 없음.

gain도 +0.79pp로 노이즈 수준.

가장 근접한 선행 = 2606.07687 "What Makes Video World Model Latents Action-Relevant"
SDXL VAE가 PSNR 최고인데 action R² ≤ 0, V-JEPA2는 R² 0.40 → 0.85(+ID) → 픽셀 품질 ⊥ action 관련성 증명. 단 (i) frozen feature probe지 closed-loop SR 아님(저자 스스로 한계 명시), (ii) 기하 축 미검토, (iii) WAM 아님.

빈칸: "world model의 3D 일관성은 control을 사는가?" 픽셀 축은 답이 나왔고 기하 축은 비어 있다.

3-6. X-WAM 자체 데이터가 이미 답을 암시

사실수치출처
X-WAM depth 타깃이 기하학적으로 무의미
에피소드×뷰별 min-max, metric 복원 불가, 뷰 간 gain 1.87×
claude/260731, 260803
그런데 SR을 올린다+4.8pp (63.0 → 67.8)X-WAM Table 4a
연구실 Cosmos Policy (고정 [0.05,3.0]m, well-posed)+7.5pp (60.8 → 68.3)내부 EVAL_RESULTS
주의 — 완전 분리 가설의 반대 신호: well-posed 타깃을 쓴 Cosmos Policy 쪽 gain(+7.5pp)이 ill-posed인 X-WAM(+4.8pp)보다 크다. 백본이 달라 직접 비교는 불가하나, "기하 품질은 무관하다"는 단순한 결론을 그대로 밀 수는 없고 통제 실험이 필요하다는 뜻.

3-7. 왜 X-WAM이 베이스인가 — 후보 전수 비교

이 질문을 물으려면 베이스가 ①액션 출력 ②탈착 가능한 명시적 기하 브랜치 ③멀티뷰 ④공개 + 시뮬 SR을 동시에 갖춰야 한다.

후보① 액션② 기하 브랜치③ 멀티뷰④ 공개+시뮬 SR
X-WAM✅ block 20 fork, 추론 시 off✅ 3뷰✅ RoboCasa / RoboTwin
RynnWorld-4D (2607.06559, 7/7 공개, 동일 Wan2.2)✅ IDM head✅ RGB-D-Flow❌ 단일뷰⚠️ 실기 bimanual
TesserAct (CogVideoX-5B)⚠️ 별도 IDM✅ RGB-D-N⚠️
Cosmos Policy + depth (연구실 내부)✅ 6 depth slot✅ 동일 3뷰⚠️ 미공개
PAIWorld / Geometry Forcing / GEM-4D일부
GR00T / OpenVLA / π0 / Fast-WAM일부
넷을 다 가진 건 X-WAM뿐. 결정적 조건은 ② — 끌 브랜치가 없으면 대체 실험 자체가 불가능하고, 이것이 AGRA·MECo-WAM·Spatial Forcing이 그 질문을 못 물은 구조적 이유다.

야생에 이미 3점 사다리가 존재(외적 타당성 팔로 활용 가능):

모델백본depth 정규화metric 복원양자화
X-WAMWan2.2-TI2V-5B에피소드 × 뷰별 min-max불가~6mm
Cosmos Policy + depthCosmos고정 전역 [0.05, 3.0] m가능11.5mm
RynnWorld-4D동일 Wan2.2고정 전역 [0, 5.0] m가능19.6mm

X-WAM ↔ Cosmos Policy는 RoboCasa 동일 3뷰 + 동일 pseudo-RGB VAE 인코딩이고 정규화만 다르다 — 통제변수 정합이 극단적으로 좋은 짝.

4 Takeaway

의미

후보 3개는 전부 선점됐지만, 선점 논문들이 공통으로 회피한 질문이 남았다: 3D 일관성 진영은 정책이 없어서 SR을 못 재고, 표현 정렬 진영은 기하 GT가 없어서 3D를 못 잰다. 둘 다 가진 곳이 이 프로젝트다 — GT-anchored metric 3D 오차 하네스(DROID)와 RoboCasa 24-task closed-loop SR이 이미 구축돼 있다.

그리고 X-WAM은 연구 대상이 아니라 다이얼이다: 기하 브랜치가 격리·탈착 가능하고, 타깃이 사다리 최하단이라 올릴 방향이 하나뿐이며, 코드·데이터·재현 baseline이 손에 있다. PAIWorld가 아이디어를 가져간 게 아니라 질문의 앞쪽 절반을 대신 풀어준 것에 가깝다 — 그쪽은 "3D 일관성을 어떻게 올리는가"를 풀었고, 자기 손으로는 "그게 control에 쓸모가 있는가"를 물을 수 없다.

어느 결과가 나와도 논문이 된다.
분리 → 4D-WAM 분야 전체가 잘못된 proxy를 최적화 중이라는 반직관적 결과 + 1.64B 브랜치 폐기 근거
상관 → PAIWorld future work #3("WAM과 결합")을 최초 실증

5 Next Steps

즉시 — RoboCasa base 게이트 (arm A/B 겸용, 오버헤드 아님)

Run설정목표 SR근거
Apretrained_checkpoint: null + use_depth: false
8 GPU, global batch 32, 20k step
61~63%논문 63.0 / dohyunlee 61
B동일 + use_depth: true~67.8%논문 Table 4a interleaved

판정: A가 58~65% → 진행. 50% 미만 → 레시피 진단 우선(REPA는 그 다음).

pretrained ckpt 불필요(교란변수 하나 제거). depth를 끄면 extra_blocks 1.64B가 통째로 빠져 학습 가속 + ckpt 축소.

사전 확인

use_depth: false 경로는 실행 이력이 없다. 로그인 100-step 스모크 필요. 코드상 num_modalities=1이면 extra_blocks/extra_heads가 빈 리스트가 되고 copy_weights_to_extra_blocks는 no-op이 되므로 논리적으로는 안전하나 미검증.

남은 불확실성

  • 논문 ablation의 step 수 미공개 — config 기본값 20,000은 릴리스 레시피 값. 다르면 목표치가 이동한다.
  • ablation rollout/task 수 미공개 — arm 비교는 50/task로 통일, 최종만 100/task 권장(50↔100 차이는 실측 −0.5%p).
  • 완전 분리 가설의 반대 신호(§3-6) — Cosmos Policy 축을 확보해야 일반화 반박을 막을 수 있다. junhahyung과 조율 필요.

미해결 설계 결정

  • teacher: VGGT vs Depth Anything 3 vs DINOv2 (Spatial Forcing 기준 VGGT 96.9 > DINOv2 94.1)
  • alignment 형태: 직접 cosine vs relational — 선행 2편이 독립적으로 relational을 선택했다는 점
  • fork 지점: AGRA 8/28(1/3), Spatial Forcing 24/32(3/4), Geometry Forcing 3/7(중간), X-WAM depth fork는 20/30(2/3)
  • action-token 직접 정렬을 ablation으로 넣을지 — monolithic 구조라 구현은 몇 줄이나, proprio가 이미 EE pose를 들고 있어 중복으로 gain 0일 위험