VGGRPO Progress

Video Generation with 4D Latent Reward Policy Optimization — Apr 1–7, 2026
7 Days
15 SLURM Jobs
60h+ GPU Time
2.05M LGM Params

Motivation

논문 재구현 목표: video diffusion model(Wan2.1-T2V-1.3B)이 생성한 비디오에서 4D geometry를 복원하고(Any4D), 그 품질을 reward signal로 GRPO에 주입하여 물리적 일관성을 강화한다. 타깃 도메인은 wrist-view 로보틱스(DROID). Flow-GRPO 코드베이스에 reward만 교체하면 VGGRPO로 전환 가능한 구조.

Key Progress

Week Timeline high activity
Apr 1 — Phase 0-1
환경 구축 + 기본 통합 완료
Wan2.1-T2V-1.3B, Any4D, Flow-GRPO 통합. DROID pose가 Euler XYZ extrinsic임을 발견 (axis-angle 아님). VAE latent shape 검증: z_dim=16, 공간 8x 다운샘플, 시간 ~3.7x 다운샘플.
Apr 1 — LGM 구현
Latent Geometry Model: Conv3d Connector
단일 Conv3d connector (kernel 5x5x5, stride 1x2x2, 2.05M params). E2E forward pass 확인, gradient flow 검증 완료. Peak GPU 5.6GB.
Apr 1 — Smoke Test
LGM Smoke Test 성공
Pseudo-label mode: loss 3.54 → 1.81 (5 steps). GT mode: loss 1.23 → 1.06 (5 steps). 학습 동역학 정상 확인.
Apr 3 — Audit
구현 감사: 논문 vs 코드 불일치 발견
Stitching layer가 전체 encoder를 교체하는 방식이었으나, 논문 의도는 부분 교체. 코드를 논문 기술에 맞게 수정.
Apr 3 — Long Training
LGM 장기 학습 제출 (25K + 50K steps)
190 steps로는 geometry 품질 부족. 25K steps, 50K steps 두 가지 학습 SLURM job 제출.
Apr 1 — Blocker 식별
Depth 품질 문제 + 좌표계 Calibration 미완료
Any4D 출력 depth의 절대 스케일 불확실. Pointcloud 정합 실험으로 검증 필요. Any4D ↔ DROID GT 좌표계 정렬이 GT depth/pose 학습의 전제 조건.
Apr 7 — Alternative
EgoExo4D 전환 검토
DROID 대신 EgoExo4D 데이터셋 적용 가능성 분석. 도메인 다양성과 annotation 품질 비교 진행중.

Key Results

Quantitative Summary
2.05M LGM Params
5.6GB Peak GPU
1.81 Pseudo Loss (5s)
1.06 GT Loss (5s)

SLURM Job Summary

4 completed 4 preempted ~6 cancelled 1 running
Total GPU time: ~60h+

LGM Architecture

ComponentSpecNote
ConnectorConv3d, k=5x5x5, s=1x2x22.05M params
VAE Latentz_dim=16Spatial 8x, Temporal ~3.7x
GRPO ConfigLoRA r=32, alpha=64KL beta=0.004
Base ModelWan2.1-T2V-1.3B+Any4D + Flow-GRPO

Loss Trajectory (Smoke Test)

Pseudo-label
3.54 → 1.81
GT mode
1.23 → 1.06

Critical Assessment

Strengths
  1. Flow-GRPO 코드가 reward 교체만으로 VGGRPO 통합 가능 (LoRA r=32/alpha=64, KL beta=0.004)
  2. LGM gradient flow 검증 완료 — E2E 학습 파이프라인 동작 확인
  3. 논문 vs 코드 감사로 stitching layer 불일치 사전 발견 및 수정
Weaknesses
  1. Depth label 품질 불확실 — Any4D metric depth 신뢰도 미검증
  2. 190 steps LGM은 geometry 생성 품질 부족, 장기 학습 결과 대기중
  3. 좌표계 calibration (Any4D ↔ DROID GT) 미완료 — GRPO 진입 전 선결 조건

Takeaway & Next Steps

LGM 기본 구조는 동작 확인. Conv3d connector로 VAE latent에서 depth/pose를 추출하는 파이프라인이 E2E로 학습 가능함을 smoke test에서 검증했다. 하지만 depth 품질(Any4D metric depth의 절대 스케일)과 좌표계 정렬(Any4D ↔ DROID GT)이 선결 과제로 남아 있다. 25K step LGM 학습 결과가 나오면 geometry 품질을 평가하고, pointcloud 정합 실험으로 depth 스케일을 검증한 뒤 GRPO reward 통합에 진입할 예정이다.