VGGRPO Implementation Plan

Video Generation with Geometry-Rewarded Policy Optimization
10 Phases
3 Completed
30% Progress
Apr 1 Started

Vision

VGGRPO 논문 재구현: video diffusion으로 로봇 비디오를 생성하고, 4D geometry 복원을 통해 물리적 일관성을 측정한 뒤, geometry quality를 reward signal로 사용하여 GRPO policy optimization을 수행한다. 최종 목표는 물리적으로 일관된 로봇 비디오 생성 모델.
Overall Progress 30%
3 of 10 phases done 2 in progress / 5 pending

Phase Checklist

Phase Status Purpose (WHY) Result
Phase 0
환경 구축
done Wan2.1 + Any4D + Flow-GRPO 통합 환경 구축 conda vggrpo 환경 생성, 모든 모델 weight 다운로드 완료, DROID 데이터셋 준비
Phase 1
베이스 모델 검증
done Wan2.1 생성 + Any4D inference가 실제로 동작하는지 확인 33f 480x832 비디오 생성 OK, Any4D depth/pose/flow 출력 정상 확인
Phase 2
LGM 구축
done VAE latent에서 4D geometry를 예측하는 모델 구축 Conv3d connector (2.05M params), gradient flow 확인, smoke test에서 loss 감소 확인
Phase 2.5
LGM 장기 학습
running LGM geometry 품질을 실용 수준까지 확보 25K + 50K step 작업 제출 완료, 1 job RUNNING 상태
Phase 3
Depth Calibration
running Any4D 출력과 DROID GT 좌표계를 정렬 좌표계 분석 완료, pointcloud 정합 실험 필요
Phase 4
Reward Function
pending 4D geometry quality를 scalar reward로 변환 논문 기반 설계 완료, LGM 학습 완료 후 구현 예정
Phase 5
GRPO 통합
pending Flow-GRPO에 4D reward를 연결 Flow-GRPO 코드 분석 완료, reward 교체만 필요
Phase 6
Training
pending GRPO 학습 실행 및 수렴 확인 LGM + Reward 완료 후 시작
Phase 7
Evaluation
pending 정량 평가 (FVD, 3D consistency) 미시작
Phase 8
EgoExo4D 전환
pending 다른 데이터셋(EgoExo4D)으로 적용 범위 확장 데이터 분석 시작 (Apr 7)

Architecture

VGGRPO Pipeline

Text PromptWan2.1 Transformer (LoRA)Denoised Video Latent Wan VAE DecodeGenerated Video LGM = Conv3d ConnectorAny4D Decoder 4D Geometry (depth, pose, scene_flow, Gaussians) Geometry Quality ScoreReward Signal GRPO Policy UpdateBetter Wan LoRA Weights ↺ iterate

Key Technical Specs

LGM Connector
Conv3d k=5x5x5, s=1x2x2, p=2x2x2
2.05M params
Flow-GRPO
LoRA r=32 / a=64
KL beta=0.004, clip eps=1e-3
Any4D
DINOv2 24 blocks → proj 1024→768
Transformer 24 blocks → DPT heads
DROID Pose
Euler XYZ extrinsic
(not axis-angle)

Milestones