LGM Redesign · Critical Bug Found

VGGRPO — Weekly Progress

260406-260412 · 4D geometry reward for video diffusion

Commits0
SLURM Jobs~20
StagePhase 2
Old Resultsinvalidated

Research Goal

VGGRPO 논문 재구현: video diffusion model이 생성한 비디오의 3D consistency를 4D geometry reward로 강화한다. LGM(Latent Geometry Model)이 VAE latent에서 직접 depth/pose를 예측하도록 학습한 뒤, GRPO(policy optimization)로 diffusion 자체를 fine-tune해 inference 시 별도 후처리 없이 3D-consistent 비디오를 생성. 최종 목표는 로봇 wrist-view 도메인에서 물리적으로 일관된 ego-view 비디오 생성. 핵심 아키텍처: Wan2.1 + Conv3d connector(2.05M) + Any4D backbone + LoRA r=32.

이번 주 핵심 진전

1. LGM 학습 인프라 안정화 — Resume + Validation + NaN 방지

Why: LGM 학습이 SLURM 시간 제한과 빈번한 preemption으로 끊김. 또한 학습 중 NaN 발산 사례가 누적되어 강건한 학습 루프 필요.

How (260408 작업, claude/260408/progress-resume_and_egoexo4d.md):

Result: Resume smoke test에서 step 500부터 이어서 학습 → loss 유지 확인. 04-09부터 04-13까지 LGM 학습 작업이 ~20개 이상 SLURM에 제출됨 (대부분 PREEMPTED 또는 CANCELLED, 일부 4h~22h 단위 successful run). NaN 발산 사례가 강화된 안전장치로 차단됨.

2. EgoExo4D 데이터 로더 추가 (DROID 대체 옵션)

Why: DROID는 wrist-view 로봇 데이터로 도메인이 좁고, depth GT가 ZED stereo 노이즈가 큼. EgoExo4D는 5,035 takes / 2,792 전처리 클립으로 규모가 크고, Aria glasses + 4대 GoPro로 ego/exo 모두 풍부, 그리고 caption.txt가 이미 존재해서 VLM 캡셔닝이 불필요. LGM의 일반화를 위해 EgoExo4D 옵션이 필요.

How: src/data/egoexo4d_dataset.py 작성. 데이터 경로 /home/nas_main/kinamkim/DATA/EgoX/EgoX_input/81f_100k, 101,620 클립. 각 entry는 ego_GT.mp4(448×448) + exo.mp4(796×448) + entry.json (intrinsics, frame별 ego extrinsics 81×3×4, prompt). --dataset egoexo4d 인자로 선택. scripts/train_lgm_egoexo4d.sh 신규.

Result: EgoExo4D smoke test에서 Phase A mse=0.083, Phase B loss=4.58 동작 확인. 다만 Aria fisheye 도메인 불일치가 새 문제로 발견됨 — Aria ego cam(fx=150)이 Any4D 학습 분포 밖이라 Any4D가 정상 처리하지 못함.

3. Critical design issues 발견 → 근본적 재설계 계획 수립

Why: 04-08~09에 학습 결과를 들여다보다가 두 가지 근본적 문제가 드러남: (1) 서로 다른 카메라(exo, wrist)를 하나의 VAE latent에 함께 넣고 있었음 — VAE는 temporal continuity를 가정하고 학습됐는데 exo+wrist는 시간적으로 연속된 프레임이 아니라 latent 자체가 의미 없음, (2) VAE temporal 압축으로 T_lat=1 — T=4를 쓰면 (T-1)//4+1 = 1로 temporal 정보가 완전히 손실, connector가 4개 view를 만들려 해도 모두 동일 feature에서 나옴.

How: claude/critical_design_issues.md, claude/lgm_redesign_plan.md, claude/coordinate_calibration.md 작성. 재설계 방향:

Result: 코드 변경 자체는 0건이지만, 재설계 plan은 connector / dataset / trainer / loss 4개 파일에 걸쳐 정리됨. 지금까지의 Phase A mse=0.003 / Phase B 결과는 모두 "잘못된 baseline에서 측정된 값"으로 무효 처리.

Strengths & Weaknesses

Strengths

Weaknesses

Takeaway & Next Steps

의미: "LGM이 작동하긴 하는데 wrist view가 어색하다"가 아니라 "LGM이 근본적으로 잘못된 입력을 받고 있었다"라는 진단 전환. 이건 한 사이클 미루는 손실보다 훨씬 큰 정정. 학습 인프라(resume / viz / NaN guard)가 같은 시기에 강해진 덕분에, 재설계 후의 학습 사이클이 빠르게 측정 가능해짐.