preprocess_robocasa_cam.py(3.3s/demo) + robocasa_dataset.py(3-cam loader) + train_lgm_robocasa_v0.py/.sh(4GPU DDP)VGGRPO Phase 2의 핵심은 LGM이 실제로 geometry를 학습하는지 검증하는 것이다. 기존 DROID v3 (pseudo-label) 학습은 Any4D output 자체에 의존하므로 supervision 신호가 약하다. DROID GT v0 (RealSense 2-cam)은 깊이 노이즈/홀이 많아 깨끗한 기준선을 제공하지 못한다.
RoboCasa v0.1 시뮬 데이터는 z-buffer GT depth라 노이즈 0, 3 cam (agentview_left/right + eye_in_hand), 결정론적 pose → LGM이 실제로 geometry를 학습하는지 검증할 수 있는 가장 깨끗한 데이터셋. Camera convention 검증 완료 (별도 카드) 후 본격 파이프라인 구축.
5-mode 비교로 stored 경로 채택 확정 (cross-camera NN 1.41cm, inherent geometry noise로 결론). 별도 분석 카드 참조.
scripts/preprocess_robocasa_cam.py)HDF5 demo 1개당 cam metadata를 .npz로 캐시. env 1번 reset + cam_configs 주입 + per-frame state replay → get_camera_extrinsic_matrix로 T 추출.
src/data/robocasa_dataset.py)scripts/train_lgm_robocasa_v0.py + .sh)DROID gt_v0의 helper를 그대로 import (VAE, LoRA r=32, connector→DINO, any4d tail, pseudo-label, depth align, DDP setup, viz). 주요 신규 구현:
| 항목 | 결과 | 비고 |
|---|---|---|
| 단일 demo 캐시 검증 | mm 단위 일치 | cam_pos [1.3218, -1.9076, 1.82] — viz stored mode와 일치 |
| K 행렬 검증 | 분석식 완전 일치 | agentview fy=187.06, eye_in_hand fy=140.75 |
| 학습 import smoke test | OK | train_lgm_robocasa_v0.py 모듈 로드, main fn 존재 |
| Preprocess (4-way 병렬) | 완료 | 3000 demos × ~3.3s ÷ 4 = ~4h |
| Train job 483 | RUNNING | 5h57m (260430 기준), 4 GPU core-on-sub, 선점 없이 안정 |
학습 결과 수치 (step별 loss, viz)는 job 완료 후 별도 카드로 보고 예정.
이제 LGM 학습 데이터 트랙이 3종이 되었다: DROID pseudo-label (대규모, 신호 약함) / DROID GT RealSense 2-cam (실제, 노이즈 있음) / RoboCasa GT 시뮬 3-cam (노이즈 없음, 도메인 갭 있음). RoboCasa 학습이 수렴하면 connector + LoRA가 실제로 geometry를 학습하는지 가장 명확하게 검증할 수 있다.
또한 robocasa convention 검증 결과(viz_robocasa_alignment.py, stored 경로, K 행렬 공식)는 DreamData 등 robocasa 기반 다른 프로젝트에 직접 재사용 가능하다.
job 483 완료 후 step 100 viz로 LGM pred depth vs Any4D target depth 정합성 확인. depth loss curve와 pose loss curve 확인. 발산 없이 수렴하면 성공 기준 달성.
PnPCounterToMicrowave 1-task 파일럿 성공 시, PnPCounter family 8개 task로 확장. 다양한 scene geometry로 LGM 일반화 능력 테스트.
같은 step 수에서 depth correlation, pose 정확도 비교. 시뮬 노이즈-없는 신호가 실제로 LGM 학습 품질을 높이는지 정량 검증.
RoboCasa로 학습된 LGM을 DROID/EgoExo4D에 적용해 zero-shot depth 추정 동작 확인. domain gap이 geometry 학습 자체를 방해하는지 확인.