RoboCasa GT 학습 디버깅(analysis-alignment_normalization_breakdown)에서 Any4D monocular 모델의 구조적 한계가 명확해짐: frame마다 독립적으로 depth scale을 결정하는 monocular 특성상, per-view (s, b) LS fit이 frame마다 흔들린다. eye_in_hand에서 s=1.77~6.49 (3.7× 범위).
Depth Anything 3 (DA3)는 multi-view video를 네이티브 지원. 인코더 후반부에 cross-view alternating attention이 내장되어 있어, per-view alignment 없이 metric scale을 직접 학습한다.
이번 세션에서 내린 결정만 기록. 코드 변경은 없음 — 이유: Any4D 트랙 재현이 우선이고, backbone 교체는 사실상 Phase 2 재시작 비용이므로.
VGGRPO 논문 baseline과의 직접 비교 가능. 현재 RoboCasa GT 학습 진행 중 (job 483). 클린 데이터 도착 후 완주 목표.
논문 baseline과의 차이를 "ablation 항목"으로 명시. prototype 셋업 완료 (260430). 학습은 트리거 조건 충족 후 시작.
| 컴포넌트 | Any4D | DA3 | 변경 규모 |
|---|---|---|---|
| Stitch layer | Layer 7 (DROID/RoboCasa 동일) | Layer 6 (best_layer.json) | 소 |
| Connector | lgm_connector_v2.py | lgm_connector_da3.py | 중 (신규 파일) |
| Phase-B loss | per-view (s,b) + scene_flow | per-clip 1 scale, no scene_flow | 중 (신규 파일) |
| Train script | train_lgm_robocasa_v0.py | train_lgm_robocasa_da3_v0.py | 중 (신규 파일) |
| 입력 해상도 | 294×518 (DINOv2 패치) | 504×504 (DA3 base) | 전처리 변경 |
이번 세션은 결정 단계 — 정량 수치는 DA3 실제 학습 후 산출.
LGM backbone 선택은 단순 정확도 문제가 아니라 supervision signal 설계 전체에 영향을 준다. monocular는 alignment를 끼고 가야 하고, multi-view는 alignment 없이 metric scale을 그대로 쓴다. 이 차이가 phase-B loss 구조, GT 사용 방식, 심지어 GRPO reward signal의 품질까지 달라지게 한다.
두 트랙을 명시적으로 분리해서 다루는 이유: 한 트랙의 결과를 다른 트랙에 적용하면 ablation이 오염된다. "Any4D로 학습했을 때 GRPO 성능"과 "DA3로 학습했을 때 GRPO 성능"은 독립 비교가 가능해야 한다.
클린 데이터셋 도착 → HDF5 경로 교체 → preprocessing 재실행 → 학습 재제출. 트리거 조건 관찰.
LGM 수렴 후 4D reward signal로 GRPO fine-tune. cross-view consistency 메트릭 측정. DA3 전환 트리거 2번 충족 여부 판단.
1) 클린 데이터 확보, 2) stitch search 결과 확인 (이미 완료: best layer=6), 3) LoRA target 검증 (이미 완료: 25.27M trainable), 4) 트리거 조건 충족.
Any4D vs DA3, 동일 데이터/step/메트릭으로 비교. cross-view consistency (각 cam pred depth scale/shape 일관성) 정성 비교. GRPO reward signal 안정성 비교.