archive_*로 rename 후 3개 트랙 동시 fresh start (5636/5637/5640)이전 RoboCasa 학습 데이터(v0.1_216x384_depth/)는 infinity / far-plane 영역이 depth에 그대로 포함되어 있었다. depth_max=5.0 마스킹으로 임시 우회했지만, 유효 depth 비율이 낮아 loss 품질이 저하될 위험이 있었다.
RoboCasa 측에서 clean 버전(sealed)을 제공함에 따라 ∞ depth 제거된 데이터(v0.1_216x384_depth_sealed/)로 전면 재시작. 동시에 loss 설계가 다른 세 트랙(Any4D, DA3-v1, DA3-v2-sigmoid)을 동일 데이터/동일 batch size로 동시 실행하여 공정 비교 ablation을 세팅.
depth_max=5.0 마스크로 우회 → 불완전. Sealed 데이터에서는 마스크가 무해(유효 depth 비율 향상 기대).sealed 데이터셋 경로를 학습/전처리 스크립트 전체에 업데이트 (preprocess_robocasa_pnp_microwave.sh, train_lgm_robocasa_v0.sh, train_lgm_robocasa_da3_v0.sh, train_lgm_robocasa_da3_v0_lossv1.sh). 4개 sbmr 슬라이스(4931+4941+4942+4943)로 병렬 전처리, PREEMPT 다수 발생 후 최종 완료. cam_cache 3000/3000 demos 생성.
scontrol update Dependency=로 수동 제거 후 학습 잡 직접 시작.LATEST 자동 검출이 새 잡으로 향하도록 구 학습 dirs를 archive_* prefix로 rename:
own QOS 한도 8 GPU/user → 2개만 own에 배치, 3번째는 sub partition으로 분리:
| Job | 트랙 | QOS | Launcher | 실험 dir |
|---|---|---|---|---|
| 5636 | Any4D | core-own | train_lgm_robocasa_v0.sh | lgm_robocasa_v0_0504_0352 |
| 5637 | DA3-v1 (자체 loss) | core-own | train_lgm_robocasa_da3_v0_lossv1.sh | lgm_robocasa_da3_v0_lossv1_0504_0353 |
| 5640 | DA3-v2 sigmoid (paper §3.2) | core-on-sub | train_lgm_robocasa_da3_v0.sh | lgm_robocasa_da3_v0_lossv2_0504_0354 |
모두 4 GPU DDP (--gres=gpu:4 -c 56 --mem 800GB), sbmr 5x retry 활성.
| step | total loss | depth | pose | sf |
|---|---|---|---|---|
| 0 | 1.276 | 0.903 | 0.365 | 0.017 |
| 990 | 0.400 | 0.300 | 0.097 | 0.007 |
| 1990 | 0.398 | 0.252 | 0.110 | 0.071 |
| 2000 | 0.332 | 0.258 | 0.067 | 0.015 |
| step | total | depth | ray_origin | ray_dir | rot | trans | scale |
|---|---|---|---|---|---|---|---|
| 1398 | 0.907 | 0.079 | 1.449 | 0.071 | 0.026 | 0.042 | 1.378 |
| 1598 | 1.299 | 0.067 | 2.290 | 0.052 | 0.032 | 0.029 | 1.584 |
| 1798 | 1.341 | 0.060 | 2.414 | 0.042 | 0.025 | 0.028 | 1.749 |
| 1998 | 1.396 | 0.049 | 2.576 | 0.037 | 0.019 | 0.021 | 1.647 |
| 2251 | 0.937 | 0.073 | 1.576 | 0.054 | 0.023 | 0.026 | 1.364 |
| step(approx) | total | L_D | L_M | L_P | L_C | L_grad | scale |
|---|---|---|---|---|---|---|---|
| 500 | 0.478 | 0.057 | 0.180 | 0.134 | 0.106 | 0.003 | 4.40 |
| 536 | 0.518 | 0.073 | 0.236 | 0.114 | 0.092 | 0.003 | 4.29 |
| 610 | 0.715 | 0.094 | 0.327 | 0.142 | 0.147 | 0.005 | 3.25 |
| 736 | 0.234 | 0.036 | 0.098 | 0.055 | 0.043 | 0.003 | 5.16 |
| ~800 | 0.278 | 0.043 | 0.118 | 0.053 | 0.061 | 0.003 | 4.54 |
| 트랙 | step | total loss | 주요 issue | viz 최대 |
|---|---|---|---|---|
| Any4D | 2000 | 0.332 | 없음 (안정 수렴) | step_1300.png |
| DA3-v2 sigmoid | ~800 | 0.374 | sub preemption → 학습 지연 | step_500.png |
| DA3-v1 | 2251 | 0.937 | ray_origin 진동 (1.4~2.6) | step_1300.png |
Sealed 데이터로의 전환은 전처리 레벨에서 성공. 3000 demos cam_cache 완료, 3개 트랙 모두 정상 시작. 초기 2000 step에서 Any4D(0.332)와 DA3-v2(0.374)는 유사한 절대 loss 수준이나, DA3-v1은 ray_origin이 unstable하여 비교 기준으로서 신뢰도가 낮음.
DA3-v1 ray_origin 항이 2000 step에서도 1.4~2.6 사이를 진동하는 것은 per-clip 1-scale alignment의 한계로 보임. LGM connector가 출력하는 ray origin 분포와 GT 간 scale ambiguity가 single scalar로 완전히 해소되지 않는 경우. DA3-v2의 경우 GT-side scale normalization(mean ‖P‖₂)으로 이 문제를 일부 완화하나, scale 변동(3.25~5.16)이 크게 나타나 배치 내 normalization 안정성 평가 필요.
Any4D 안정 수렴은 monocular depth를 쓰므로 scale 개념이 단순(per-clip LS fit만)한 덕분일 수 있음 — 절대적 우위라 결론 짓기엔 아직 이름.