phaseB_7500.pt. 남은 목표: 50K steps 중 7,800 완료(15.6%)DA3(Depth Anything 3, paper 2511.10647) backbone + paper § 3.2 5-term loss(v2)를 RoboCasa 24개 single-stage task 전체에 대해 학습하는 것이 목표. 이전 주(260504–260510)에 3-track ablation(1-task 기준)을 완료하고 lossv2 구현 검증을 끝냈으며, 이번 주부터 full-scale sealed 데이터 24-task 학습을 시작했다.
전 주까지 3-track 12K step ablation에서 sealed 1-task 기준 loss가 약 0.25 수준으로 수렴하는 것을 확인했다. 24-task 전체 학습은 데이터 다양성과 도메인 커버리지를 높여 Phase 2 RL reward로 활용 가능한 geometry 예측 품질을 높이기 위함.
experiments/lgm_robocasa_da3_v0_lossv2_0511_0254 (May 11 02:54 시작). 24개 HDF5 파일 × 3,000 demo = 72K demo 총합.
train_lgm_robocasa_da3_v0.sh는 experiments/에서 lgm_robocasa_da3_v0_lossv2_* 패턴의 최신 디렉토리를 자동 탐지하고 최신 phaseB_N.pt ckpt에서 재개한다.
preemption 후 동일 스크립트를 재제출하면 중단 시점 직전 저장된 ckpt에서 자동으로 이어받는 구조.
단, save_every=500이라 preemption 시점에 따라 최대 499 step을 재학습해야 한다.
| Job ID | 시작 | 종료 | 실행 시간 | 재개 step | 도달 step | 상태 |
|---|---|---|---|---|---|---|
| 1845 | 05-12 14:57 | 05-13 12:41 | 21h 35m | 3,000 | ~7,250 | PREEMPTED |
| 2212 | 05-13 12:42 | 05-13 12:56 | 11m | 7,000 | ~7,000 | PREEMPTED |
| 2223 | 05-13 12:57 | 05-13 13:18 | 11m | 7,000 | ~7,000 | PREEMPTED |
| 2236 | 05-13 13:19 | 05-13 16:44 | 3h 24m | 7,000 | ~7,650 | PREEMPTED |
| 2269 | 05-13 16:45 | 05-13 17:10 | 22m | 7,500 | ~7,500 | PREEMPTED |
| 2285 | 05-13 17:11 | 05-13 18:12 | 59m | 7,500 | ~7,500 | PREEMPTED |
| 2327 | 05-13 18:13 | 05-13 19:51 | 1h 37m | 7,500 | 7,800 | CANCELLED (사용자) |
| Step | Total loss | L_D (depth) | L_M (motion) | L_P (3D point) | L_C (9-DoF) | L_grad |
|---|---|---|---|---|---|---|
| 3,000 | 0.5252 | 0.143 | 0.158 | 0.137 | 0.081 | 0.006 |
| 3,500 | 0.2437 | 0.064 | 0.094 | 0.051 | 0.031 | 0.003 |
| 4,000 | 0.5002 | 0.124 | 0.138 | 0.150 | 0.080 | 0.007 |
| 5,000 | 0.2290 | 0.055 | 0.074 | 0.057 | 0.039 | 0.004 |
| 5,500 | 0.1635 | 0.033 | 0.070 | 0.033 | 0.025 | 0.003 |
| 6,000 | 0.3017 | 0.052 | 0.104 | 0.050 | 0.093 | 0.003 |
| 7,000 | 0.2002 | 0.060 | 0.057 | 0.050 | 0.027 | 0.006 |
| 7,250 | 0.1814 | 0.036 | 0.076 | 0.030 | 0.036 | 0.003 |
| 7,800 | 0.2005 | 0.037 | 0.090 | 0.037 | 0.035 | 0.002 |
job 1845는 21h35m 동안 4K+ step을 진행했으나, 이후 May 13 오전 cluster 혼잡 시간대에는 6회 재시도 중 최장 3h24m에 그쳤다. share QOS는 long-run 학습에 구조적으로 취약 — 50K step 목표에는 안정적인 own/extra 사용이 필수.
sbmr 5 "bash scripts/train_lgm_robocasa_da3_v0.sh" --gres=gpu:4 -c 32 --mem 800GB --qos=extra 로 재시작 — share 대신 extra로 안정성 확보. 현재 phaseB_7500.pt에서 자동 재개.train_lgm_robocasa_da3_v0.py에 배치 내 HDF5 경로 출력 라인 삽입.