TL;DR
- 전체 학습 시작: robocasa single_stage 전체 24 HDF5 (23 tasks) 70,267 train demos, 총 ~1,756,700 steps (≈25 epochs)
- Step 20,300 도달 (May 4 09:33, 1.2% 완료): checkpoint-20300 저장, loss 0.02~0.05 범위로 안정
- 25+ PREEMPTED: May 1–3 사이 core-extra / sub QOS 경합으로 반복 선점, sbmr 자동 requeue로 학습 연속성 유지
- 현재 상태: job 5430 RUNNING (May 4 02:37 시작, 조회 시점 기준 ~7h 경과)
1 배경 / 목적
2026-04-27 구현된 Wan T2V 파이프라인의 full-scale 학습 실행. 기존 EgoX2 실험들(exp1/exp2: DROID, EgoExo4D)과 독립적으로 robocasa manipulation domain에서의 2-view RGB + PT 공동 생성 학습 신호를 확보하는 것이 목적.
학습 목표: step 500마다 validation GT vs Pred 비디오로 두 뷰 시간적 일관성 + PT셀 sanity 정성 확인. 1k step 내에 loss 1.0↓ 도달 여부 체크.
Smoke test 완료 (2026-04-30): Robocasa_smoke/ — 4-step, latent shape [1,16,21,54,96] 확인, frame 0 clamp 검증, step 4 validation mp4 생성 완료
2 작업 내용
학습 설정
모델: Wan2.1-T2V-1.3B-Diffusers (LoRA rank 128, target: to_q/k/v/out.0)
데이터: robocasa single_stage 전체 24 HDF5 (23 tasks), 70,267 train / 240 val
→ split: datasets/robocasa_split.json (seed=42, n_val_per_hdf5=10)
해상도: 81×432×768 (F=81, 2×216 height, 2×384 width)
latent → [16, 21, 54, 96]
배치: batch_size=1, grad_accum=1, lr=5e-5, warmup=100 steps
검증: every 500 steps, 2 samples (CoffeePressButton demo_116, demo_147)
Checkpointing: every 100 steps, keep 10
GPU: 4×B200 (core-extra / core-on-sub QOS)
Step당 시간: ~3.8–4.1s
총 steps: ~1,756,700
제출 패턴 (sbmr auto-requeue)
conda activate egoxv2
sbmr 5 "bash scripts/run_robocasa_t2v.sh" \
--gres=gpu:4 -c 56 --mem 800GB --qos=core-extra
# PREEMPTED 시 자동으로 최대 5회 requeue.
# 각 재시작에서 최신 checkpoint로 resume (checkpointing_steps=100).
SLURM 진행 이력 (May 1–4)
| 기간 | Job IDs | 상태 | 특이사항 |
| May 1 22:36 ~ May 2 04:01 | 3491, 3908, 4006 | COMPLETED × 2, PREEMPTED × 1 | 첫 정상 학습 시작. 3491: 1h24m, 3908: 40min COMPLETED |
| May 2 12:07 ~ 21:00 | 4229–4458 | CANCELLED × 4, PREEMPTED × 3 | sub/extra QOS 혼용 시도, 반복 선점 |
| May 2 21:33 ~ May 3 01:25 | 4491–4577 | PREEMPTED × 3, CANCELLED × 1 | 4491: 2h17m로 최장 연속 실행 |
| May 3 01:50 ~ May 4 진행 중 | 4594, 5183, 5363, 5430 | PREEMPTED × 3, RUNNING | 4594: 12h11m (step ~10-13k), 5183: 2h, 5363: 1h40m, 5430 현재 RUNNING ~7h+ |
3 결과
학습 진행률 (May 4 09:33 기준)
Loss 범위 (step 10k~20k)
0.01–0.10
전체 진행률:
Step 0Step 20,300 (현재)Step 1,756,700 (완료)
Loss 로그 샘플 (slurm 출력 기반)
| Step | Loss (샘플) | grad_norm (샘플) | lr | 출처 Job |
| ~10,800 | 0.022, 0.011, 0.025 | 0.007–0.012 | 5e-5 | 4594 |
| ~13,500 | 0.044, 0.012, 0.016 | 0.008–0.068 | 5e-5 | 4594 |
| ~19,200 | 0.044, 0.014, 0.034 | 0.006–0.008 | 5e-5 | 5363 |
| ~19,400~20,300 | 0.035, 0.017, 0.027 | 0.008–0.154 | 5e-5 | 5430 |
주의: 개별 step loss는 배치 내 단일 demo → 분산 큼. 안정적 평균 추이는 tensorboard의 sliding window 확인 필요.
Validation 출력 (step 13,500 기준)
results/Robocasa/validation/step_0013500/
├── CoffeePressButton_demo_116_gt_vs_pred.mp4 (top=GT, bottom=Pred)
└── CoffeePressButton_demo_147_gt_vs_pred.mp4
step_0020000/ 까지 40개 validation checkpoint 생성
정성 평가 보류: GT vs Pred 비디오의 wrist/agentview 일관성, PT셀 XYZ 그라디언트 sanity는 사용자 직접 시청 필요.
Checkpoint 디렉토리 (최근)
results/Robocasa/
├── checkpoint-19400 (May 4 08:33)
├── checkpoint-19500 (May 4 08:39)
├── ...
└── checkpoint-20300 (May 4 09:33) ← 최신
validation/step_0020000/ ← 최신 validation
4 Takeaway
Preemption 대응 평가
May 1–3에 25+ preemption이 발생했음에도 checkpointing_steps=100 (5분~7분 간격) 덕분에 학습 진행이 단절 없이 이어졌다. sbmr의 자동 requeue + conda env 자동 wrap 조합이 실질적인 fault tolerance를 제공함.
가장 긴 단일 연속 실행: job 4594 (12h11m, step ~0 → 13,500). 현재 job 5430이 7h+ RUNNING 중으로 최근 가장 안정적인 구간.
Loss가 step 10k 시점에 이미 0.02–0.05 수준으로 안정 — warmup 100 steps이 지나고 LoRA가 빠르게 task 분포를 학습한 것으로 해석. 그러나 1 epoch = 70,267 step이므로 step 20k는 아직 첫 epoch의 29%에 불과. 충분한 학습 단계를 거쳐야 validation 품질이 의미 있게 평가 가능.
5 Next Steps
- Validation 정성 평가: step_0020000/ mp4 시청 — 두 뷰의 temporal 일관성 (버튼 누르는 경로 보존), PT셀 XYZ 그라디언트 합리성, first-frame과 prediction frame-0 동일성 확인.
- 1 epoch (step 70k) 도달 후 중간 평가: loss curve 추이, 500-step validation 품질 변화 로그. loss plateau 여부로 lr scheduler 변경 (constant→cosine) 검토.
- QOS 안정성 개선: core-on-sub보다 core-extra가 최근 더 안정적인 경향. sbmr 재시도 횟수 5→10으로 늘리거나 longer walltime 파티션 활용 검토.
- tensorboard 모니터링:
results/Robocasa/logs/ — 개별 step이 아닌 rolling mean loss 추이 확인. rgb_loss vs pt_loss 분리 logging이 현재 없음 → 필요 시 추가.
- Phase 2: step 70k (1 epoch) 이후 결과 보고 후 3rd view 추가 / LoRA rank 변경 / lr schedule 조정 등 ablation 진행.