Index
2026-05-12 — Experiment

RoboCasa I2V A14B 첫 본격 LoRA 학습 시도 + Preemption

EgoX v2 (exp3) | Wan 2.2 I2V A14B | scripts/run_robocasa_i2v.sh

TL;DR

2
PREEMPTED 횟수
15h 32m
HCPT 학습 실행
11h 22m
RGB-only 학습 실행
COMPLETED
캐시 빌드(1091/1092)

1 배경 / 목적

Phase A(T2V smoke), Phase B(I2V A14B 마이그레이션 + smoke), Phase C(latent cache 3-way split)가 순차적으로 완료됐다. Phase D는 8-GPU DDP로 실제 LoRA fine-tuning을 진행하는 단계다. latent cache가 미리 빌드되어 있으면 학습 시작 시 eager precompute 없이 바로 학습에 들어갈 수 있다.

선행 조건 충족: RGB latent cache 빌드 (job 1091, 2h57m, COMPLETED) + PT latent cache 빌드 (job 1092, 3h51m, COMPLETED). 전체 RoboCasa 학습 데이터셋의 cache가 NAS에 준비됨.

2 작업 내용

캐시 빌드 (선행)

# RGB cache 빌드 (job 1091) sbatch --gres=gpu:8 -c 112 --mem 800GB --qos=extra \ accelerate launch --config_file configs_acc/8gpu.yaml \ scripts/build_robocasa_latent_cache.py \ --config configs/robocasa_i2v.yaml --mode rgb # → COMPLETED (2:57:33) # PT cache 빌드 (job 1092, share QOS로 병렬 실행) sbatch --gres=gpu:8 -c 112 --mem 800GB --qos=share \ ... --mode pt # → COMPLETED (3:51:21)

HCPT 본격 학습 제출 (job 1164)

# HCPT (RGB + PT, 2×2 grid) 학습 sbatch --gres=gpu:8 -c 56 --mem 800GB --qos=extra \ bash scripts/run_robocasa_i2v.sh # config: configs/robocasa_i2v.yaml # LoRA rank=64, boundary_ratio=0.875 (A14B dual-expert) # → PREEMPTED (15:32:40)

RGB-only 재시도 (jobs 1170, 1174)

# job 1170: CONFIG 환경변수 전달 방식 오류 sbatch ... CONFIG=configs/robocasa_i2v_rgbonly.yaml bash scripts/run_robocasa_i2v.sh # → CANCELLED by 0 (0:30:31) — env var 위치 문제로 config 미적용 추정 # job 1174: 올바른 전달 방식으로 재제출 sbatch ... bash scripts/run_robocasa_i2v.sh CONFIG=configs/robocasa_i2v_rgbonly.yaml # → PREEMPTED (11:22:25)

학습 config 핵심 파라미터 (configs/robocasa_i2v.yaml)

backbone: Wan 2.2 I2V A14B (dual-expert MoE) lora_rank: 64 boundary_ratio: 0.875 # 첫 87.5% transformer, 마지막 12.5% transformer_2 layout: HCPT (2×2 grid — RGB row + PT row) resolution: 432×(512+512) per row training_steps: (config 기준, 확인 필요) optimizer: AdamW qos: extra (preemptible)

3 결과

Job IDConfigQOS실행 시간State비고
1091robocasa_i2v.yaml --mode rgbextra2h 57mCOMPLETEDRGB cache 빌드 완료
1092robocasa_i2v.yaml --mode ptshare3h 51mCOMPLETEDPT cache 빌드 완료
1164robocasa_i2v.yaml (HCPT)extra15h 32mPREEMPTED첫 본격 HCPT 학습
1170robocasa_i2v_rgbonly.yamlextra0h 30mCANCELLEDCONFIG env var 전달 오류 추정
1174robocasa_i2v_rgbonly.yamlextra11h 22mPREEMPTEDRGB-only 재시도
Preemption 패턴: 두 학습 job 모두 extra QOS로 제출됐고, 15h와 11h 실행 후 다른 사용자의 own job이 들어오면서 CANCELLED됐다. 5분 grace period가 있으므로 마지막 체크포인트는 preemption 직전까지 저장됐을 가능성이 있다.
실제 loss 수치 미확인: SLURM 메타데이터만으로는 step 수, loss 값, 저장된 체크포인트 경로를 확인할 수 없음. slurms/ 디렉토리의 output 파일을 직접 확인해야 한다.

4 Takeaway

의미

Phase A→C가 완료된 시점에서 실제 학습이 시작됐다는 것 자체가 중요한 이정표다. 15h와 11h가 정상 실행됐다는 것은 코드와 데이터 파이프라인에 치명적 버그가 없다는 간접 증거다 — latent cache 미스, OOM, NaN 발산이 있었다면 수 분~수십 분 내 crash가 났을 것이다. extra QOS 특성상 preemption은 예상된 결과이며, 문제는 resume 전략의 부재다.

5 Next Steps

즉시: 체크포인트 확인

jobs 1164, 1174의 output 파일(slurms/*.out)에서 마지막 저장 step과 loss 값 확인. checkpoint 디렉토리(results/robocasa_i2v/)의 최신 파일 timestamp로 저장 여부 검증.

Resume 전략 선택

옵션 A: sbmr 5 "bash scripts/run_robocasa_i2v.sh" --gres=gpu:8 -c 56 --mem 800GB --qos=extra — 자동 재시도(최대 5회), preemption 발생 시 마지막 checkpoint에서 resume. 코드에 --resume_from_checkpoint latest가 설정돼 있는지 확인 필요.

옵션 B: --qos=own으로 제출해 preemption 없는 환경 확보. 단, own quota(8 GPU)를 독점하므로 팀 내 조율 필요.

HCPT vs RGB-only 우선순위 결정

job 1164(HCPT)이 15h 실행됐는데 PT view2 outlier 버그(context.md 기재)가 학습에 영향 줬을 가능성 있다. RGB-only(job 1174)로 baseline 수렴을 먼저 확인한 뒤 HCPT로 전환하는 순서가 안전할 수 있다.