EgoX_wan2.2 Experiments

SLURM Job Summary — March–April 2026
~95 Total Jobs
200h+ GPU Hours
2 Running Now
~30% Preemption Rate

Job Status Distribution

COMPLETED
~20
CANCELLED
~25+
PREEMPTED
~12
RUNNING
2
PENDING
2
Variants: wan2.2, wan2.2_long

Key Long-Running Jobs

Job ID Duration State Period Notes
23339 3d 14h CANCELLED Mar 25–29 longest run
31765 2d 15h CANCELLED Apr 4–7
26101 1d 21h CANCELLED Mar 30–Apr 1
28145 1d 19h CANCELLED Apr 1–3
37398 1d+ RUNNING Apr 7 05:04 → current
37649 22h+ RUNNING Apr 7 08:09 → current
20644 1d 0h CANCELLED Mar 20–21
22243 18h CANCELLED Mar 24–25
2 RUNNING 2 PENDING: #38016, #38017 (wan2.2_long)

Training Configuration

Wan 2.2 LoRA Fine-Tuning active
DROID dataset ego+wrist dual-view LoRA training on Wan Transformer
Base model Wan 2.2
Method LoRA fine-tuning
GPU B200 x 8 (FSDP)
Data DROID ~3998 episodes
Batch size per-GPU (memory-limited)
Views ego + wrist dual-view

Phase 1 — High Noise

Noise range σ ∈ [0.7, 1.0]

Phase 2 — Low Noise

Noise range σ ∈ [0.0, 0.7]
Extras gradient clipping enabled

GPU Usage Statistics

200h+ Total GPU Hours
~30% Preemption Rate
1–2h Avg Completed
16 GPUs Occupied
Average training job duration: 12–24h  |  Validation/test runs: ~1–2h  |  Current: 2 jobs × 8 GPU = 16 GPUs

Experiment Phases Timeline

Mar 17–18
Environment setup, initial runs (short, many restarts)
Mar 18–25
Phase 1 training — long runs, preemption issues
Mar 25–Apr 1
Extended training (3d+ runs)
Apr 1–3
Training continuation, collapse debugging
Apr 3
Validation/inference test runs (many short <20min jobs)
Apr 4–7
Long training with collapse fix applied
Apr 7–8
Stable training RUNNING — Jobs #37398, #37649