Index
2026-05-08 ~ 2026-05-10 — Engineering

Sealed RoboCasa MG-30 Per-task Preprocessing 2차 배치 완료

VGGRPO | preprocess_robocasa_task.sh | jobs 313–316 COMPLETED (11–13h each)

TL;DR

4
완료 tasks
~11.5h
평균 소요
10
잔여 tasks
14
1차 배치 실패

1 배경 / 목적

DA3-v2 sealed data 3-track ablation (Any4D / DA3-v1 / DA3-v2-sigmoid)에 쓰이는 RoboCasa v0.1 216×384 depth sealed 데이터셋의 per-task preprocessing cache 생성. scripts/preprocess_robocasa_task.sh가 task별 demo HDF5를 읽어 cam-calibration .npz를 생성하고, 이후 train_lgm_robocasa_da3_v0.sh가 이 cache를 읽어 학습에 사용한다.

배경: sealed data는 randomize_cameras=False로 고정 cam 파라미터를 보장. 1차 배치 실패로 microwave/drawer 4개 task만 2차에 완료됨. PnP/sink/stove/doors/coffee 계열 10개 task는 재제출 대기 중.

2 작업 내용

1차 배치 실패 원인 분석

1차 배치(jobs 161–182)는 --gres=gpu:1 -c 18 --mem 200GB --qos=extra로 제출됐다. DefCpuPerGPU=8이고 per-GPU hard limit은 14 CPU(own QOS 기준)이므로, -c 18은 자원 할당을 받아도 스케줄러 측에서 제약을 받을 수 있는 설정이다. extra QOS 특성상 다른 own job 도착 시 5분 grace 후 CANCELLED. 실제로 jobs 161–182의 대부분이 27~28분 후 CANCELLED by 10010 (SLURM admin cancel)으로 종료됐다.

1차 배치 (실패): sbatch --gres=gpu:1 -c 18 --mem 200GB --qos=extra ... preprocess_robocasa_task.sh 결과: 14개 CANCELLED (27–28min), 2개 PREEMPTED (19~21min), 2개 COMPLETED (27s — 이미 캐시 있는 task) 2차 배치 (성공): sbatch --gres=gpu:1 -c 14 --mem 200GB --qos=extra ... preprocess_robocasa_task.sh 결과: 4개 COMPLETED (10h41m ~ 13h15m)

2차 배치 제출 스크립트 패턴

sbm "bash scripts/preprocess_robocasa_task.sh \ /home/nas_main/taewoongkang/Datasets/robocasa/v0.1_216x384_depth_sealed/\ single_stage/kitchen_microwave/TurnOffMicrowave/mg/.../demo_216x384_depth.hdf5" \ --gres=gpu:1 -c 14 --mem 200GB --qos=extra

각 task별로 독립 job 제출. -c 14로 수정해 own-job hard limit(14 CPU/GPU) 내로 맞춤.

3 결과

2차 배치 완료 현황 (jobs 313–316)

Job IDTaskStateElapsed
313kitchen_microwave/TurnOffMicrowaveCOMPLETED11:08:45
314kitchen_microwave/TurnOnMicrowaveCOMPLETED10:56:27
315kitchen_drawer/OpenDrawerCOMPLETED10:41:51
316kitchen_drawer/CloseDrawerCOMPLETED13:15:56
per-task 소요 시간: 10h41m ~ 13h15m. CloseDrawer가 가장 오래 걸림 (demo 수 차이 가능성). 평균 약 11.5h/task.

1차 배치 실패 현황 (jobs 161–182)

StateCountElapsed (approx)Tasks
CANCELLED by 100101020~28 minTurnOnMicrowave, TurnOffMicrowave, OpenDrawer, CloseDrawer, PnP계열 6개
PREEMPTED419~21 minTurnOnStove, TurnOffStove, CloseSingleDoor, OpenDoubleDoor
COMPLETED227 secCloseDoubleDoor, OpenSingleDoor (이미 캐시 존재)

전체 preprocessing 현황 (sealed MG-30)

카테고리Tasks상태
kitchen_microwaveTurnOffMicrowave, TurnOnMicrowaveCOMPLETED (jobs 313–314)
kitchen_drawerOpenDrawer, CloseDrawerCOMPLETED (jobs 315–316)
kitchen_doors (일부)CloseDoubleDoor, OpenSingleDoorCOMPLETED (캐시 기존 존재)
kitchen_pnpPnPStoveToCounter, PnPCounterToStove, PnPSinkToCounter, PnPCounterToSink, PnPCounterToCab, PnPCabToCounter, PnPMicrowaveToCounter미완료 — 재제출 필요
kitchen_sinkTurnSinkSpout, TurnOnSinkFaucet, TurnOffSinkFaucet미완료 — 재제출 필요
kitchen_stoveTurnOnStove, TurnOffStove미완료 — 재제출 필요
kitchen_doors (일부)CloseSingleDoor, OpenDoubleDoor미완료 — 재제출 필요
kitchen_coffeeCoffeeServeMug, CoffeePressButton, CoffeeSetupMug미완료 — 재제출 필요
잔여 규모: 약 13개 task 미완료. per-task ~11.5h 기준으로 단순 직렬 시 약 150h. 병렬 제출하면 GPU 1개씩 13개 job 동시 제출 가능 (own quota 여유 시).

4 Takeaway

CPU 할당 초과가 1차 배치 전량 실패 원인

-c 18DefCpuPerGPU=8 기준 2.25배, own QOS hard limit인 14 CPU/GPU의 약 1.29배로 초과 설정이었다. extra QOS 특성상 own job 도착 시 즉시 CANCELLED 대상이 되며, 실제로 27분 내 전량 종료됐다. -c 14로 수정한 2차 배치는 4개 모두 10–13h 완주했다.

CloseDrawer(13h15m)가 OpenDrawer(10h41m)보다 약 2.5h 더 걸린 이유는 demo 수 차이 또는 시뮬레이션 초기화 비용 차이로 추정되며, per-task 소요 예측 시 최대값 기준(약 14h) 여유를 잡는 것이 안전하다.

5 Next Steps

잔여 13개 task 재제출

2차 배치 동일 패턴으로, -c 14 --mem 200GB --qos=extra. 병렬 13개 동시 제출 가능 (GPU quota 여유 확인 후):

for task_hdf5 in $REMAINING_TASKS; do sbm "bash scripts/preprocess_robocasa_task.sh $task_hdf5" \ --gres=gpu:1 -c 14 --mem 200GB --qos=extra done

잔여 tasks: PnP 계열 7개, sink 3개, stove 2개, doors 2개, coffee 3개 (일부 중복 확인 필요).

preprocessing 완료 후 DA3 3-track 학습 재시작

sealed data 3-track ablation (Any4D / DA3-v1 / DA3-v2-sigmoid)은 step ~12.6K (Any4D), ~7.8K (DA3-v1), ~9.75K (DA3-v2) 진행 중. preprocessing cache가 완성되면 extended task set으로 재학습 옵션이 열림. 현재 학습 중인 트랙에는 영향 없음 (기존 cache 사용 중).