Keh0t0/robocasa_mg30_real_v2 gripper stats q01[6]=-0.9252(정상 -1.000) 버그가 여전히 그대로. python scripts/recompute_stats_action_state.py --repo_id Keh0t0/robocasa_mg30_real_v2 실행 → 200-step smoke → sbmr 5 "bash scripts/launch_pi05_b0_ref.sh" --gres=gpu:4 -c 32 --mem 800GB --qos=extra 순서 그대로 유효. 이게 풀려야 close-task SR=0 원인 검증과 Pi0.5 재학습이 시작된다.launch_pi05_b{0,1,2}_ref.sh + recompute_stats_action_state.py는 260606 디스크 정리 사고로 한 번 소실됐던 이력이 있는 파일들이다. 08-06 복원 이후 이레째 커밋되지 않은 채 그대로다.Robotics/MetaView-action 소속으로 확인). 실질 최종 작업(08-03 DROID GT depth 4-way 검증) 이후 10일째 업데이트 없음.Robotics/X-WAM 완료 잡(260709), 38197은 타 사용자(jooyeolyun/svg-outpainting) PREEMPTED 잡(260710) 소속으로 이미 확인됨 — 둘 다 이 프로젝트 소속이 아니다. Phase 2 학습 실제 재개 여부부터 재검증 필요.lora_step6000.safetensors에서 auto-resume 가능한 상태 그대로 방치 중(문서 최종 갱신 50일 전). 관련 SLURM job(38016/38017) 재제출 없음 확인. tail drift 등 추론 품질 이슈도 미해결.claude/*.md 갱신 0건, 대상 프로젝트향 SLURM 제출 0건. 08-10 이후 최소 3일 연속 0/6 확인 지속 — DreamData의 마지막 실질 작업(08-06)으로부터 벌써 7일째 정지.Keh0t0/robocasa_mg30_real_v2 gripper stats q01[6]=-0.9252, 정상 -1.000)가 7일째 미수정 — 재계산 스크립트는 존재하지만 아직 실행되지 않았다. 복원한 Pi0.5 launch 스크립트 4개도 같은 기간 미커밋 상태로 노출 중(260606 유실 사고 재발 리스크 지속).Robotics/X-WAM: gate_v4d_depth_repa 8GPU 17시간 완주 + ev_a*/ev_b*/ev_d* 1GPU eval batch 20여 건 대부분 COMPLETED, Robotics/MetaView-action: rc_m3f own 8GPU 반복 재실행, Robotics/cosmos: cfgoff-full0~3 isaac-lab 2GPU 배치가 preempt-resubmit 반복, Robotics/tau-0-wm: tau_rc_posttrain 8GPU 신규 착수)에서 작업이 대량 처리됐고, 지금도 cfgoff-full0(job 78492)·cfgoff-full1(job 78493)·cfgoff-full2(job 78688, Robotics/cosmos)와 tau_rc_posttrain(job 78541, Robotics/tau-0-wm, 8GPU)이 RUNNING 중이다 — 전부 대상 6개 프로젝트 범위 밖.q01[6]=-0.9252(정상 -1.000) 미수정. 복원 스크립트 4개 여전히 uncommitted.
lora_step6000 LoRA에서 auto-resume 가능하나 미실행 지속. tail drift 등 추론 품질 이슈 미해결.
Robotics/X-WAM 완료 잡(260709) / 타 사용자(jooyeolyun/svg-outpainting) PREEMPTED 잡(260710)으로 확인 — 127일째 미수정. Phase 2 학습 실재 여부부터 재검증 필요.
| Job ID | 프로젝트 | 실행 명령 | GPU | 상태 | 실행 시간 | 노드 |
|---|---|---|---|---|---|---|
| 대상 6개 프로젝트 범위 내 어제(08-12) 제출된 SLURM 작업 없음 | ||||||
참고: 같은 기간 클러스터에서는 대상 외 프로젝트에서 다수 작업이 처리됐다(대상 6개 프로젝트 범위 밖이라 요약만 기재) —
Robotics/X-WAM: gate_v4d_depth_repa(job 77866, 8GPU, own, 17시간 완주 COMPLETED) + ev_a*/ev_b*/ev_d* 1GPU eval 배치 20여 건(대부분 COMPLETED, 일부 PREEMPTED/CANCELLED 재시도) + gate_v4d_eval(job 78278/78297/78298/78375, 반복 PREEMPTED·CANCELLED 후 소형 eval로 분할 성공);
Robotics/MetaView-action: rc_m3f(job 77966→78509→78514→78665, own 8GPU, 최종 07:59:12 COMPLETED + postrun 완료);
Robotics/cosmos: cfgoff-full0~3(job 78401-78403/78424/78492-78495/78507/78512, isaac-lab 2GPU 컨테이너, share·extra QOS 반복 PREEMPT-재제출);
Robotics/scene_bench: egress 프로브 2건(job 78417/78419, CPU-only);
Robotics/tau-0-wm: tau_rc_posttrain(job 78541, 8GPU, extra, RUNNING 신규 착수, 06:55 시작).
지금 이 시각 RUNNING 중: cfgoff-full0(job 78492, 13시간+), cfgoff-full1(job 78493, 13시간+), cfgoff-full2(job 78688, 재제출본, 2시간40분+, 전부 Robotics/cosmos), tau_rc_posttrain(job 78541, Robotics/tau-0-wm, 2시간+). 대상 6개 프로젝트(DreamData/EgoX2/EgoX_wan2.2/EgoX_wan2.2_long/Graph_VLM/VGGRPO) 관련 작업은 sacct·squeue 어디에도 없음.