Daily Progress

2026-07-02 (목)  ·  집계 기간: 2026-07-01
2 활성 프로젝트
0 커밋
16 SLURM 작업
3 현재 RUNNING

🎯 오늘의 우선순위

TL;DR

프로젝트별 현황

VGGRPO
High 2 RUNNING 미커밋
Video diffusion GRPO fine-tune → 4D geometry reward 기반 3D-consistent wrist-view 생성  ·  EgoW/VGGRPO
📐 Stitch Layer 확정
Phase 2(LGM 구축) — 260629에 reward backbone을 VGGT-Ω로 확정(AbsRel 0.296, off-the-shelf 4-way 비교 1위)한 직후, 실제 학습 파이프라인 통합을 위한 stitch layer 탐색 완료: aggregator 경로 best layer=2 (MSE 8.2e-3) vs DINOv2 경로 best layer=4 (MSE 1.22e-1, 15배 나쁨) — aggregator stitch가 더 유력한 설계로 확인.

어제 작업 (미커밋)

SLURM ↔ 실험 해석

⚠️ Preempt·재시도 흐름
1GPU stitch 탐색(31896/31897)은 둘 다 DUE TO PREEMPTION으로 취소(eval pass 중간, 각 36분/21분30초 지점) — extra qos 특성상 정상적인 preemption. 재시도(31941/31942)는 완료되어 위 layer 결정을 확보. 4GPU 본학습 스윕(NUM_FRAMES 8×16 × STITCH_TYPE aggregator/dino)에서 NF16 조합은 스모크성(31768 즉시 취소, 31769는 COMPLETED이나 exitcode 1 트레이스백 존재·재확인 필요), NF8 조합(31796/31797)은 3.5시간+ 진행 후 같은 초에 동시 취소(수동 scancel 추정, 재구성 목적) → 이후 31943/31944를 own qos + MAX_STEPS=50000으로 재제출해 현재 안정적으로 RUNNING 중.
Job ID실행 명령상태GPU실행 시간QOS
31768 STITCH_TYPE=aggregator NUM_FRAMES=16 train_lgm_robocasa_vggt_v0.sh CANCELLED400:09:19own
31769 STITCH_TYPE=dino NUM_FRAMES=16 train_lgm_robocasa_vggt_v0.sh COMPLETED*400:07:36own
31796 STITCH_TYPE=aggregator NUM_FRAMES=8 train_lgm_robocasa_vggt_v0.sh CANCELLED403:39:31own
31797 STITCH_TYPE=dino NUM_FRAMES=8 train_lgm_robocasa_vggt_v0.sh CANCELLED403:33:01own
31896 VAE_TYPE=cosmos find_stitch_layer_vggt.sh PREEMPTED100:36:00extra
31897 find_stitch_layer_vggt_dinov2.sh PREEMPTED100:21:30extra
31941 VAE_TYPE=cosmos find_stitch_layer_vggt.sh (재시도) COMPLETED101:00:28extra
31942 find_stitch_layer_vggt_dinov2.sh (재시도) COMPLETED100:34:41extra
31943 STITCH_TYPE=aggregator NUM_FRAMES=8 MAX_STEPS=50000 train_lgm_robocasa_vggt_v0.sh RUNNING (14h+)414:18:10+own
31944 STITCH_TYPE=dino NUM_FRAMES=8 MAX_STEPS=50000 train_lgm_robocasa_vggt_v0.sh RUNNING (14h+)414:17:40+own
*31769는 상태상 COMPLETED이나 로그에 torchrun exitcode 1 트레이스백 존재 — 재확인 필요. RUNNING 2건 최신 로그: agg2 step 18100(loss 2.91), dino4 step 14000(loss 2.11) — 둘 다 noisy, 뚜렷한 수렴 신호 아직 없음.

오늘 할 일

DreamData
Medium 1 RUNNING 미커밋
Action label 없는 비디오로 로봇 학습 — DreamGen 파이프라인 (IDM pseudo-action 역추정 → Cosmos-Predict2 비디오 생성 → policy fine-tune)  ·  Robotics/DreamData
🔧 파이프라인 검증 → 본학습 가동
IDM 트랙은 latent-multistream 107mm까지 개선 완료, Cosmos 14B 학습으로 전환 중. 어제 4GPU dry-run(3건, max_iter=10) → CPU 전처리(prepare_robocasa_for_cosmos.py) → T5 임베딩 → 8GPU 본학습 순서로 파이프라인 전체를 검증하고 실제 가동까지 완료.

어제 작업 (미커밋)

SLURM ↔ 파이프라인 흐름

Job ID실행 명령상태GPU실행 시간QOS
31927 run_cosmos_train_robocasa_mg30_14b_droid_4gpu.sh max_iter=10 (dry-run) COMPLETED400:00:56extra
31930 run_cosmos_train_robocasa_mg30_14b_droid_4gpu.sh max_iter=10 (재시도) COMPLETED400:00:25extra
31933 run_cosmos_train_robocasa_mg30_14b_droid_4gpu.sh max_iter=10 (재시도) COMPLETED400:05:59extra
31938 prepare_robocasa_for_cosmos.py (CPU-only 전처리, 30 workers) COMPLETED0 (32c)01:56:59extra
31984 run_t5_embeddings_standalone.py (T5 임베딩 생성) COMPLETED100:06:26extra
31988 run_cosmos_train_robocasa_full_14b_droid_8gpu.sh (본학습, max_iter=20000) RUNNING (12h+)812:10:39+extra
흐름: 4GPU dry-run(3건, path-fix+apex제거 검증) → CPU 전처리(2시간) → T5 임베딩(6분) → 검증 통과 후 본학습(31988, extra qos, ckpt pruning 활성). extra qos라 preempt 리스크 있음 — own 여유 시 전환 고려.

오늘 할 일

비활성 프로젝트

EgoX_wan2.2_long
마지막 활동: 2026-06-24 (데이터 복구)
phase1 step6000/100k(6%)에서 학습 중단, 재개 대기. infer_long.sh stale lora_path 수정 필요. tail-drift(마지막 chunk 품질 붕괴) 미해결.
EgoX_wan2.2
마지막 커밋: 2026-04-08
81f training collapse 수정 이후 3개월째 신규 커밋 없음. context.md 기준 job 37398/38197 기록은 4월 스냅샷이라 현재 유효성 불명.
Graph_VLM 2.5개월 정체
마지막 활동: 2026-04-20
Graph V3가 hard 벤치마크(L34hard10)에서 40% vs Describe 20% 우위 확보한 채 정지. Tier 2 그래프 빌드(visual position/occurrence count/container edges) 미착수.
EgoX2
git repo 아님 / claude/ 문서 없음
마지막 활동: 2026-05-19 (44일 전). 실험 산출물 폴더(EgoX2_exp1/exp2/exp3/rgb)만 존재, 코드/문서 관리 인프라 자체 미구축.

SLURM 전체 요약 (2026-07-01)

Job ID 프로젝트 실행 명령 상태 GPU 실행 시간 노드
31768VGGRPO train_lgm_robocasa_vggt_v0.sh (agg, NF16) CANCELLED400:09:191
31769VGGRPO train_lgm_robocasa_vggt_v0.sh (dino, NF16) COMPLETED400:07:361
31796VGGRPO train_lgm_robocasa_vggt_v0.sh (agg, NF8) CANCELLED403:39:311
31797VGGRPO train_lgm_robocasa_vggt_v0.sh (dino, NF8) CANCELLED403:33:011
31824cosmos-predict2.5
(외부 프로젝트)
train_robocasa_mv.sh trainer.max_iter=20 (CP=4) COMPLETED400:01:441
31825FastWAM
(외부 프로젝트)
robocasa_bs1024 — train_zero1.sh 8 (resume) CANCELLED800:34:121
31896VGGRPO find_stitch_layer_vggt.sh PREEMPTED100:36:001
31897VGGRPO find_stitch_layer_vggt_dinov2.sh PREEMPTED100:21:301
31927DreamData run_cosmos_train_robocasa_mg30_14b_droid_4gpu.sh (dry-run) COMPLETED400:00:561
31930DreamData run_cosmos_train_robocasa_mg30_14b_droid_4gpu.sh (dry-run 재시도) COMPLETED400:00:251
31933DreamData run_cosmos_train_robocasa_mg30_14b_droid_4gpu.sh (dry-run 재시도) COMPLETED400:05:591
31938DreamData prepare_robocasa_for_cosmos.py (CPU-only) COMPLETED0 (32c)01:56:591
31941VGGRPO find_stitch_layer_vggt.sh (재시도) COMPLETED101:00:281
31942VGGRPO find_stitch_layer_vggt_dinov2.sh (재시도) COMPLETED100:34:411
31943VGGRPO train_lgm_robocasa_vggt_v0.sh (agg, NF8, MAX_STEPS=50000) RUNNING (14h+)414:18:10+1
31944VGGRPO train_lgm_robocasa_vggt_v0.sh (dino, NF8, MAX_STEPS=50000) RUNNING (14h+)414:17:40+1
31984DreamData run_t5_embeddings_standalone.py COMPLETED100:06:261
31988DreamData run_cosmos_train_robocasa_full_14b_droid_8gpu.sh (본학습) RUNNING (12h+)812:10:39+1
대상 6개 프로젝트 매핑 job은 16건(VGGRPO 10 + DreamData 6). 31824(cosmos-predict2.5)·31825(FastWAM)는 WorkDir 기준 대상 프로젝트 외라 카드/우선순위에서 제외. 현재 RUNNING 3건 기준 점유 GPU: VGGRPO 8장(31943+31944) + DreamData 8장(31988) = 16장.