Daily Progress Report

2026-06-25 Thursday

활성 프로젝트 2개
커밋 0건
SLURM 작업 6건 (RUNNING 1)
GPU 8장 RUNNING (FastWAM)

🎯 오늘의 우선순위

TL;DR

어제 유의미한 진전 2건. VGGRPO에서 off-the-shelf RGB 4-way backbone depth eval 완료(Job 26434, 21분) — VGGT-Ω가 전 metric 1위(AbsRel 0.296)로 reward backbone 후보 확정. Any4D harness 버그도 병행 수정(AbsRel 1.77 → 0.27, 6.6×). viser 3D pointcloud 비교 viewer도 추가 구축.

EgoX_wan2.2_long에서 학습 데이터 소실 오인 상황 해소 — derived export만 삭제였고 원본 생존, Jun 24 symlink 복구로 99,587 train 샘플 전수 복구됨. Phase1(6k/100k) + Phase2(1k/100k) 학습 재개 가능 상태.

커밋 없음. SLURM에서 FastWAM robocasa 학습(Job 25672)이 8 GPU로 1일 14시간 이상 RUNNING 중. EgoX_wan2.2(Phase2), DreamData(Pi0.5 B1/B0) 기존 실험은 상태 확인 필요.

프로젝트별 현황

VGGRPO High
  • off-the-shelf RGB 4-way backbone depth eval harness 구축 (eval_backbones_rgb.py)
  • VGGT-Ω HF gated access 승인(keh0t0 계정), NAS 공유 캐시에 weight(4.58GB) 저장 → worker 토큰 불필요
  • Any4D harness 버그 수정: any4d_tail_forward+dense.value[:,3](LGM wrapper) → native pts3d_cam[...,2]으로 교체. AbsRel 1.77 → 0.27 (6.6×)
  • Job 26434 Full eval (48 clips × 32 frames × 3 cam, 21분, 1 GPU) COMPLETED
  • viser 3D pointcloud 비교 viewer 구축 (scripts/viser_compare.py, login-0:8788)
ModelAbsRel ↓RMSE ↓δ<1.25 ↑δ³ ↑
VGGT-Ω ★ 0.296 0.168 0.747 0.920
VGGT 0.386 0.188 0.711 0.885
Any4D 0.699 0.351 0.617 0.835
DA3 0.776 0.324 0.596 0.830
  • reward path 설계: VGGT-Ω direct-RGB backbone 채택 결정 → Phase 4 RL fine-tuning Plan sub-plan #1 Task 1 (FF submodule) 착수
  • (선택) per-task breakdown 분석 (tmp/eval_backbones_rgb/eval_metrics.json)
  • (선택) viser 정성 관찰이 정량 순위와 일치하는지 확인
EgoX_wan2.2_long Medium
  • 전체 파이프라인 점검: 구현·학습·추론·데이터 상태 전수 확인
  • 데이터 소실 오인 해소 — derived export(EgoX_input) 삭제였고 원본 생존. Jun 24 02:23 symlink 복구
  • dry-load 재검증: train 99,587 / val 2,033 전부 OK (MISS 0)
  • 81f_100k_fixed / 81f_100k_full 심링크 재연결 완료
  • Phase1 high-noise: step 6,000 / 100,000 (6%)lora_step6000.safetensors (4.9GB) 잔존
  • Phase2 low-noise: step 1,000 / 100,000 (1%) → SLURM 38016/38017 Apr 9 preempted
  • 현재 추론 품질: 03-24 생성(step6000 이전) — tail drift 존재(마지막 chunk 품질 붕괴)
  • Phase1 학습 재개: sbmr 10 "bash scripts/final_train_81f.sh" --gres=gpu:8 -c 64 --mem 1600GB --qos=extra — auto-resume이 step6000에서 시작
  • infer_long.sh의 stale --lora_path 수정 후 step6000 추론 1건 실행
EgoX_wan2.2 No Activity
  • Phase 2 학습 Job 37398 RUNNING (2d+ since context), Job 38197 PENDING 상태 — 어제 커밋·문서 변경 없음
  • 81f 학습 context: scene_name 파싱 버그 수정 완료, Phase 2 validation 파이프라인 추가 상태
  • Job 37398/38197 상태 확인 (sjob 37398), loss curve 확인
DreamData (GR00T-Dreams) No Activity
  • Pi0.5 B1 학습 (Job 5588): step 16,000+/20,000 (80%+), loss 0.018, ~12s/step. mid-eval 4 task SR=0%
  • Pi0.5 B0 baseline (Job 5889): PENDING (real heldout 720 ep, B1과 동일 recipe)
  • Pi0.5 ref 트랙 (B0/B1/B2_ref): DAVIAN H50 config 정렬 완료, smoke 후 본 학습 대기 상태
  • State schema-fraud 이슈(260508) 미해결 — B0/B1/B2 재학습 필수
  • Job 5588 완료 확인 및 ckpt 015500/020000 SR 측정
  • ref 트랙 200-step smoke → sbm 본 학습 제출
Graph_VLM No Activity

어제 활동 없음. 마지막 작업: Tier 1 retrieval infra 완료 (query plan 3-bug fix, context 8× 축소). 다음 Tier 2 — visual position attribute + occurrence count + container edges.

EgoX2 No Activity

어제 활동 없음. context.md 없음.

SLURM 작업 현황 (최근 1일)

Job ID 프로젝트 실행 명령 GPU 상태 실행 시간 시작
25672 FastWAM train_zero1.sh 8 robocasa_uncond_7d_1e-4_local (step290k+) 8 GPU ● RUNNING 1-13:59h+ 06-23 19:01
26434 VGGRPO eval_backbones_rgb.sh (4-way full 48clips) 1 GPU COMPLETED 00:21:10 06-24 17:38
26255 FLIPTION ahs_xoutfit.py (batch_full_xoutfit) 1 GPU COMPLETED 05:53:42 06-24 11:26
26226 VGGRPO eval_lgm_3way.sh 1 GPU COMPLETED 00:18:02 06-24 11:25
26074 FLIPTION ahs_batch.py --stage infer paste 1 GPU COMPLETED 01:38:44 06-24 09:33
26433 VGGRPO eval_backbones_rgb.sh (own QOS → CANCELLED) 1 GPU CANCELLED 00:00:00 06-24 17:37