Daily Progress Report

Research Activity — 2026-04-09

DreamData · EgoX2 · EgoX_wan2.2 · EgoX_wan2.2_long · Graph_VLM · VGGRPO
1Commit (24h)
4SLURM Running
1SLURM Pending
2Active Projects

오늘의 우선순위

1
EgoX_wan2.2 — 81f 학습 결과 확인 & 검증 긴급running
어제 scene_name 버그 수정 후 재학습 시작. SLURM 38361/38366 결과가 오늘 중 나올 가능성 높음. outputs_val_81f 정성 평가 + loss curve 확인. Phase 2 validation도 동시에 검증. 81f 학습 안정화가 이후 모든 실험의 전제.
2
VGGRPO — LGM 학습 모니터링 & DROID vs EgoExo4D 결과 비교 running
37398이 1d 23h+ 실행 중. viz/ 확인으로 학습 진행 상황 점검. 선점 빈도 높아 resume 스크립트 상시 대기 필요. DROID vs EgoExo4D 비교가 Phase 3 데이터 전략 결정에 직결.
3
VGGRPO — Aria fisheye 문제 해결 방안 결정 검토 필요
EgoExo4D ego cam(Aria fisheye, fx=150) → Any4D 학습 분포 밖. undistort(간단) vs Fisheye3R/Pow3R(정확) 선택. EgoExo4D 101k 클립 활용 가능 여부를 결정.
4
DreamData — Layout 실험 결과 비교 (A/B/C × T2V/I2V) running
SLURM 38361(layout_B), 38513(layout_C_i2v) 실행 중. 이미 완료된 layout_A, layout_A_i2v, layout_B_i2v, layout_C_i2v 결과 비교 필요. 어떤 layout + 모드 조합이 가장 좋은지 판단해서 다음 스텝 결정.
5
Graph_VLM — gemini-2.0-flash 테스트 + 액션 병합 로직 unblocked
Phase 2 JSON 잘림 문제 해결 가능. 액션 병합 로직은 ~30줄. SLURM 대기 시간에 병행 처리 권장.

SLURM Jobs Overview

현재 Running / Pending (04-09 기준)

JobID프로젝트실행 명령GPUStateElapsedNode
37398EgoX_wan2.2PHASE=2 scripts/final_train_81.sh8RUNNING2d+worker-4
38361DreamDatascripts/train_MG30_layout_B.sh4RUNNING13h+worker-13
38366VGGRPOscripts/resume_lgm.sh4RUNNING12h+worker-3
38513DreamDatascripts/train_MG30_layout_C_i2v.sh4RUNNING~1hworker-12
38197EgoX_wan2.2scripts/final_train_81.sh8PENDING(Resources)

오늘 완료 / 선점 (04-09)

JobID프로젝트실행 명령GPUStateElapsed
38360DreamDatascripts/train_MG30_layout_B_i2v.sh4COMPLETED6h 39m
38362DreamDatascripts/train_MG30_layout_C.sh4COMPLETED0h 02m
38207DreamDatascripts/train_MG30_layout_A_i2v.sh4COMPLETED8h 03m
38016EgoX_wan2.2_longscripts/final_train_81f.sh8PREEMPTED8h 01m
38017EgoX_wan2.2_longPHASE=2 scripts/final_train_81f.sh8PREEMPTED6h 17m
38208DreamDatascripts/train_MG30_layout_C_i2v.sh4PREEMPTED14h 05m
주목: 어제(04-08)부터 preemption 빈도 높음 — 38016, 38017, 38208 모두 선점됨. core partition 경쟁 심화. 192 CPU 잡은 특히 취약 (8GPU 노드 독점). 38197 pending — Resources 부족으로 대기 중.

어제 주요 완료 (04-08)

JobID프로젝트실행 명령GPUStateElapsed
38145GR00T-Dreamsscripts/run_robocasa_convert.sh0COMPLETED5h 39m
38161DreamDatascripts/train_MG30_layout_A_i2v.sh4COMPLETED1h 17m
38163DreamDatascripts/train_MG30_layout_C_i2v.sh4COMPLETED0h 34m
38189DreamDatascripts/train_MG30_layout_A.sh4COMPLETED4h 18m
38019DreamDatascripts/train_MG30_layout_B.sh4COMPLETED3h 41m

프로젝트별 현황

EgoX_wan2.2 HIGH
Wan2.2 기반 EgoX ego-view synthesis. Phase 1 (고노이즈 expert) + Phase 2 (저노이즈 expert) 2-phase LoRA 학습. 81f 데이터셋 지원.

어제 Git 활동 (2026-04-08)

5 files changed — wan_dataset.py, sft_trainer.py, args.py, trainer.py + 81f train scripts
핵심 수정 (3건):
(1) 81f scene_name 버그 — 다른 경로 구조에서 scene_name 추출 실패 → 모든 샘플이 동일 캐시 파일 공유 → training collapse. 경로 파싱 로직 수정으로 각 에피소드 독립 캐싱.
(2) Phase 2 validation — phase1_lora_path 인자 추가, Phase 1 LoRA를 high-noise expert에 로드 후 Phase 2 expert swap 검증.
(3) auto-resume 정렬 버그 — checkpoint 번호가 9999 초과 시 정렬 오류 수정.

오늘 할 일

VGGRPO HIGH
VGGRPO 논문 재구현 — Wan2.1 + Any4D LGM + DROID/EgoExo4D. 4D geometry reward로 ego-view video policy optimization. Phase 2 LGM 학습 중.

어제 Claude 문서 활동 (2026-04-08)

주요 구현 (4건):
(1) Resume 기능 — --resume 인자로 Phase A 완료 후 Phase B만 재시작. SLURM 선점 대비.
(2) EgoExo4D 데이터 로더 — 101,620 클립, ego_GT 448×448 + exo 796×448. entry.json (intrinsics, extrinsics, prompt) 파싱.
(3) NaN 방지 강화 — depth clamp 100m, loss>5.0 backward skip, grad clip 1.0→0.5.
(4) 학습 시각화 — train_log.csv, val_log.csv, viz/loss_curves.png, viz/depth_step_N.png 자동 저장.

Smoke test 결과: Resume step 500 이어서 학습 ✅ / EgoExo4D Phase A mse=0.083, Phase B loss=4.58 ✅
이슈: Aria fisheye(fx=150) → Any4D 학습 분포 밖. undistort 또는 Fisheye3R/Pow3R 필요.

현재 Phase 상태

Phase 0 환경 구축 완료    Phase 1 베이스 모델 검증 완료    Phase 2 LGM Full Training 진행 중 (SLURM 37398, 1d+)

오늘 할 일

EgoX_wan2.2_long PLANNED
EgoX_wan2.2의 long video 확장 — 49프레임 chunk autoregressive inference. condition latent frame으로 temporal consistency 유지.

최근 Git 활동

마지막 커밋 2026-03-10 (약 30일 전). 이후 활동 없음. plan.md와 plan_long_inference.md에 상세 구현 계획 작성 완료 — 구현 미착수 상태. EgoX_wan2.2 81f 학습 안정화 후 병행 착수 권장.

계획 상 미착수 핵심 항목

Graph_VLM MEDIUM
EPIC-KITCHENS VQA — VLM(Gemini) → action triplet 추출 → NetworkX graph → 4축 쿼리 엔진. Phase 1/2 파이프라인 검증 완료.

최근 활동 (04-06 분석 문서 기준)

Phase 1/2 파이프라인 검증 완료. Phase 1: 5/5 씬 설명 성공. Phase 2: 3/5 triplet 추출 성공 (2/5 JSON 잘림 — Gemini 2.5 Flash thinking token 소모 문제). 비용 실측: 10초 구간 ~$0.06, 5분 비디오 ~$1.8.

오늘 할 일 (plan.md 미완료 항목)

DreamData BLOCKED
RoboCasa Multi-View Wan LoRA Fine-Tuning — left/right/wrist 3-view horizontal concat → Wan2.1 T2V LoRA. finetrainers v0.2.0 기반.

최근 Git 활동

Block 원인: Step 1 — RoboCasa 데이터셋 경로 미제공. HDF5 구조 탐색 불가. 경로 확보 즉시 시작 가능 (python h5py 구조 탐색 + 3-view layout A/B/C 시각화 비교).

경로 확보 후 즉시 진행할 항목

EgoX2 INACTIVE
EgoX prior renderer 베이스 레포. EgoX_wan2.2 / EgoX_wan2.2_long 파생 레포의 공통 기반.
최근 커밋: README 업데이트만 (HuggingFace badge, GPU requirements 수정). claude/ 디렉토리 없음. 현재 직접 개발 없음 — EgoX_wan2.2 파생 레포에서 작업 진행 중.