Daily Progress Report

2026-04-10 금요일

기간: 2026-04-09 (어제) · 생성: 2026-04-10 09:00
활성 프로젝트 4
커밋 1
SLURM RUNNING 6
GPU 사용 중 28

오늘의 우선순위

01
DreamData RUNNING ×3
Layout A/B/C I2V v2 학습 중 (4GPU×3). 결과 확인 시 Layout 비교 전체 정리 & MG-100 스케일업 여부 결정
02
VGGRPO RUNNING ×2
LGM v2 재설계 후 train_lgm_v2_full.sh 실행 중 (4GPU×2). loss curve 확인, Phase A alignment 수렴 검증
03
EgoX_wan2.2 RUNNING
Wan2.1 81f Phase 2 학습 중 (8GPU). validation 이미지 및 loss curve 점검. expert swap 정상 동작 여부 확인
04
Graph_VLM TODO
QA 파이프라인 설계 완료. graph_builder.py 구현 착수 or P01_01 300~360s QA 생성 테스트 실행
05
EgoX_wan2.2_long BLOCKED
EgoX_wan2.2 학습 안정화 확인 후 착수. 현재 구현 미착수. 대기
06
EgoX2 탐색
방법론 미확정. VGGRPO geometry reward 연계 가능성 검토 (후순위)
TL;DR
프로젝트별 상세
DreamData High
commit ×1 RUNNING ×3 4GPU×3
Video generation model로 로봇 데이터셋 증강 → VLA few-shot post-training 성능 극대화. Stage 1: Wan2.1 LoRA multi-view layout 비교 (A/B/C × T2V/I2V). 결론: Layout A I2V 최선 확인, v2 학습 전개.
  • Layout A/B/C I2V v2 학습 시작 (38676, 38678, 38795). A/C는 11h+ 진행 중.
  • 추론 비교 완료: I2V(14B) >> T2V(1.3B). 3분할 구조 명확도, GT 일관성 모두 I2V 우세.
  • Layout C T2V 체크포인트 손상으로 재시작 필요 판단.
  • Multi-GPU precompute 재진입 SIGKILL 해결 위한 외부 precompute 스크립트 설계 완료 (VAE/T5/CLIP 1GPU 선처리 → pt 저장).
  • MG-30 데이터 분석: 690 고유 에피소드, ~10,000 클립. Wrist view 학습 부족 원인 = 2/3 비중이 overhead 시점.
  • 38676/38678/38795 학습 결과 확인 → Layout 전체 정성 비교표 작성
  • MG-100 스케일업 여부 결정 (데이터 먼저 vs 캡션 먼저 vs 동시)
  • scripts/precompute_embeddings.py 작성 및 Layout A 테스트
  • Layout C T2V 체크포인트 삭제 후 재시작 스크립트 준비
  • Wrist view 캡션 세분화 방안 구체화 (VLM per-clip captioning 비용 산출)
8533de4 Add I2V training, external precompute, and overfit experiments 04-09 15:37
VGGRPO High
CRITICAL FIX RUNNING ×2 4GPU×2
VGGRPO 재구현: 4D geometry reward(LGM)로 video diffusion의 3D consistency 강화. 어제 근본적 설계 오류 발견 → 즉시 재설계.
  • Critical 설계 결함 발견: exo+wrist를 하나의 VAE latent에 넣고 있었음. VAE는 단일 카메라 temporal coherence 가정 → multi-camera 혼합은 latent 무의미.
  • 추가 결함: T_lat=1 (4프레임 입력)로 temporal 정보 전부 손실. 모든 view가 동일 feature에서 나옴.
  • 지금까지 모든 LGM 학습 결과(Phase A mse=0.003 포함) 전부 무효.
  • 재설계 완료: 카메라별 독립 VAE → temporal upsample 먼저(VIST3A 방식, 16ch) → Conv3d → 49 views/cam × 2 = 98 views Any4D 입력.
  • train_lgm_v2_full.sh v2 재시작 (38796, 38815).
  • 38366 (구버전 resume_lgm.sh) 캔슬.
  • 38796/38815 loss curve 확인 → Phase A MSE 수렴 여부 검증
  • exo_t0 pose ≈ identity 확인 (Any4D reference view 정상 여부)
  • wrist vs exo pointcloud가 같은 3D 공간에 정합되는지 viser 시각화
  • Aria fisheye 문제 결정: undistort vs Fisheye3R/Pow3R
  • 메모리: batch=1 기준 130-160GB 예상 → gradient checkpointing 필요 여부 확인
EgoX_wan2.2 Medium
RUNNING 8GPU PENDING ×1
EgoX를 Wan 2.2 base model로 업그레이드. 2-Phase LoRA (고노이즈/저노이즈 expert). 현재 Wan2.1 81f 학습 중 (38813), Wan2.2 PENDING 대기.
  • context.md 업데이트. 38813 (Wan2.1 final_train_81_wan21.sh, 8GPU) 실행 중.
  • 38814 (Wan2.2 final_train_81.sh) PENDING — Resources 대기.
  • 81f training collapse 버그 수정(260408) 이후 학습 안정 진행 중.
  • 37398 (2일+ 실행 중이던 job) 2026-04-10 00:21:40에 CANCELLED by admin.
  • 38813 loss curve 및 validation 이미지 확인 (ego+wrist 생성 품질)
  • Phase 2 expert swap 정상 동작 여부 검증
  • 38814 PENDING 해소 시 Wan2.2 vs Wan2.1 비교 계획 수립
  • 81f 하이퍼파라미터 튜닝 여부 판단 (LR, rank)
Graph_VLM Medium
docs ×3 GPU 불필요
Egocentric 비디오에서 시공간 그래프 자동 구축 → long-term memory 기반 VQA. Gemini → Scene Graph → NetworkX. EPIC-KITCHENS 데이터.
  • VQA 태스크 카테고리 설계 완료: EM1~5 (에피소딕 메모리) + T1~6 (시간/인과/집계) 총 11개 카테고리.
  • QA 파이프라인 설계 완료: 60초 구간 분할 → event description → 카테고리×난이도 QA 생성 → cross-segment L3/L4 → 검증.
  • 비용 실측: 10분 영상 QA 생성 ~$0.12 (매우 저렴).
  • 난이도 4단계 정의: L1(단일 프레임) → L2(단일 이벤트) → L3(크로스 이벤트) → L4(전체 영상).
  • todo.md 업데이트: entity resolution, action embedding 일반화, camera clustering 등.
  • P01_01 300~360s 구간으로 Step 2→3-1 QA 생성 파이프라인 테스트
  • graph_builder.py 구현 착수 (structured JSON → NetworkX)
  • Gemini 2.5 Flash JSON 잘림 문제 → gemini-2.0-flash 테스트
  • 연속 동일 액션 병합 로직 구현 (stirring 중복 문제)
EgoX_wan2.2_long Low
BLOCKED 38016/38017 PREEMPTED
  • context.md 업데이트. 38016(2d+), 38017(6h) PREEMPTED 확인.
  • 구현 미착수. plan.md + plan_long_inference.md 계획 문서만 존재.
  • EgoX_wan2.2 학습 안정화 확인 후 착수 예정. 현재 대기.
  • 구현 대상: args.py 인자 추가, sft_trainer.py condition frame 처리, infer_long.py GGA 지원
EgoX2 Low
탐색 중
  • context.md 업데이트. 초기 단계 — render.py 디버깅 수준.
  • 방법론 미확정. 활성 실험 없음.
  • VGGRPO geometry reward → 3D consistency 개선 연계 가능성 구체 검토
  • 실험 계획(plan.md) 작성 (후순위)
SLURM 작업 요약 (2026-04-09 이후)
Job ID 프로젝트 실행 명령 GPU 상태 실행 시간 시작
38676 DreamData train_MG30_layout_A_i2v_v2.sh 4 RUNNING 11h 47m 04-09 21:13
38678 DreamData train_MG30_layout_C_i2v_v2.sh 4 RUNNING 11h 47m 04-09 21:13
38795 DreamData train_MG30_layout_B_i2v_v2.sh 4 RUNNING 9h 04m 04-09 23:56
38796 VGGRPO train_lgm_v2_full.sh 4 RUNNING 9h 00m 04-10 00:01
38815 VGGRPO train_lgm_v2_full.sh 4 RUNNING 8h 24m 04-10 00:36
38813 EgoX_wan2.2 final_train_81_wan21.sh 8 RUNNING 8h 39m 04-10 00:21
38814 EgoX_wan2.2 final_train_81.sh 8 PENDING
38361 DreamData train_MG30_layout_B.sh 4 PREEMPTED 14h 22m 04-09 01:07
38528 DreamData (DreamData training) 4 PREEMPTED 12h 21m 04-09 14:02
38016 EgoX_wan2.2_long train_long.sh 8 PREEMPTED 8h 01m 04-09 04:21
38017 EgoX_wan2.2_long train_long.sh 8 PREEMPTED 6h 17m 04-09 06:05
38366 VGGRPO resume_lgm.sh (v1, 폐기) 4 CANCELLED 15h 03m 04-09 01:47
38599 DreamData (DreamData training) 4 CANCELLED 4h 53m 04-09 16:20
38207 DreamData (DreamData training) 4 COMPLETED 8h 03m 04-08 20:18
38360 DreamData (DreamData training) 4 COMPLETED 6h 39m 04-09 01:07
38513 DreamData train_MG30_layout_C_i2v.sh 4 COMPLETED 1h 14m 04-09 13:52
38638 VGGRPO train_lgm (v1) 4 COMPLETED 4h 21m 04-09 18:37