Daily Progress

2026-07-10 (금) · 커버 기간: 2026-07-09 (목) 활동
1/6활성 프로젝트
12커밋
10SLURM 작업
~54GPU-h

오늘의 우선순위

TL;DR

프로젝트별 진행 상황

VGGRPO High
4D Latent Reward Policy Optimization — LGM(geometry reward module) 구축 + GRPO RL fine-tuning. 두 개의 병렬 트랙(worktree)에서 동시 진행: 메인 리포(LGM/Phase 2)와 VGGRPO-rl-phase2(RL/Phase 4).
12Commits (RL)
10SLURM Jobs
~54hGPU Time
2Work Docs

어제 한 일

▸ LGM 트랙 (메인 리포, Phase 2)

코드 커밋 없음 — 학습 잡 2개 완주 + 핸드오프 문서 1건.

▸ RL 트랙 (VGGRPO-rl-phase2, Phase 4)

12 commits — GRPO 학습 파이프라인을 하루 만에 신규 구축하고 첫 negative result까지 확정.

analysis-grpo_reward_saturation.md — v0(37375, sde_steps=4/noise=0.7): reward 5 epoch 동안 [0.9723, 0.9741]로 고정, grad_norm은 0으로 수렴. v1(37389, full-SDE 16 steps/noise=1.0, 4× 확률성 증가): group reward_std 0.0013→0.0016로 거의 무변화 — 다양성 lever는 무효. Determinism probe(3회 반복, std=0.00e+00)로 reward 자체가 결정론적임을 확인 → 진짜 reward saturation(플러밍 버그 아님). 원인: 수렴된 14B base model은 SDE noise와 무관하게 이미 일관된 geometry를 생성 → GRPO advantage에 증폭할 신호 자체가 없음. 최종 24-task 서베이(37509, 35 epoch round-robin)에서도 동일 — reward_std 평균 0.0019, 최대 0.0078, 35개 중 1개만 0.005 초과(비재현). PnP/Turn 등 24개 전 task가 균일하게 reward ~0.96, rstd ~0.002.
해석: SLURM 잡 37369→37375→37389→37406→37509는 크래시가 아니라 의도된 진단 실험 — 각 가설(다양성 lever, regime saturation)의 답이 epoch 0~N 안에 나오면 즉시 kill하고 다음 실험으로 전환한 패턴. 커밋 12개의 타임라인과 정확히 일치.

SLURM (VGGRPO)

COMPLETED × 5 CANCELLED × 5

오늘 할 일

무활동 프로젝트

DreamData (+GR00T-Dreams, dreamzero)마지막 커밋 05-08
GR00T-Dreams 문서 260701, dreamzero 커밋 04-19(외부 협업자) — 3개 저장소 모두 무활동
EgoX2마지막 활동 05-19
4개 worktree(exp1/exp2/exp3/rgb) 전부 커밋·문서 없음
EgoX_wan2.2마지막 커밋 04-08
81f collapse 수정 이후 정체, context.md의 "Active Experiments" job 번호는 재사용되어 이미 stale
EgoX_wan2.2_long마지막 활동 04-09
phase1 step6000/100k에서 preempt된 채 재개 대기, step6000 ckpt에서 auto-resume 가능
Graph_VLM마지막 커밋 04-01
~3개월 무활동. Tier 2 그래프 구축(공간 속성/action-chain) 미착수 상태로 정지

SLURM 요약

Job ID프로젝트실행 명령GPU상태실행 시간노드
37231VGGRPOtrain_lgm_robocasa_vggt_v0.sh (STITCH=dino)4CANCELLED00:00:05n10
37232VGGRPOtrain_lgm_robocasa_vggt_v0.sh (STITCH=aggregator)4CANCELLED00:00:00-
37233VGGRPOtrain_lgm_robocasa_vggt_v0.sh (STITCH=dino, cosmos)4COMPLETED04:58:08n11
37234VGGRPOtrain_lgm_robocasa_vggt_v0.sh (STITCH=aggregator, cosmos)4COMPLETED04:00:42n12
37399VGGRPOtrain_lgm_robocasa_vggt_v0.sh (agg2 resumed, IndexError fix)4COMPLETED02:57:41n27
37369VGGRPO-rl-phase2cosmos_ff/train_grpo.sh (smoke)1COMPLETED00:07:45n45
37375VGGRPO-rl-phase2cosmos_ff/train_grpo.sh (v0, sde=4/noise=0.7)1CANCELLED (user)00:48:20n73
37389VGGRPO-rl-phase2cosmos_ff/train_grpo.sh (v1, full-SDE/noise=1.0)1CANCELLED (user)00:10:50n84
37406VGGRPO-rl-phase2cosmos_ff/train_grpo.sh (v2, regime pivot)1CANCELLED (user)01:30:18n87
37509VGGRPO-rl-phase2cosmos_ff/train_grpo.sh (24-task survey, 35 epoch)1CANCELLED (user)03:46:44n86