scene_bench — F6(PnP-resume 후 bowl 낙하) 원인 미규명 — 최우선 조사 대상. done-verification 오라클 체크 구현.
MetaView-action — pre-restoration commit(55c1002) 별도 worktree에서 rc_m3f vs rc_m3 생성품질 비교. M1(no-geometry) 순수 대조군 학습 착수.
MolmoBot — FrankaPnP OmniCam part1 660 shards/1.43TB 다운로드 완료 확인 → validate_trajectories.py → ≤100 step 스모크 → 본 학습 제출.
UMI — 저자 응답으로 아티팩트 비공개 확정 — RoboTwin transfer 실험 진행 여부 vs action-제외 video corpus 전용 사용 vs 중단, 결정 필요.
scenemem — context.md 10일째 stale(8/3 기준 job 68392 "진행 중"으로 오기재) — 오늘 나온 4.07x 검증 결과부터 작업 로그·context 갱신 필요.
TL;DR. 14개 대상 중 8개 활성(커밋 23건, SLURM 38건). 가장 큰 수확은 tau-0-wm naive τ₀-VAM RoboCasa 24-task 최종 확정(63.00%, X-WAM released 대비 −12.3pp)과 X-WAM A/B/C/D 4-arm World Forcing 완주(D≈C, geometry 신호 결합은 상쇄 — 샘플 크기가 병목)다. MetaView-action은 3D geometry conditioning 아키텍처를 완전 복원했지만 SR 개선 없음 — cross-attention 경로로 geometry 신호가 action head까지 전파 안 되는 것을 probe_output_sensitivity.py로 확정(부정적이지만 명확한 결론). scene_bench는 하루 만에 20 커밋으로 온라인 하네스 A/B/B2 밸리데이션을 마치고 plan-first 모드를 기본값으로 채택했다. scenemem은 pi0.5 MolmoSpace 15k-step 체크포인트 검증에서 zero-motion 대비 4.07x 개선을 확인했지만 문서화가 밀렸다. cosmos는 CFG ablation(n=1200)에서 guidance 유무 차이 −11.0%p를 통계적으로 확정했고, 2.0/4.0 스윕이 현재 RUNNING 중이다.
프로젝트별 진행 상황
cosmosHigh
NVIDIA Cosmos3 world model을 클러스터에서 실행 가능하게 만들고 RoboLab 시뮬 벤치마크로 X-WAM 등과 비교 가능한 수치 확보.
어제 한 일
커밋 0건 (문서만)
claude/260812/exp-cfg_off_ablation.md · exp (오늘 업데이트 섹션)
CFG(guidance) ablation full-120 완료(n=1200): CFG-off(guidance=1.0) 313/1200=26.1% vs CFG-on(guidance=3.0) 445/1200=37.1%, Δ−11.0%p, CI 비중첩(통계적 유의). 표준 15태스크 서브셋(n=150)에서는 −4.7%p로 구분 불가였던 것이 full-120에서 반전 — 서브셋 편향 확인. 정밀·다물체 태스크(CubesAndBlocksInBin 9→2, RubiksCubeRightOfBowl 8→1 등)에서 특히 붕괴. 결론: CFG-off의 ~2배 추론속도는 26%p 성공률 대가라 실배포는 guidance=3.0 유지. 이후 GPU 절약용 30태스크 보정 서브셋으로 guidance 2.0/4.0 스윕 제출.
A/B/C/D 4-arm World Forcing 완료(24 task × 50 rollout × 4 arm = 4800 rollout): A(no geometry) 61.08%, B(+1.64B depth branch) 66.00%, C(+29M REPA) 64.67%, D(depth+REPA 결합) 64.75%. D≈C(+0.08pp) — depth와 REPA 결합이 오히려 상쇄(D는 B보다 −1.25pp). B−A만 유의(z=2.51), 나머지 pairwise 차이는 SE≈1.95pp 노이즈 안 — 샘플 크기가 병목. 아키텍처 신규 발견: X-WAM의 multi-view는 position encoding에 cross-view geometric 관계가 전혀 없음(단일 학습 임베딩) — C/D의 PnP 약점 유력 원인.
sealed-arena depth rebuild(무한 depth escape-ray 제거용) 과정에서 RGB가 원본 HDF5 그대로 복사돼 escape-ray 픽셀에 RGB/depth 불일치 버그 발견·수정. 실측 손상: 평균 0.94% 픽셀, 최대 31.9%(TurnSinkSpout 22.2% 최악, 이전엔 미샘플). 동시에 수직 flip 방향 버그도 발견·수정. 1,320 episodes/33GB/323,001 clips 재구축, 0 실패 shard. 기존 A/B 결론(66.67% vs 64.00%)은 두 arm이 동일 버그를 공유해 영향 없음 — 단, 재학습 후 절대 SR 값은 이동 예상.
SLURM: COMPLETED ×10CANCELLED ×2 — rc_final(gpu:1) + ab2_pm/ab2_depth 재구축 데이터셋 재학습. 앞 9회는 <1분 내 종료(재구축 반영 재시작 추정), 뒤 2회는 30~42분 만에 취소.
naive τ₀-VAM 최종 결과: 63.00%(756/1200), PnP-8 49.0% / non-PnP 70.0%. 학습곡선: 3k 11.75% → 9k 37.67% → 18k 58.50% → 24k 57.25% → 27k 63.00%(24k→27k +5.75pp, z≈2.9 유의). X-WAM 비교: arm A(base init, no depth) 61.08%와 동급(z≈0.96), arm B(+depth) 66.00%와도 미유의(z≈1.5), 하지만 X-WAM released(pretrain init) 75.33%와는 −12.3pp 명확한 갭. 해석: τ₀ pretrain이 RoboCasa 전이에서 X-WAM pretrain만큼 효과를 못 냄 — X-WAM은 pretrain으로 +14pp를 얻는데 τ₀는 base-init 밴드에 머묾. 인프라 이슈 3건 해결(cu128 NCCL hang 6배 지연, teardown race로 인한 최종 저장 파손, max-step 무한 epoch 버그).
SLURM: posttrain 재시작 CANCELLED ×2PREEMPTED ×3 끝에 COMPLETED(own, gpu:8, 8:09:09) 완주. eval 5건(step 3000/9000/18000/24000/27000v2) 대부분 COMPLETED, step27000 1차 시도는 CANCELLED 후 재실행 완료.
오늘 할 일 / 이슈
TTC 실험 착수(RCS 시뮬레이터를 zmq 브릿지에 이식) — naive 63.0% 대비 이득 측정, τ₀ 논문 핵심 주장 검증
base-Wan init 대조군 실험(arm A 완전 통제 비교)으로 τ₀ pretrain 기여분 분리
필요시 step27k vs armB(66.0) 판별용 100 rollout 재평가(SE 1.4→1.0pp)
τ₀ pretrain의 RoboCasa 전이 효율이 X-WAM 대비 낮은 원인 미해명 — 실로봇 dual-arm rel-eef6d → sim 단일암 raw controller 도메인/액션공간 갭 추정
scene_benchHigh
가정용 로봇을 위한 장기 기억(scene-level memory) 벤치마크 — 다일간 누적 컨텍스트(물건 위치, 사건, 집안 규칙) 회상·행동 테스트.
c40d7a8feat: receptacle-side nav params, inventory artifact filter+297/-27, 6 files
+ 6건 추가 소규모 커밋
exp-ab_experiments_final_run.md · exp
온라인 2단계 하네스(VLM high-level + VLA low-level) split-validation: (A) 스크립트 서브골 π0.5-FT 실행 — navigate→pick(61 step)→carry-navigate 성공, PnP-resume 후 실패 600/600(bowl 낙하, 신규 블로커 F6); (B) VLM(gemini-3.6-flash) 자연어→서브골 분해 — 15 rollout, $1.60, id 정확도 100%, nav→pnp 11/15; (B2) stepwise vs plan-first 비교 — plan-first 승(할루시네이션 19:1, 입력 토큰 −38%) → 온라인 기본값 채택.
analysis-sample_dataset_review.md · analysis
실데이터 샘플 2건(val_136, val_290) 전수 검증 — embodiment는 mobile Franka 11-dim @25Hz 확정. 릴리즈 차단 버그 4건: (1) 이벤트 22%가 grasp 대상과 라벨 불일치, (2) 동일 객체가 target·distractor 동시 등장, (3) 모호 쿼리 답변 중복/모순, (4) 쿼리 13개 중 2개(15%)는 정답이 쿼리 시점에 이미 보임/접근 가능 — 메모리 테스트 무력화. 4건 중 3건은 재시뮬레이션 없이 후처리로 수정 가능.
exp-read_eval_pilot.md · exp
read-phase 메모리 평가 파이프라인 첫 구현 + 2모델 파일럿(n=6): textlog 0.833(양 모델 동일, 게이트 G1 통과 — 메모리가 target-finding에 도움됨 확인). 단, "상식 누출" 발견(blind=0.75 ≫ chance=0.2, axiom A1 위반) — distractor 배치가 반상식적이어야 함.
scenemem 선행 프로젝트가 이미 pi0.5×MolmoSpace 15k step 학습을 완주(final loss 0.0027, ckpt 검증 통과)했음을 확인했으나, 사용자 지시로 해당 결과 미참고 — 공식 AllenAI 경로(pi05_mlspaces_finetune)로 독자 셋업 착수. 완료: venv 구축(uv sync, 8GB), DROID norm stats prefetch, pi05_droid JAX→PyTorch 변환(bf16 7.2GB, missing/unexpected 파라미터 0건). 진행중: FrankaPnP OmniCam part1 train 660 shards/1.43TB 다운로드. raw action 구조 실측으로 스케일 정합 검증(joint_pos_rel/0.2 후 p99=0.473 ≈ DROID norm stats q99 0.448, 일치).
SLURM: 없음
오늘 할 일 / 이슈
FrankaPnP OmniCam part1(660 shards/1.43TB) 다운로드 완료 대기
validate_trajectories.py로 액션 정규화 값 범위 확인
login ≤100 step 스모크 테스트 → sbm/sbmr로 본 학습 제출
bulk_download.py에서 --part N을 --max_part_shards 없이 쓰면 필터 미적용되는 버그 발견(회피법 확인됨)
MetaView-actionMedium
MetaView의 3D geometry conditioning(PRoPE)이 action prediction/control을 실제로 개선하는지 RoboCasa video+action+proprio joint training(arm M3)으로 검증.
어제 한 일
81193beMake the validation launcher runnable, chain post-training measurements+160/-3, 3 files
8300c70Record the restored arm's SR: unchanged on grasping, no gain overall+50/-0, 1 file
6f07861Record m3f's validation, and that the m3 baseline cannot be run from here+30/-0, 1 file
claude/results-robocasa_sr.md · analysis
rc_m3f(geometry branch 아키텍처 완전 복원) 결과: SR 개선 없음. PnP 12/24=0.500(복원 전과 동일), non-PnP 29/48=0.604(복원 전 34/48에서 하락), overall 41/72=0.569 vs 복원 전 rc_m3 46/72=0.639, gate-A 기준 55/72=0.764보다 낮음. probe_output_sensitivity.py로 원인 확정: geometry 콘텐츠 섭동이 action 출력보다 video 출력에 6.7배 더 크게 반영(0.081 vs 0.012, step 3500~20k 전 구간 동일) — geometry 정보가 video 토큰까진 도달하지만 학습을 거쳐도 action head로 전파되지 않음.
rc_m3f vs rc_m3 생성품질 비교 — 아키텍처 변경으로 체크포인트 비호환, pre-restoration commit(55c1002) 별도 worktree 필요(~30-40분)
M1(no-geometry baseline, 동일 LoRA-64/data) 아직 미학습 — geometry 효과 비교용 순수 대조군 필요
핵심 연구 질문("3D geometry conditioning이 action prediction을 돕는가")이 4가지 아키텍처 이탈을 모두 수정한 후에도 부정적 — geometry 신호가 cross-attention을 통해 action head에 도달하지 못하는 구조적 병목으로 확인
UMIMedium
HiFi-UMI-2K(2,000h robot-free bimanual manipulation)를 1~5TB 예산 내에서 확보해 manipulation policy / world-action-model 학습 데이터로 사용.
어제 한 일
git 저장소 아님 (커밋 추적 불가)
claude/260812/plan-hifi_umi_wam_eval_design.md · plan (오늘 업데이트 섹션)
HiFi-UMI 논문 저자(HF Community)가 4건 문의에 모두 응답했지만 아티팩트(URDF/intrinsics/distortion params/head pose) 제공은 전부 거절. 유용한 정보 3건 획득: (1) intrinsics는 디바이스마다 달라 요청으로 해결 불가 → self-calibration이 유일한 경로로 확정, (2) 카메라 HFoV 확정 — hand 200°, head도 144° 광각으로 판명(기존 "평평한 무료 옵션" 가정은 과장이었음), (3) 그리퍼 기하 확보 — fingertip-to-axis 12cm, 대칭 2손가락, 최대 개구각 35°/finger(실측 34.4°와 일치 검증, CAD 불필요해짐).
SLURM: 없음
오늘 할 일 / 이슈
저자에게 추가 요청: 디바이스 단위 intrinsics 근사값 + shard-디바이스 매핑, head-camera trajectory 다음 배치 일정
결정 대기: (a) RoboTwin transfer 실험 진행 (b) action 제외 egocentric video world-model corpus로만 사용 (c) 중단
논문 가중치/학습코드 미공개(simple-world-lab HF org에 모델 0개)
121h 보유 데이터는 underpowered — 논문 pretraining 4,000h 대비 3%, cross-embodiment 전이 자체가 미검증 가설
scenememMedium
pi0.5를 MolmoSpaces(franka_droid) demo로 finetune, zero-shot 대비 success-rate 상승 측정 (참고: MolmoBot 논문 15K-step finetune 기준 36.0% vs 10.0% zero-shot).
어제 한 일
git 저장소 아님. claude/*.md 문서 업데이트도 없음 — 대신 15:33 KST에 산출물이 새로 생성됨.
pi05-mlspaces/eval/val_14999.json (검증 결과, 문서 아님)
15,000-step 목표 체크포인트(step 14999)에 대한 최종 검증(validate_checkpoint.py) — context.md의 "⏭️ 여기부터 재개" TODO 항목. 결과: L1 model 0.01930 vs zero-motion baseline 0.07853 → 4.07x 개선(context.md 통과 기준 ≥1.5x). RMSE 0.07139 vs 0.18232, 128 samples/127 episodes/horizon 15, non-finite 0건. 최약 축은 gripper(L1 0.03425 vs baseline 0.27835)이지만 그래도 8x 개선. 단, 체크포인트 자체는 8/4(10일 전) 학습 완료분 — 어제는 검증만 수행.
SLURM: 없음 (검증은 외부/로컬 환경에서 실행된 것으로 추정)
오늘 할 일 / 이슈
MolmoSpaces bench-v2 success-rate eval(Phase 6) — 외부 환경에서 실행 필요, 아직 미착수
context.md가 8/3자로 정지 — job 68392를 "본 학습 정상 진행 중"으로 여전히 기술 중이나 실제로는 8/4 완료. 이번 검증 결과에 대한 작업 로그도 아직 없음 — 클러스터 전체에서 오늘 나온 가장 강한 수치(4.07x)임에도 문서화 공백.