Index
2026-05-13 · plan

Pi0.5-RoboCasa + MemER LoRA cascade for scene-mem-benchmark

probe 후속 통합 계획 · 12-task graph · 자매 repo 인프라 재사용

TL;DR

44
Pi0.5 files
49s
download
252
atomic tasks
1382
episodes
12
tasks (2 done)

1배경 / 목적

scene-mem-benchmark의 memory_success(approach fixture R<1.2m AND door joint ≥ 0.5)를 측정하려면 low-level VLA가 필요 — Pi0.5-RoboCasa 통합이 필수. 그리고 오전 probe에서 발견된 vocabulary lock-in ("place X on top/bottom shelf"만 출력)을 해결하려면 RoboCasa 어휘 LoRA tuning이 필요.

두 작업을 한 trajectory로 묶어서 plan 수립 — 데이터셋 / venv / cascade 어댑터 / scaling.

2사용자 결정 (260513 confirmed)

항목결정이유
Vocab 해결LoRA finetuneprompt enum 단독은 불충분 가능. 진짜 vocab swap이 필요
프로세스 격리2 venv + IPC (torch=memer, JAX=pi05)numpy 충돌 회피, REFERENCE 권장
데이터셋daixianjie/robocasa_human_lerobot252 atomic tasks, RoboCasa primitive 어휘 정확히 매치
해상도320×180deployment과 일치 (train-deploy 분포 일치)
Keyframe 라벨MemER 원본 스크립트 (수정 후) → 자매 repo ms-swift template로 전환공식 generate_sft_data.py는 v3.x+subtask 요구 → 미스매치 발견

3핵심 발견: 자매 repo가 거의 모든 인프라 제공

경로: ~/repos/Robotics/robomme_policy_learning/. RoboMME (v2 no-subtask) 위에서 MemER LoRA + Pi0.5 cascade를 이미 굴렸음.

우리가 만들 것자매 repo template분량
RoboCasa MemER 데이터 빌더src/mme_vla_suite/dataset_builder/build_vlm_subgoal_dataset_memer.pyadapt
LoRA 학습 entry (ms-swift)scripts/finetune_vlm_subgoal_predictor.shadapt (46 L)
Pi0.5 JAX 서버 (IPC)scripts/serve_policy.py재사용 (109 L)
MemerPi05Policy 어댑터scripts/eval_robomme_memer_lora.pyadapt (365 L)
MemER inference pathexamples/robomme/subgoal_prediction/qwenvl/api_memer.py거의 그대로
openpi 라이브러리src/openpi/재사용 (local pkg)
REFERENCE 문서가 "scratch부터 짜라"고 한 작업 6개 중 4개가 자매 repo의 adapt로 끝남. 새 코드는 데이터 빌더 + scene-mem 어댑터 2개에 집중.

4발견된 위험 / 미해결

Data format mismatch — 공식 scripts/generate_sft_data.py는 LeRobot v3.x + per-frame subtask_index 요구. daixianjie/robocasa_human_lerobot는 v2.0 + per-episode task_index만. → 자매 repo의 ms-swift template 패턴 따라가야 함.
Compound trajectory 구성 — RoboCasa는 1 episode = 1 atomic task. MemER 학습엔 multi-subtask trajectory가 필요. 자매 repo가 RoboMME에서 어떻게 multi-task trajectory를 구성하는지 코드 분석 후 그 패턴 따라가야 함 (task #12).
LoRA 어디서 시작?Yinpei/vlm_subgoal_predictor가 RoboMME tuned. 같은 author가 RoboCasa 버전 따로 push했을 가능성 검증 (task #11). 있으면 task #5, #6 스킵 가능.
이미지 저장 비용 — 1382 ep × ~270 frame = 372K frame at 320×180. JPEG q90 평균 25KB → 약 9 GB. 학습 시 stacked (2 cam) 이면 18 GB 정도 예상. 디스크 OK.

5Task graph (#1-#12)

#1 Pi0.5 ckpt download ✅ DONE #2 RoboCasa365 dataset 조사 ✅ DONE #11 Yinpei RoboCasa LoRA? ─┐ (있으면 #5, #6 스킵) #3 pi05 venv 재사용 여부 ─┼─→ #4 Dataset 다운 #12 build_dataset 코드 분석 ─┘ │ ▼ #5 RoboCasa data builder 작성 │ ▼ #6 MemER LoRA 학습 (ms-swift, 4-8 GPU sbm) │ ▼ #7 Vocab sanity check (combo_002) │ ▼ #8 MemerPi05Policy 어댑터 │ ▼ #9 1 scenario 풀 rollout (memory_success) │ ▼ #10 257 scenario SLURM batch

6다음 액션 (P0)

  1. Yinpei HF 검색 (task #11) — RoboCasa LoRA 있으면 학습 스킵 → 가장 cost-effective 첫 단계
  2. 자매 repo .venv 재사용 가능 여부 (task #3) — jax/flax/openpi import 가능한지 확인
  3. build_vlm_subgoal_dataset_memer.py 코드 분석 (task #12) — compound trajectory 구성 방식, prompt schema, keyframe 규칙 파악. 새 builder 짜기 전에 필수

의견

1번부터 시작해서 (cheap) LoRA가 이미 있으면 4-6일 분량 작업이 절반으로 줄어듦. 없어도 2, 3번 진행에 차질 없음. 다음 세션에 WebFetch/curl 한 번이면 검증 끝.

7산출물

경로내용
~/ckpts/pi05_robocasa_pretrain_human300_step75000/Pi0.5 ckpt 44 file
claude/260513/plan-pi05_memer_integration.mdmd plan 원본
~/repos/claude_reports/memer/260511-260517/260513-pi05_memer_integration_plan.html(이 리포트)
claude/context.md갱신 — 260513 오후 상태 반영
Task list #1-#12TaskCreate로 cluster, 2 completed