Egocentric 비디오(EPIC-KITCHENS)에서 장기 활동을 이해하기 위해 시공간 그래프를 자동 구축하는 시스템. 기존 VQA는 프레임 단위 처리라 "5분 전에 칼을 어디 뒀는가?" 같은 장기 기억 질문에 답할 수 없다.
sink vs kitchen_sink) 해결을 위해 EPIC-Fields camera parameter 활용. 핵심 발견: position distance가 유일한 유효 지표. Viewing direction은 주방 환경에서 구별력 없음 -- cosine similarity가 0.999로 수렴. 고정 물체는 카메라 위치 기반 클러스터링, 이동 물체는 action-chain tracking으로 분리 설계.
| Metric | v3 | v4 (improved) | Change |
|---|---|---|---|
| Object nodes | 74 | 39 | -47% |
| Action nodes | 14 | 10 | -29% |
| Person-related | 13 | 5 | -62% |
| Generic IDs | 3 | 0 | -100% |
| Celery duplicates | 11 | 2 | -82% |
| Spatial edges | 248 | 192 | -23% |
| API cost (1min clip) | ~$0.085 | similar | - |
프롬프트 개선 + 카메라 기반 entity resolution으로 그래프 품질이 크게 향상되었으나, 후처리 정규화가 여전히 필요한 상태. VLM의 규칙 불이행은 프롬프트만으로는 해결 한계가 있으며, 후처리 레이어가 불가피.