Graph VLM Progress

VQA/Graph_VLM -- Egocentric Video Long-term Memory via Spatiotemporal Graph
2026.03.24 ~ 2026.04.06 (2주간 진행 리포트)
11 Commits
0 SLURM Jobs
5 Claude Sessions
10 Work Logs

Why This Project

문제 정의

Egocentric 비디오(EPIC-KITCHENS)에서 장기 활동을 이해하기 위해 시공간 그래프를 자동 구축하는 시스템. 기존 VQA는 프레임 단위 처리라 "5분 전에 칼을 어디 뒀는가?" 같은 장기 기억 질문에 답할 수 없다.

그래프 기반 long-term memory가 이 한계를 깨는 접근. VLM이 비디오를 보고 structured graph를 직접 추출하면, 시간적 추론이 graph traversal로 환원된다.

Key Progress

Mar 24
MVP 파이프라인 구현
VLM description -> graph building -> querying 전체 파이프라인 완성. Gemini 2.5 Flash로 structured JSON 직접 추출에 성공하여 별도 파싱 단계 불필요 (전략 B 검증). 별도 NER/relation extraction 없이 VLM 하나로 end-to-end 그래프 구축.
+4,900 lines
Apr 1
Entity Resolution with Camera Parameters
VLM의 object naming 불일치 문제(sink vs kitchen_sink) 해결을 위해 EPIC-Fields camera parameter 활용. 핵심 발견: position distance가 유일한 유효 지표. Viewing direction은 주방 환경에서 구별력 없음 -- cosine similarity가 0.999로 수렴. 고정 물체는 카메라 위치 기반 클러스터링, 이동 물체는 action-chain tracking으로 분리 설계.
viewing direction cosine sim: 0.999 (무의미) / position distance: 유효
Apr 6
프롬프트 개선으로 47% 노드 감소
프롬프트 규칙 강화만으로 Object 노드 74 -> 39개로 감소. Person 관련 노드 13 -> 5, generic ID 3 -> 0, celery 중복 11 -> 2, washing 과분할 6 -> 1. 추가 비용 없이 그래프 품질을 대폭 개선.
-47% object nodes, -29% action nodes (cost-free)

Quantitative Results

v3 vs v4 비교 Active
프롬프트 개선 전후 그래프 노드/엣지 수 비교. 1분 클립 기준.
Metric v3 v4 (improved) Change
Object nodes 74 39 -47%
Action nodes 14 10 -29%
Person-related 13 5 -62%
Generic IDs 3 0 -100%
Celery duplicates 11 2 -82%
Spatial edges 248 192 -23%
API cost (1min clip) ~$0.085 similar -

Phase Progress

MVP -> Entity Resolution -> Graph Quality 60%

Critical Assessment

Strengths

  1. Camera-aware entity resolution은 도메인 무관 일반화 가능. Position distance 기반이라 kitchen 외 환경에도 적용 가능.
  2. 프롬프트만으로 47% 감소는 cost-free 개선. 추가 모델 호출이나 후처리 없이 입력 규칙 변경만으로 달성.
  3. Structured output 직접 추출로 파이프라인 단순화. NER + relation extraction 2단계가 VLM 1단계로 축소.

Weaknesses

  1. 39개 중 ~30개로 추가 merge 필요. cutting_board/chopping_board 등 동의어가 여전히 별도 노드로 존재.
  2. VLM이 규칙을 100% 따르지 않음. water, person 등 금지 엔티티가 여전히 간헐적으로 생성됨.
  3. 이동 물체 추적은 아직 미구현. Action-chain tracking 설계만 존재, 구현 및 검증 미완료.

Takeaway & Next Steps

프롬프트 개선 + 카메라 기반 entity resolution으로 그래프 품질이 크게 향상되었으나, 후처리 정규화가 여전히 필요한 상태. VLM의 규칙 불이행은 프롬프트만으로는 해결 한계가 있으며, 후처리 레이어가 불가피.

Next Steps