direcf Real-time VLM Cost Optimization
📚 Coursework

Real-time VLM Cost Optimization

끝없이 흐르는 비디오에서 특정 이벤트를 최소 비용으로 실시간 탐지하기 위해, 파이프라인 단계별 비용 절감 핵심 논문 10편(2026년 7월 기준)을 해부한다. ①토큰 다이어트(TimeChat-Online·Dispider) → ②기억 관리(StreamingVLM·ReKV·LiveVLM·StreamMem·Flash-VStream) → ③트리거(VideoLLM-Online·StreamMind·StreamBridge)의 3단계로 정리하고, 이들을 직교 조합한 '2단 게이트 캐스케이드' 아키텍처로 종합한다. prefill·KV cache·attention sink 등 기초부터 쌓아 연구자·면접 대비용 advanced 10챕터.

고급 10 chapters Python

커리큘럼

10 chapters
CH
01
🗺️Foundations & the Cost Map
기초 개념과 비용 지도 — 왜 실시간 VLM은 비싼가
Prefill·KV cache·attention sink 세 개념으로 스트리밍 VLM의 3대 병목을 이해하고, 비용을 깎는 3단계 파이프라인(토큰 다이어트 → 기억 관리 → 트리거) 지도를 세운다.
Prefill vs DecodeKV CacheAttention Sink
CH
02
✂️TimeChat-Online — Differential Token Drop
TimeChat-Online — 변화분만 입장시켜라
스트리밍 비디오 비주얼 토큰의 약 80%는 프레임 간 중복이다. 이전 프레임과 비교해 안 변한 패치를 LLM 입장 전에 드롭하면 prefill·KV·attention이 한꺼번에 줄고, drop률은 공짜 이벤트 신호가 된다.
Differential Token Drop패치 단위 중복 제거최상류 절감
CH
03
🎭Dispider — Disentangled Perception, Decision, Reaction
Dispider — 보는 놈·판단하는 놈·말하는 놈을 분리하라
하나의 LLM이 인식·판단·생성을 다 하면 답변 중엔 눈을 감는다. Dispider는 셋을 별도 모듈로 쪼개 비동기로 돌리고, 장면 경계 기반 비균일 세그먼트와 1토큰 판단으로 '싸게 감시, 드물게 생성'을 구현한다.
Perception–Decision–Reaction 분리비동기 파이프라인장면 경계 비균일 세그먼트
CH
04
♾️StreamingVLM — Infinite Stream, Constant Cost
StreamingVLM — 무한 스트림을 고정 비용으로
attention sink를 비디오로 확장한다. Sink + 텍스트 윈도우(길게) + 비전 윈도우(짧게)의 3구역 고정 KV cache에, RoPE 위치 재인덱싱과 학습-추론 정렬을 더해, 캐시 크기를 상수로 묶고 H100 한 장에서 8 FPS 무한 스트림을 돌린다.
3구역 고정 KV cacheattention sink 확장위치 재인덱싱(RoPE)
CH
05
🗄️ReKV — Offload then Retrieve
ReKV — 버리지 말고 창고에 넣었다 꺼내라
StreamingVLM과 정반대 철학. KV를 버리지 않고 GPU→RAM→디스크로 오프로드하고, 질문이 오면 레이어별로 관련 KV 블록만 검색해 올린다. 재인코딩 비용이 0이고 training-free라, 이벤트 탐지 이후의 장기 사후 질의에 최적이다.
KV 오프로드레이어별 KV 검색재인코딩 0
CH
06
🫧LiveVLM — Compress before Storing
LiveVLM — 창고에 넣기 전에 압축하라
ReKV의 '다 보관하되 검색이 병목' 문제를 앞당겨 푼다. Vision Sink Bucketing으로 다른 토큰들이 많이 참조하는 허브 토큰만 남겨 압축 저장하고, 위치 무관 검색으로 조각을 이어붙인다. training-free·query-agnostic이라 재학습 없이 붙는다.
Vision Sink Bucketing허브 토큰 선별Position-agnostic Retrieval
CH
07
⚖️StreamMem — Fixed-Size, Importance-Ranked Memory
StreamMem — 밀어내지 말고 매번 다시 요약하라
FIFO의 나이순 방출을 중요도순으로 바꾼다. 새 프레임이 올 때마다 [기존 메모리+새 KV]를 한 덩어리로 놓고 전체를 중요도로 재선별·재압축해, 스트림 길이와 완전히 무관한 고정 크기 KV 메모리를 유지한다. 중요도는 범용 프록시 질의로 측정한다.
고정 크기 KV 메모리중요도순 재압축프록시 질의
CH
08
🧠Flash-VStream — Hierarchical Gist + Detail Memory
Flash-VStream — 요약은 넓게, 디테일은 몇 개만 선명하게
생산자-소비자 2프로세스로 프레임 흡수와 질문 응답을 분리하고, K-means 요약 메모리(CSM)와 핵심 프레임 고해상 부록 메모리(DAM)의 2단 계층으로 기억을 구성한다. 새 클러스터 생성이 곧 새 장면 신호다.
생산자-소비자 2프로세스Context Synopsis Memory(CSM)Detail Augmentation Memory(DAM)
CH
09
🔔VideoLLM-Online — Silence as Learned Output
VideoLLM-Online — 침묵도 학습된 출력이다
트리거 계열의 시조. Streaming EOS라는 어휘 하나로 '언제 말할지'와 '뭘 말할지'를 통합하고, 오프라인 타임스탬프 라벨을 스트리밍 대화로 바꾸는 데이터 합성 레시피를 세워 이후 모든 후속 연구의 기반이 된다. 다만 판단조차 풀 LLM을 매 프레임 돌린다.
Streaming EOS침묵=출력데이터 합성 레시피
CH
10
🏗️StreamMind, StreamBridge & the 2-Stage Cascade
StreamMind·StreamBridge와 2단 게이트 캐스케이드 — 10편의 종합
게이트를 어디까지 내리느냐의 두 극점 — StreamMind는 SSM 게이트로 LLM을 상시 루프에서 완전히 빼 100 FPS를 달성하고, StreamBridge는 0.5B 게이트를 본체 옆에 붙여 무수정 스트리밍화한다. 마지막에 10편 전부를 쌓아 '2단 게이트 캐스케이드'로 최소 비용 실시간 이벤트 탐지 VLM을 설계한다.
EPFE + Cognition GateDecoupled 0.5B Activation ModelRound-Decayed Compression