direcf Ego-Exo View Consistency
📚 Coursework

Ego-Exo View Consistency

1인칭(ego)과 3인칭(exo) — 같은 사건의 두 시점을 '일관되게' 잇는 연구가 8년간 어떻게 깊어졌는지의 흐름과 insight를 10편으로 정리한다. 데이터셋이 아니라 방법론에 집중: 표현 정렬(Actor-Observer·Ego-Exo·AE2·BYOV·Rosetta Stone) → 객체 대응(ObjectRelator·O-MaMa·CCMP) → 시점 생성(Exo2Ego) → 추론 통합(View-GRPO). '일관성의 정의가 feature→시간→픽셀→생성→추론으로 점점 깊어진 역사'를 축으로, 각 전환의 필연을 논문 figure·개념 다이어그램과 함께 해부하는 연구자·면접 대비 advanced 10챕터.

고급 10 chapters Python

커리큘럼

10 chapters
CH
01
🪞Actor and Observer
배우와 관찰자 — 두 시점을 한 임베딩에 담다
1인칭(ego)과 3인칭(exo)은 같은 행동의 두 그림자다. Actor-Observer는 이 둘을 하나의 공유 임베딩 공간으로 끌어당겨, exo에서 배운 것을 ego로 옮기는 길을 처음 냈다.
Joint embeddingTriplet lossWeak supervision
CH
02
⚗️Ego-Exo Transfer
Ego-Exo — 3인칭에서 1인칭으로 지식을 증류하다
exo는 풍부하지만 도메인이 다르고, ego는 딱 맞지만 부족하다. Ego-Exo는 exo 영상 속에 숨은 '1인칭적 신호'(주목 객체·상호작용 지도)를 찾아 사전학습 증류 손실로 주입해, 이 딜레마를 우회한다.
Knowledge distillationPre-trainingEgo-specific signals
CH
03
AE2 — Align Ego-Exo
AE2 — 짝 없이, 시간으로 정렬하다
같은 시각에 찍은 ego·exo 짝은 귀하다. AE2는 '동시 촬영' 가정을 버리고, 서로 다른 때·다른 곳에서 찍힌 ego·exo를 시간축에서 정렬해 미세한 view-invariant 행동 표현을 배운다.
Unpaired alignmentTemporal alignmentObject-centric encoder
CH
04
🎭BYOV — Masked Ego-Exo
BYOV — 가리고 맞히며 두 시점을 함께 부트스트랩
BYOV는 unpaired 계열을 이어가되 대조 대신 마스킹을 쓴다. 자기 시점을 가려 시간 동역학을 배우고, 상대 시점의 잠재를 예측해 cross-view 정렬을 배운다 — 두 목적을 동시에.
Masked modelingSelf-view maskingCross-view masking
CH
05
🗝️Viewpoint Rosetta Stone
로제타석 — 소량의 짝으로 대량의 짝 없는 데이터를 해금
소량의 동기화 paired 영상을 '로제타석'으로 삼아, 확산모델 번역기(RST)가 ego feature에서 exo feature를 합성한다. 이 합성 짝으로 대량 unpaired를 정렬 — paired의 정확성과 unpaired의 규모를 잇는 다리.
Feature translationDiffusionPaired-to-unpaired bridge
CH
06
🧩ObjectRelator
ObjectRelator — 표현 정렬에서 객체 대응으로
로봇·AR은 '같은 행동'이 아니라 '이 컵이 저 컵'이라는 객체 대응이 필요하다. ObjectRelator는 문제를 cross-view 세그멘테이션으로 세우고, 시점 변화로 무너지는 분할을 XObjAlign 일관성으로 잡는다.
Cross-view segmentationObject correspondenceXObjAlign
CH
07
🎯O-MaMa — Object Mask Matching
O-MaMa — 대응을 '마스크 매칭'으로 다시 세우다
O-MaMa는 픽셀 dense matching 대신 문제를 '마스크 후보 간 매칭'으로 재프레이밍한다. FastSAM 후보를 DINOv2로 인코딩하고, cross-attention과 대조 매칭·하드 negative로 정답 마스크를 고른다.
Mask matchingFastSAM candidatesDINOv2
CH
08
🔄CCMP — Cycle-Consistent Mask Prediction
CCMP — 되돌아오면 제자리, 사이클로 대응을 자기검증하다
CCMP는 ego→exo 예측 마스크를 다시 exo→ego로 되돌려 원래 질의 마스크를 복원하게 한다. 이 cycle-consistency가 라벨 없는 자기지도와 test-time 적응을 주어, 대응을 스스로 검증·정련한다.
Cycle-consistencySelf-supervisionTest-time training
CH
09
👟Exo2Ego
남의 신발을 신다 — 3인칭에서 1인칭을 통째로 생성
정렬도 대응도 아닌 생성. Exo2Ego는 3인칭 영상만 보고 사실적 1인칭 영상을 만든다. 대응을 강제하는 구조 변환 단계와, 손 배치 사전에 조건화된 확산 픽셀 생성의 2단계로 시점을 통째로 번역한다.
View translationDiffusion generationStructure transform
CH
10
🧠View-GRPO & the Consistency Gap
View-GRPO — video-LLM은 두 시점을 일관되게 추론하는가
정렬·대응·생성을 지나 무대는 video-LLM으로 통합된다. EgoExo-Con은 최신 video-LLM의 cross-view 시간 추론이 단일 시점의 절반 수준임을 폭로하고, View-GRPO는 '같은 답 강제'가 아니라 '시점별 추론→일치 결론'을 RL로 학습시킨다.
Video-LLMCross-view reasoningConsistency gap