direcf / Archive
GitHub ↗
ARCHIVE — ALL POSTS

전체 아카이브

지금까지 쓴 모든 글과 코스 35편. 카테고리별로 정리했다.

💻 Computer Science

4 POSTS
JUN 22, 2026
AI 엔지니어를 위한 백엔드 & Ops
AI 엔지니어가 혼자서 하나의 시스템을 처음부터 끝까지 구축할 수 있도록, HTTP·데이터베이스·API 설계·컨테이너·클라우드·모니터링·CI/CD까지 백엔드와 Ops의 핵심을 쉽고 깊게 다룹니다. 코드 예제는 모두 Python 기반이며, 각 챕터는 실제 프로덕션 환경에서 시니어 엔지니어가 평가하는 기준까지 포함합니다.
JUN 19, 2026
AI 엔지니어를 위한 멀티모달 데이터 시스템
정형 데이터·비전·비디오 — 세 가지 모달리티를 다루는 시스템적 사고법. GBM vs 딥러닝의 실전 판단부터 Video Foundation Model 선택 기준, Feature Store 설계, 멀티모달 융합 전략까지. Claude Code가 코드를 짜는 시대, AI 엔지니어에게 필요한 '왜'와 '어떻게 설계할 것인가'를 10챕터로 기른다.
JUN 15, 2026
Video Codecs — H.264, H.265, AV1, and Beyond
Raw 데이터의 압도적 크기부터 세 가지 중복·압축 파이프라인·DCT·모션 추정·H.264/H.265/AV1까지. ffmpeg 실전 매뉴얼.
JUN 05, 2026
System Architecture & Network Protocols
시스템 아키텍처와 네트워크 프로토콜 10장 코스. OSI·TCP·HTTP·라우팅·로드밸런서·CDN까지.

🧠 Engineering Philosophy

2 POSTS
JUN 16, 2026
Human Capital & Token Capital — Satya Nadella의 AI 시대 엔지니어링 철학
Microsoft CEO Satya Nadella가 2026년 제시한 'Human Capital + Token Capital' 프레임워크 — 모델 선택이 아니라 학습 루프를 짓는 것이 AI 시대 엔지니어링의 핵심이다. 저자 소개, 신빙성 평가 포함.
JUN 11, 2026
Engineering Philosophy in the AI Agent Era
Karpathy·Sutton·Limoncelli·Ousterhout 외 7인의 에세이 10편을 깊이 읽는다. Software 2.0/3.0, Bitter Lesson, Building Effective Agents까지.

☁️ Cloud / Infra

2 POSTS
JUN 22, 2026
AWS 기초 완전 정복 — S3·EC2·VPC·Lambda부터 실전 아키텍처까지
AWS를 처음 시작하는 학생을 위한 실용적인 입문 과정. IAM·S3·EC2·VPC·RDS·Lambda·CloudFront·ELB를 그림과 함께 배우고, 실제 3-Tier 웹 아키텍처를 직접 설계해 본다.
JUN 22, 2026
AWS 심화 완전 정복 — ECS·SageMaker·EventBridge·Kinesis부터 FinOps까지
AWS Solutions Architect Professional 수준의 심화 과정. 컨테이너 오케스트레이션(ECS/EKS), ML 파이프라인(SageMaker), 이벤트 기반 아키텍처, 실시간 스트리밍, 데이터 레이크, 보안 심화, 관찰 가능성, CDK·CI/CD, Multi-Account FinOps까지 — 프로덕션 현장의 핵심만 담았다.

👁️ Computer Vision

8 POSTS
JUL 23, 2026
에고-엑소 시점 일관성 — 두 시점을 하나로 잇는 연구의 흐름 (대표 논문 10편)
1인칭(ego)과 3인칭(exo) — 같은 사건의 두 시점을 '일관되게' 잇는 연구가 8년간 어떻게 깊어졌는지의 흐름과 insight를 10편으로 정리한다. 데이터셋이 아니라 방법론에 집중: 표현 정렬(Actor-Observer·Ego-Exo·AE2·BYOV·Rosetta Stone) → 객체 대응(ObjectRelator·O-MaMa·CCMP) → 시점 생성(Exo2Ego) → 추론 통합(View-GRPO). '일관성의 정의가 feature→시간→픽셀→생성→추론으로 점점 깊어진 역사'를 축으로, 각 전환의 필연을 논문 figure·개념 다이어그램과 함께 해부하는 연구자·면접 대비 advanced 10챕터.
JUN 30, 2026
Ego-Exo 연구 — 크로스뷰 학습부터 논문 작성까지
2024–2026년 최신 논문 기반 Ego-Exo 연구 완전 정복. Ego-Exo4D·EgoExoBench·EgoExoMem 벤치마크, CCMP(CVPR 2026) 사이클 일관성 대응 학습, Naive Fusion 실패(-8.1%) 분석, Foundation Model 한계(55.3%) 극복 방향, Novel View Synthesis·3D 재구성, 멀티모달 통합까지 — 논문 작성을 목표로 한 연구자용 10챕터 커리큘럼.
JUN 11, 2026
DeepLabV3 & SqueezeSegV2: Semantic Segmentation
DeepLabV3의 ASPP와 SqueezeSegV2의 LiDAR range image — 2D/3D semantic segmentation 완전 정리. ECCV 2018·ICRA 2019.
JUN 11, 2026
PointPainting: Sequential Fusion of Lidar and Image Semantics
PointPainting — 2D semantic segmentation을 LiDAR point cloud에 투영하는 센서 융합. CVPR 2020.
JUN 11, 2026
PointRCNN: 3D Object Proposal Generation from Point Cloud
PointRCNN — Two-stage 3D detection with bin-based encoding. KITTI 벤치마크에서 최고 성능. CVPR 2019.
JUN 11, 2026
PointNet++: Deep Hierarchical Feature Learning
PointNet++의 Set Abstraction Layer — 계층적 지역 학습으로 비균일 밀도와 로컬 구조 포착. NIPS 2017.
JUN 11, 2026
PointNet: Deep Learning on Point Sets for 3D
PointNet — Symmetric Function으로 Point Cloud의 Permutation Invariance 해결. CVPR 2017.
JUN 11, 2026
CNN Backbone Evolution: AlexNet → ResNet
AlexNet, VGG, GoogLeNet, ResNet — ILSVRC 2012~2015 우승 아키텍처들의 설계 철학과 핵심 기여

🎨 Multimodal AI

10 POSTS
JUL 24, 2026
Spatial VLM의 진화 — 대표 논문 10편으로 읽는 공간추론 연구의 흐름
SpatialVLM(2024)에서 GR3D·VLM-3R(2026)까지, vision-language model이 '공간을 추론'하게 된 과정을 대표 논문 10편으로 해부한다. 진단(BLINK) → 데이터 합성(SpatialVLM) → region·depth 아키텍처(SpatialRGPT·SpatialBot) → 비디오 벤치마크(VSI-Bench·OmniSpatial) → 정신적 시뮬레이션(APC) → depth-native VLM(DepthVLM) → verifiable RL(Smooth Operator) → reconstruction 융합(GR3D)으로 이어지는 흐름을, '언어 토큰과 연속적 3D 기하 사이의 표상 불일치(representational mismatch)'라는 축으로 관통한다. 각 전환의 필연을 논문 figure·mermaid 개념도·실행 가능한 코드와 함께 해부하는 연구자·면접 대비 advanced 10챕터.
JUL 22, 2026
실시간 VLM 비용 최적화 — 단계별 이벤트 탐지 논문 10편
끝없이 흐르는 비디오에서 특정 이벤트를 최소 비용으로 실시간 탐지하기 위한 파이프라인 단계별 비용 절감 핵심 논문 10편(2026.07 기준)을 해부한다. ①토큰 다이어트(TimeChat-Online·Dispider) → ②기억 관리(StreamingVLM·ReKV·LiveVLM·StreamMem·Flash-VStream) → ③트리거(VideoLLM-Online·StreamMind·StreamBridge)의 3단계로 정리하고, 직교 조합한 '2단 게이트 캐스케이드'로 종합. prefill·KV cache·attention sink 기초부터 쌓는 advanced 10챕터.
JUN 22, 2026
LLM & VLM Post-Training 완전 정복 — SFT부터 최신 RL까지
SFT Chat Template부터 PPO·DPO·GRPO·DAPO·VAPO까지 LLM Post-Training 전 과정을 15챕터로 정복한다. VLM 비주얼 인스트럭션 튜닝·멀티모달 RLHF, 비디오 프레임 선택·전처리·Duration 설계, Temporal Grounding GRPO vs Video-OPD step-level reward, Qwen3/Qwen3-VL 기반 실전 코드까지. 2026년 6월 최신 논문 트렌드(VAPO·DAPO·Scale>Algorithm·VideoRewardBench·STVG-R1) 포함.
JUN 17, 2026
Pretrained to Imagine, Fine-Tuned to Act: World-Action Models
비디오로 미래를 상상하고 그 상상에서 행동을 이끌어내는 WAM(World-Action Model)의 등장 배경부터 최신 시스템까지. VLA와의 차이, 역동역학·공동 예측·표현 전용 세 패러다임, DreamZero(RoboArena 1750)·Fast-WAM·LingBot-VA 등 실전 시스템, 그리고 WAM+VLA 하이브리드 미래 전망을 10챕터로 체계적으로 다룬다. (NVIDIA Tech Blog, Moritz Reuss, 2026)
JUN 16, 2026
Temporal Grounding for Video VLMs (2026)
Temporal Grounding이 2024년까지 DETR 기반 boundary regression이었다면, 2025-2026년에는 VLM이 timestamp를 직접 emit하는 생성 문제로 재정의되었다. Time-R1(NeurIPS 2025), VideoMind(ICLR 2026), MeCo(ICLR 2026), VideoITG(CVPR 2026 Highlight), TimeLens(CVPR 2026) 6편과 12개 신규 paper 아이디어까지.
JUN 15, 2026
Real-time Video LLM
Real-time Video LLM은 sampler/memory 설계를 넘어 'Streaming Pipeline + Adaptive Processing'으로 멘탈 모델이 바뀐다. VideoLLM-online의 EOS-based stream alignment, Flash-VStream STAR, vLLM continuous batching, 그리고 차세대 architecture(Cascade + Chunk encoder + Scene graph memory + Timing of Speech)까지.
JUN 15, 2026
World Models & JEPA — LeCun's Path Beyond Generative AI
LeCun의 2022 비전부터 V-JEPA 2(2025)까지. World Model이라는 큰 우산 아래 JEPA 시리즈를 깊이 본다. Generative vs Predictive 논쟁, 물리 추론 벤치마크, Dreamer·Genie·Sora·Cosmos 같은 다른 학파까지.
JUN 11, 2026
Frame Sampling for Multimodal AI
비디오 LLM의 진짜 병목은 모델 크기가 아니라 frame sampling이다. 2026 SOTA(AKS, BOLT, Frame-Voyager, Q-Frame, AdaRD-Key, FOCUS)와 상용 서비스(Gemini, Twelve Labs)의 갭, plug-and-play architecture로 SOTA를 갈아끼우는 운영 패턴.
AUG 28, 2024
VLM과 Fine-tuning: LLaVA, LoRA, LLaMA Adapter v2
VLM의 3가지 구성요소(LLM·Vision Encoder·Alignment)를 해부하고, LLaVA의 instruction data 생성 전략과 2-stage 학습 방식, LoRA·LLaMA Adapter v2로 이어지는 PEFT 기법까지.
MAY 30, 2024
멀티모달 LLM 기초 연구: CLIP → Flamingo → LLaMA → Vicuna
멀티모달 LLM의 출발점을 짚는다. CLIP·Flamingo가 image-text 융합의 문을 열고, LLaMA 오픈소스 공개 이후 Alpaca·Vicuna로 이어지는 fine-tuning 생태계의 탄생.

⚙️ AI Engineering

6 POSTS
JUL 23, 2026
Loop Engineering — 프레임워크에서 루프, 그리고 그래프로 (대표 논문 13편)
AutoGPT식 monolithic 에이전트 프레임워크에서 "에이전트는 결국 루프다"라는 harness 관점으로, 다시 LangGraph식 명시적 그래프 오케스트레이션으로 넘어가는 흐름을 대표 논문·에세이 13편으로 추적한다. ReAct·Reflexion·Voyager·Building Effective Agents·Tree of Thoughts·ReWOO·LLMCompiler·DSPy·LangGraph까지, framework→loop→graph 진화사로 2026 프로덕션 에이전트를 실제로 어떻게 짜는지 배운다.
JUN 22, 2026
빅테크 System Design 완전 정복 — 분산 시스템부터 LLM 인프라까지
Google·Amazon·Meta AI Engineering 직군 면접을 위한 시스템 설계 완전 정복. 분산 시스템 이론·CAP 정리·샤딩·캐시·Kafka부터 Twitter/YouTube/Uber 실전 설계, ML 파이프라인·추천 시스템·LLM 서빙 인프라까지. 기초부터 심화까지 10챕터로 체계적으로 학습한다.
JUN 19, 2026
Claude Code 완전 정복 — CLAUDE.md부터 Multi-agent까지
Karpathy의 65줄 CLAUDE.md가 왜 22만 GitHub star를 받았는지부터 — CLAUDE.md 로딩 원리, Hooks 시스템, Skills/슬래시 커맨드, Multi-agent 오케스트레이션까지. 해외 고수들이 실제로 쓰는 세팅과 워크플로우를 분해해 당신만의 AI 개발 환경을 완성한다.
JUN 19, 2026
Claude Code 스킬 생태계 & 전문가 워크플로 완전 가이드
2026년 Claude Code 스킬 생태계를 10챕터로 정복한다. 고ROI 스킬 20선 설치 가이드, Hooks·MCP·Plan Mode를 결합한 전문가 워크플로, 팀 자산화 전략까지. 초보와 고수를 가르는 25가지 노하우를 실전 코드와 함께 습득한다.
JUN 17, 2026
How AI Agents Reshape Knowledge Work
Perplexity의 실제 사용 데이터로 증명한 AI 에이전트의 힘 — 세션당 26분 자율 실행, 87% 시간 절감, 94% 비용 절감. 자율성·효율성·범위 확장(Scope) 3차원 프레임으로 에이전트가 지식 노동을 어떻게 재편하는지 분석한다. (Yang et al. 2025, arXiv:2606.07489)
JUN 17, 2026
Harness Engineering — Claude Code 하네스 완전 가이드
AI 에이전트 성능의 98.4%는 모델이 아니라 하네스다. Claude Code 유출본 분석·Karpathy 컨텍스트 엔지니어링·LangChain Terminal Bench 30→5위 사례로 CLAUDE.md·Hooks·MCP·Skills·Memory·Permission 전 레이어를 당장 적용 가능한 수준으로 설계한다.

🤖 Physical AI

3 POSTS
JUL 06, 2026
COMPASS & Cross-Embodiment Mobility — 하나의 정책으로 모든 로봇을 움직이다
다양한 형태(wheeled·quadruped·humanoid)의 로봇을 하나의 mobility 정책으로 움직이는 cross-embodiment 문제를 완전 정복한다. NVIDIA COMPASS(arXiv:2502.16372)의 3단계 파이프라인 — Imitation Learning + Residual RL + Policy Distillation — 을 뼈대로, World Model 기반 navigation(X-Mobility), covariate shift, embodiment conditioning, generative policy의 averaging 문제, Sim-to-Real, 그리고 2026년 Navigation Foundation Model(NavFoM·GR00T)까지. 데이터 스케일링 vs 구조적 분리라는 두 패러다임을 insight 중심으로 다루는 연구자용 10챕터 커리큘럼.
JUL 06, 2026
NVIDIA Physical AI Map — Omniverse·Cosmos·Isaac·GR00T 전체 지도
2026년 7월 기준 NVIDIA가 Physical AI 분야를 어떻게 하나의 스택으로 만들어가는지 전체 그림을 그린다. Omniverse·OpenUSD·Isaac Sim·Isaac Lab·Cosmos의 history와 관계성 같은 기초부터, three computers 아키텍처, 합성 데이터 파이프라인(MobilityGen·GR00T-Dreams), GR00T foundation model 계보(N1→N1.7), 로봇 정책 워크플로우(COMPASS·HOVER), autonomous driving·산업 디지털 트윈, Jetson Thor 배치, GTC 2026 최전선(Cosmos 3·Newton 1.0)까지. NVIDIA 공식 다이어그램 다수 포함, 개념·아키텍처와 insight 중심의 13챕터 지도.
JUL 06, 2026
GR00T & NVIDIA Physical AI 2026 — GR00T는 데이터로 navigation과 manipulation을 다 먹는가
2026년 NVIDIA는 navigation과 manipulation을 GR00T N1.6이라는 하나의 reasoning VLA로 통합하고 있다. 이 코스는 'GR00T가 데이터로 두 분야를 다 먹는가, 아니면 구조적 분리가 여전히 필요한가'라는 긴장을 축으로 — COMPASS(데이터 엔진으로 재배치)·Cosmos(뇌이자 데이터공장)·SONIC(전신 제어)·Isaac 합성데이터 공장, 그리고 metric localization이 여전히 geometric으로 남는 통합의 경계선까지 — 원문 인용으로 해부한다. 'Robots Need More than VLA and World Models'(2026.06) 반론과 NavFoM(데이터 극점) vs COMPASS(구조 극점) 대비를 포함한 연구자·면접 대비 advanced 10챕터. COMPASS cross-embodiment 코스의 2026 속편.