LLM/VLM¶
대규모 언어 모델(LLM)과 비전-언어 모델(VLM)에 대한 종합 문서.
섹션 구성¶
기초 이론¶
LLM과 VLM의 핵심 개념과 이론적 기반을 다룹니다.
| 섹션 | 주요 내용 | 링크 |
|---|---|---|
| LLM 기초 | 언어 모델링 이론, Transformer, Attention, 학습 패러다임 | 바로가기 |
| VLM 기초 | 멀티모달 학습, 대조 학습, 이미지 인코딩, 아키텍처 유형 | 바로가기 |
LLM 세부 토픽:
- Transformer - Self-Attention, Position Encoding
- Attention - Multi-Head, Efficient Attention
- Embedding - Token/Position Embedding
- Tokenization - BPE, SentencePiece
- Prompting - CoT, Few-shot, ReAct
- Fine-tuning - LoRA, RLHF, DPO
VLM 세부 토픽:
- 멀티모달 학습 - Contrastive Learning
- 이미지 인코딩 - ViT, CLIP Encoder
- Cross-Attention - Fusion 메커니즘
- Token Fusion - Q-Former, Perceiver
- OCR vs VLM - 선택 가이드
아키텍처¶
다양한 모델 아키텍처와 최적화 기법.
| 토픽 | 설명 | 링크 |
|---|---|---|
| 종합 가이드 | LLM/MLLM 아키텍처 전체 개요 | 바로가기 |
| Transformer | 기본 구조, 변형, 발전 | 바로가기 |
| MoE | Mixture of Experts | 바로가기 |
| SSM | State Space Models (Mamba) | 바로가기 |
| Hybrid | 하이브리드 아키텍처 | 바로가기 |
| Quantization | 양자화 기법 | 바로가기 |
| Context Extension | 긴 컨텍스트 처리 | 바로가기 |
서빙/프로덕션¶
실제 서비스 운영을 위한 인프라와 파이프라인.
| 토픽 | 설명 | 링크 |
|---|---|---|
| 기술 스택 가이드 | 상황별 스택 선택 | 바로가기 |
| 프로덕션 인프라 | 인프라 구성 패턴 | 바로가기 |
| 서빙 파이프라인 | 추론 최적화, 배치 처리 | 바로가기 |
모델 카탈로그¶
주요 LLM/VLM 모델들의 상세 스펙과 비교 분석.
LLM:
| 회사 | 모델 |
|---|---|
| OpenAI | GPT-4o, o1, o3 |
| Anthropic | Claude 4 Opus, Claude 3.5 Sonnet |
| Gemini 2.0, Gemma 2 | |
| Meta | Llama 3.3, Llama 3.1 |
| Mistral | Mistral Large 2, Mixtral |
| DeepSeek | DeepSeek V3, R1 |
VLM:
| 모델 | 링크 |
|---|---|
| GPT-4V | 바로가기 |
| Claude 3 Vision | 바로가기 |
| Gemini Vision | 바로가기 |
| LLaVA | 바로가기 |
| Qwen-VL | 바로가기 |