검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음
먼저 읽는 30초 요약
이 글에서 가져갈 것
- 컨텍스트는 모델이 한 번에 참조할 수 있는 토큰 범위입니다.
- 길이를 늘리면 KV 캐시 메모리 요구량이 증가합니다.
- 문서 길이와 답변 여유를 측정해 최소 충분 값을 선택합니다.
MEMORY FLOW 01
문맥이 메모리를 쓰는 과정
큰 숫자보다 필요한 토큰 예산이 먼저입니다.
- 01PROMPT
지시·대화·문서
- 02TOKENS
문맥 예산
- 03KV CACHE
길이·동시성 증가
- 04LIMIT
최소 충분 값
토큰 예산으로 생각합니다
시스템 지시, 대화 기록, 검색된 문서와 생성할 답변이 같은 컨텍스트 예산을 나눠 씁니다. 글자 수와 토큰 수는 언어와 토크나이저에 따라 다릅니다.
KV 캐시가 커집니다
모델은 이전 토큰의 계산 결과를 KV 캐시에 보관합니다. 문맥과 동시 요청이 늘면 모델 파일이 같아도 메모리 사용이 증가합니다.
Ollama에서 확인합니다
현재 Ollama는 VRAM 구간에 따라 기본 컨텍스트를 정하며 큰 값은 더 많은 메모리를 요구한다고 안내합니다. 실제 할당과 오프로딩은 `ollama ps`로 확인합니다.
OLLAMA_CONTEXT_LENGTH=8192 ollama serve
ollama ps필요한 만큼만 늘립니다
대표 문서의 토큰 수, 지시문과 답변 여유를 합쳐 단계적으로 늘립니다. 긴 문서를 무조건 한 번에 넣기보다 검색·분할·계층 요약을 고려합니다.
자주 묻는 질문
컨텍스트가 크면 답이 항상 좋아지나요?
아닙니다. 메모리와 지연이 늘고 모델이 긴 문맥을 효과적으로 쓰지 못할 수도 있습니다.
RAM과 VRAM 중 어디를 쓰나요?
런타임과 오프로딩 방식에 따라 달라지므로 실행 상태를 확인해야 합니다.
대화가 느려지면 어떻게 하나요?
새 대화로 비교하고 컨텍스트를 줄인 뒤 같은 질문을 측정하세요.
공식 출처
세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.