검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음

먼저 읽는 30초 요약

이 글에서 가져갈 것

  • 컨텍스트는 모델이 한 번에 참조할 수 있는 토큰 범위입니다.
  • 길이를 늘리면 KV 캐시 메모리 요구량이 증가합니다.
  • 문서 길이와 답변 여유를 측정해 최소 충분 값을 선택합니다.
MEMORY FLOW 01

문맥이 메모리를 쓰는 과정

큰 숫자보다 필요한 토큰 예산이 먼저입니다.

  1. 01
    PROMPT

    지시·대화·문서

  2. 02
    TOKENS

    문맥 예산

  3. 03
    KV CACHE

    길이·동시성 증가

  4. 04
    LIMIT

    최소 충분 값

활용 기준 새 대화와 작은 컨텍스트로 비교해 병목을 확인합니다.
SECTION 01

토큰 예산으로 생각합니다

시스템 지시, 대화 기록, 검색된 문서와 생성할 답변이 같은 컨텍스트 예산을 나눠 씁니다. 글자 수와 토큰 수는 언어와 토크나이저에 따라 다릅니다.

SECTION 02

KV 캐시가 커집니다

모델은 이전 토큰의 계산 결과를 KV 캐시에 보관합니다. 문맥과 동시 요청이 늘면 모델 파일이 같아도 메모리 사용이 증가합니다.

SECTION 03

Ollama에서 확인합니다

현재 Ollama는 VRAM 구간에 따라 기본 컨텍스트를 정하며 큰 값은 더 많은 메모리를 요구한다고 안내합니다. 실제 할당과 오프로딩은 `ollama ps`로 확인합니다.

OLLAMA_CONTEXT_LENGTH=8192 ollama serve
ollama ps
SECTION 04

필요한 만큼만 늘립니다

대표 문서의 토큰 수, 지시문과 답변 여유를 합쳐 단계적으로 늘립니다. 긴 문서를 무조건 한 번에 넣기보다 검색·분할·계층 요약을 고려합니다.

FAQ

자주 묻는 질문

컨텍스트가 크면 답이 항상 좋아지나요?

아닙니다. 메모리와 지연이 늘고 모델이 긴 문맥을 효과적으로 쓰지 못할 수도 있습니다.

RAM과 VRAM 중 어디를 쓰나요?

런타임과 오프로딩 방식에 따라 달라지므로 실행 상태를 확인해야 합니다.

대화가 느려지면 어떻게 하나요?

새 대화로 비교하고 컨텍스트를 줄인 뒤 같은 질문을 측정하세요.

공식 출처

세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.

Ollama Context Length Ollama FAQ

이어서 읽기

GGUF와 Q4·Q5 양자화, 무엇을 골라야 할까?한국어 로컬 모델, 어떻게 비교해야 할까?