검증 범위Hugging Face GGUF 형식·양자화 문서와 Ollama 메모리·컨텍스트 설명 검토 · 제품별 성능 수치는 미측정

먼저 읽는 30초 요약

이 글에서 가져갈 것

  • 8B·14B 같은 파라미터 규모와 Q4·Q5 같은 양자화 수준을 함께 봐야 합니다.
  • 모델 파일 외에 컨텍스트 캐시, 실행 프로그램, 운영체제용 메모리가 필요합니다.
  • 구매 전에는 최대 실행 가능 모델보다 매일 사용할 모델의 체감 속도를 기준으로 판단합니다.
CALCULATED 01

모델 규모·양자화별 가중치 하한

단위 GB · 파라미터 수 × 평균 비트 ÷ 8

Q4_K 수준 4.5bitQ5_K 수준 5.5bit8bit
모델 규모와 양자화별 이론상 가중치 크기
모델Q4_K 수준Q5_K 수준8bit
3B1.7GB2.1GB3GB
8B4.5GB5.5GB8GB
14B7.9GB9.6GB14GB
32B18GB22GB32GB
주의 실측 메모리나 권장 RAM이 아닙니다. GGUF 메타데이터, KV 캐시, 실행 프로그램, 운영체제 메모리가 추가되므로 실제 필요량은 더 큽니다. 출처: Hugging Face GGUF 양자화 표.
SECTION 01

B와 비트가 뜻하는 것

모델 이름의 8B는 대략 80억 개의 파라미터를 가진다는 뜻입니다. 각 파라미터를 16비트로 저장하면 단순 계산상 가중치에 약 16GB가 필요하지만, 4비트로 줄이면 약 4GB 수준으로 내려갑니다. 실제 파일에는 메타데이터와 양자화 방식의 부가 정보가 있으므로 계산값과 정확히 같지는 않습니다.

양자화는 숫자의 정밀도를 줄여 메모리와 저장 공간을 아끼는 방법입니다. Hugging Face의 GGUF 문서는 Q4_K가 평균 4.5비트, Q5_K가 5.5비트, Q6_K가 6.5625비트 수준임을 설명합니다. 비트가 높을수록 원본 정보를 더 보존하는 경향이 있지만 파일과 메모리 사용량도 늘어납니다.

# 가중치의 아주 거친 하한 계산
파라미터 수 × 비트 수 ÷ 8

8B × 4bit ÷ 8 ≈ 4GB
14B × 4bit ÷ 8 ≈ 7GB

# 실제 실행에는 파일 부가 정보와 런타임 메모리가 추가됩니다.
SECTION 02

GGUF 파일 이름 읽는 법

GGUF는 모델 텐서와 표준화된 메타데이터를 한 파일에 담는 형식으로, llama.cpp 계열 실행 도구에서 널리 사용됩니다. 같은 모델 페이지에 Q2, Q4, Q5, Q8처럼 여러 파일이 있으면 일반적으로 숫자가 낮을수록 작고, 높을수록 원본 정밀도에 가까운 변형입니다.

파일 이름의 세부 접미사는 양자화 방법을 나타냅니다. 이름만 보고 절대적인 품질 순위를 단정하기보다, 같은 모델의 서로 다른 변형을 내 질문으로 비교하세요. 처음에는 크기와 품질 균형 때문에 널리 쓰이는 4비트 전후 변형에서 시작하는 것이 실용적입니다.

표기대략적 성격처음 선택할 때
Q2~Q3매우 작은 파일, 품질 손실 가능성 큼메모리가 매우 제한적일 때 시험
Q4크기와 품질의 균형첫 비교 기준으로 적합
Q5~Q6더 큰 파일, 정보 보존 증가Q4 품질이 부족할 때 비교
Q8큰 파일, 높은 정밀도메모리 여유와 명확한 필요가 있을 때
SECTION 03

파일 크기보다 메모리가 더 필요한 이유

실행 중에는 모델 가중치 외에도 대화 내용을 기억하기 위한 KV 캐시, 입력·출력 버퍼, 실행 프로그램이 메모리를 사용합니다. 운영체제와 브라우저 같은 다른 앱도 같은 자원을 사용하므로 모델 파일 크기와 정확히 같은 여유 메모리만 남겨서는 안정적으로 실행하기 어렵습니다.

컨텍스트 길이를 늘리면 더 긴 문서를 한 번에 다룰 수 있지만 캐시 메모리도 증가합니다. Ollama 공식 FAQ는 현재 기본 컨텍스트를 4096 토큰으로 설명하며, 병렬 요청은 요청 수만큼 전체 컨텍스트 할당을 늘릴 수 있다고 안내합니다. ‘긴 문맥을 지원한다’는 모델 사양과 ‘내 장비에서 그 길이를 감당한다’는 사실은 다릅니다.

SECTION 04

RAM과 VRAM은 어떻게 다를까

외장 GPU가 있는 PC에서는 GPU 전용 메모리인 VRAM에 모델이 모두 들어갈 때 일반적으로 가장 빠릅니다. 모델 일부가 시스템 RAM으로 넘어가 CPU와 GPU 사이를 오가면 실행은 가능해도 응답 속도가 크게 낮아질 수 있습니다. `ollama ps`의 PROCESSOR 열은 모델이 CPU와 GPU에 어떤 비율로 적재되었는지 보여줍니다.

Apple Silicon Mac의 통합 메모리는 CPU와 GPU가 하나의 메모리 풀을 공유합니다. 별도 VRAM 숫자만 볼 수 없는 대신 운영체제와 모든 앱이 같은 총량을 사용합니다. 따라서 16GB 통합 메모리 전체를 모델에 쓸 수 있다고 계산하면 안 됩니다.

구성장점주의점
외장 GPU PCVRAM에 맞으면 높은 처리 속도VRAM 초과 시 CPU 오프로딩과 속도 저하
통합 메모리 MacCPU·GPU 간 별도 복사 부담 감소운영체제와 앱이 같은 메모리 공유
CPU 전용GPU 없이도 작은 모델 실행 가능대형 모델의 체감 속도 제한
SECTION 05

숫자표 대신 안전하게 고르는 절차

먼저 아무 모델도 실행하지 않은 평상시 메모리 사용량을 확인합니다. 그다음 목표보다 한 단계 작은 4비트 모델을 받아 짧은 질문과 실제 길이의 공개 문서로 시험합니다. 메모리 압박, 스왑 사용, 응답 지연, 시스템 전체의 끊김을 기록하세요.

문제가 없다면 같은 파라미터 규모에서 더 높은 비트 변형을 비교하거나, 다음 크기의 모델로 올라갑니다. 두 변수를 동시에 바꾸면 품질 차이가 모델 규모 때문인지 양자화 때문인지 알기 어렵습니다. 한 번에 하나만 바꾸는 것이 중요합니다.

  • 평상시 사용 메모리 기록
  • 작은 Q4 전후 모델로 기준선 생성
  • 실제 문서 길이로 세 번 반복
  • 스왑·GPU 적재·첫 응답 지연 기록
  • 양자화 또는 모델 크기 중 하나만 변경
SECTION 06

벤치마크를 비교할 때 빠지기 쉬운 함정

초당 토큰 수만으로 사용성을 판단하면 안 됩니다. 첫 토큰이 나오기까지 20초가 걸린 뒤 빠르게 출력되는 모델과 즉시 시작해 꾸준히 출력되는 모델의 체감은 다릅니다. 프롬프트 길이, 컨텍스트, 배치 설정, 운영체제, 드라이버가 다르면 같은 장비 이름의 결과도 달라집니다.

온라인 결과를 참고할 때는 모델의 정확한 태그와 양자화, 실행 도구 버전, GPU 오프로딩 비율을 확인하세요. 이 정보가 없는 숫자는 구매 판단의 근거로 삼기 어렵습니다. 가장 신뢰할 수 있는 벤치마크는 내 장비에서 내 문서와 고정된 질문으로 반복한 결과입니다.

  • 정확한 모델명과 양자화
  • 실행 도구·버전
  • 컨텍스트 길이와 입력 길이
  • 첫 토큰 지연과 초당 토큰
  • CPU·GPU 적재 비율
  • 전력 모드와 다른 실행 앱
SECTION 07

장비 구매 전 판단 기준

가끔 실행할 수 있는 가장 큰 모델보다 매일 사용할 모델이 충분히 빠른지가 중요합니다. 문서 요약이 주목적이면 긴 컨텍스트에서의 메모리 사용을, 코딩 보조라면 첫 응답 지연과 연속 생성 속도를, 여러 사람이 쓰는 서버라면 동시 요청 시 메모리 증가를 봐야 합니다.

업그레이드가 불가능한 통합 메모리 제품은 운영체제와 향후 모델 증가분까지 고려해 여유 있게 선택합니다. 데스크톱 GPU는 VRAM뿐 아니라 전원 공급 장치, 케이스 크기, 냉각, 드라이버 지원을 함께 확인하세요. 로컬 AI만을 위해 고가 장비를 사기 전에 현재 장비에서 작은 모델로 업무 가치부터 검증하는 편이 안전합니다.

SECTION 08

우리 사이트의 장비 표기 원칙

앞으로 로컬AI 노트의 벤치마크에는 장비 이름만 쓰지 않습니다. 운영체제, 메모리, GPU와 VRAM, 전력 모드, 실행 도구 버전, 모델 전체 이름, 양자화, 컨텍스트와 입력 길이를 함께 적습니다.

직접 측정하지 않은 결과는 ‘공식 문서 기준’ 또는 ‘외부 측정 인용’으로 표시합니다. 제조사 최대 성능과 실제 반복 작업의 체감 성능을 섞지 않으며, 측정 파일과 프롬프트를 가능한 범위에서 재현할 수 있게 공개합니다.

FAQ

자주 묻는 질문

모델 파일이 VRAM보다 작으면 무조건 빠른가요?

아닙니다. 컨텍스트 캐시와 런타임 메모리가 추가되고, GPU·드라이버·실행 도구·모델 구조도 속도에 영향을 줍니다. 실제 적재 상태와 반복 실행을 확인해야 합니다.

16GB 메모리면 14B 4비트 모델을 쓸 수 있나요?

파일이 들어갈 가능성과 쾌적한 사용은 다릅니다. 운영체제, 컨텍스트, 다른 앱의 사용량에 따라 달라지므로 작은 모델에서 단계적으로 확인하는 것이 안전합니다.

Q4와 Q8 중 무엇이 좋나요?

메모리가 충분하고 Q8의 품질 향상이 실제 작업에서 확인된다면 Q8을 선택할 수 있습니다. 처음에는 Q4 전후를 기준으로 같은 질문을 비교해 차이가 가치 있는지 판단하세요.

공식 출처

세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.

Hugging Face GGUF 안내 Hugging Face Transformers GGUF Ollama FAQ — 컨텍스트와 GPU 적재 llama.cpp 지원 백엔드와 양자화

이어서 읽기

로컬 AI용 Mac vs NVIDIA PC, 어떻게 고를까?로컬 AI용 중고 PC·GPU 구매 체크리스트