검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음

먼저 읽는 30초 요약

이 글에서 가져갈 것

  • 공식 릴리스·Docker·소스 빌드 중 한 경로만 선택합니다.
  • 모델 카드와 라이선스를 확인한 GGUF를 사용합니다.
  • CLI가 성공한 뒤 OpenAI 호환 로컬 서버를 띄웁니다.
RUNTIME 01

GGUF를 실행하는 최소 경로

CLI가 성공한 뒤 서버를 추가합니다.

  1. 01
    INSTALL

    공식 설치 경로

  2. 02
    GGUF

    모델·라이선스

  3. 03
    CLI

    단일 프롬프트

  4. 04
    SERVER

    localhost API

활용 기준 백엔드와 양자화만 한 번에 하나씩 바꿔 결과를 비교합니다.
SECTION 01

설치 경로를 고릅니다

공식 저장소는 사전 빌드 바이너리, Docker와 소스 빌드를 안내합니다. GPU 백엔드는 CUDA, Metal, Vulkan 등 장비에 맞게 선택합니다.

SECTION 02

GGUF를 선택합니다

GGUF에는 텐서와 메타데이터가 담깁니다. 같은 모델에도 여러 양자화가 있으므로 Q4 정도로 시작하고 모델 카드의 채팅 템플릿과 라이선스를 확인합니다.

SECTION 03

CLI로 먼저 실행합니다

현재 공식 Quick Start는 Hugging Face 모델을 바로 내려받아 실행하는 흐름을 제공합니다.

llama-cli -hf ggml-org/Qwen3.5-0.8B-GGUF
SECTION 04

서버는 로컬에서 검증합니다

애플리케이션 연결이 필요하면 서버를 실행하고 localhost에서 먼저 호출합니다. 외부 바인딩에는 별도의 인증 계층이 필요합니다.

llama-server -hf ggml-org/Qwen3.5-0.8B-GGUF
FAQ

자주 묻는 질문

GGUF가 모델 이름인가요?

아니요. 모델 가중치와 메타데이터를 담는 파일 형식입니다.

무조건 직접 빌드해야 하나요?

아닙니다. 공식 사전 빌드 바이너리와 Docker 경로도 있습니다.

GPU 없이 되나요?

CPU 실행이 가능하지만 모델 크기와 하드웨어에 따라 속도가 느릴 수 있습니다.

공식 출처

세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.

llama.cpp 공식 저장소 Hugging Face GGUF 문서

이어서 읽기

Ollama 설치부터 첫 모델 실행까지LM Studio로 첫 로컬 모델 실행하기