검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음

먼저 읽는 30초 요약

이 글에서 가져갈 것

  • 모델 로드, 첫 출력, 연속 생성을 따로 측정합니다.
  • 같은 프롬프트와 출력 길이로 반복합니다.
  • 평균뿐 아니라 최악값, 메모리와 오류도 기록합니다.
BENCHMARK 01

체감 속도를 세 구간으로

첫 실행과 반복 실행을 구분합니다.

  1. 01
    LOAD

    모델 적재

  2. 02
    TTFT

    첫 출력 지연

  3. 03
    TOKENS

    연속 생성

  4. 04
    QUALITY

    업무 성공률

활용 기준 조건을 고정하고 중앙값과 최악값, 메모리와 실패를 함께 기록합니다.
SECTION 01

세 가지 시간을 구분합니다

콜드 시작에는 파일을 메모리에 올리는 시간이 포함됩니다. 첫 토큰 지연은 사용자가 기다리는 시간, 초당 토큰은 답이 이어지는 속도를 설명합니다.

SECTION 02

조건을 고정합니다

모델·양자화·런타임·컨텍스트·프롬프트·출력 제한, 전원 모드와 백그라운드 앱을 기록합니다. 첫 실행과 웜 실행을 분리합니다.

SECTION 03

API 측정값을 읽습니다

Ollama의 generate/chat 응답에는 전체 시간, 모델 로드, 프롬프트 평가와 생성 관련 필드가 포함됩니다. 단위와 스트리밍 종료 응답을 확인합니다.

curl http://localhost:11434/api/generate -d '{"model":"gemma3:4b","prompt":"로컬 AI를 설명해줘","stream":false}'
SECTION 04

업무 성공률과 함께 판단합니다

속도가 빨라도 사실 오류가 늘면 좋은 선택이 아닙니다. 실제 문서 세트의 품질 기준을 통과한 후보끼리 성능을 비교합니다.

구간의미
Load저장장치에서 모델 적재
TTFT요청부터 첫 출력까지
Generation첫 출력 이후 생성 속도
Total사용자가 작업을 마칠 때까지
FAQ

자주 묻는 질문

초당 토큰만 보면 되나요?

아닙니다. 대화형 사용은 첫 응답, 배치 작업은 전체 처리량이 더 중요할 수 있습니다.

한 번만 재면 되나요?

최소 여러 번 반복해 중앙값과 최악값을 함께 보세요.

서로 다른 모델을 같은 출력으로 비교할 수 있나요?

출력 길이와 품질 차이가 있으므로 고정 제한과 업무 점수를 함께 기록하세요.

공식 출처

세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.

Ollama Generate API Ollama Chat API llama.cpp 공식 저장소

이어서 읽기

로컬 LLM, 순위표 대신 내 업무로 평가하는 법로컬 AI, 무엇이고 어디서부터 시작해야 할까?