검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음
먼저 읽는 30초 요약
이 글에서 가져갈 것
- 모델 로드, 첫 출력, 연속 생성을 따로 측정합니다.
- 같은 프롬프트와 출력 길이로 반복합니다.
- 평균뿐 아니라 최악값, 메모리와 오류도 기록합니다.
BENCHMARK 01
체감 속도를 세 구간으로
첫 실행과 반복 실행을 구분합니다.
- 01LOAD
모델 적재
- 02TTFT
첫 출력 지연
- 03TOKENS
연속 생성
- 04QUALITY
업무 성공률
세 가지 시간을 구분합니다
콜드 시작에는 파일을 메모리에 올리는 시간이 포함됩니다. 첫 토큰 지연은 사용자가 기다리는 시간, 초당 토큰은 답이 이어지는 속도를 설명합니다.
조건을 고정합니다
모델·양자화·런타임·컨텍스트·프롬프트·출력 제한, 전원 모드와 백그라운드 앱을 기록합니다. 첫 실행과 웜 실행을 분리합니다.
API 측정값을 읽습니다
Ollama의 generate/chat 응답에는 전체 시간, 모델 로드, 프롬프트 평가와 생성 관련 필드가 포함됩니다. 단위와 스트리밍 종료 응답을 확인합니다.
curl http://localhost:11434/api/generate -d '{"model":"gemma3:4b","prompt":"로컬 AI를 설명해줘","stream":false}'업무 성공률과 함께 판단합니다
속도가 빨라도 사실 오류가 늘면 좋은 선택이 아닙니다. 실제 문서 세트의 품질 기준을 통과한 후보끼리 성능을 비교합니다.
| 구간 | 의미 |
|---|---|
| Load | 저장장치에서 모델 적재 |
| TTFT | 요청부터 첫 출력까지 |
| Generation | 첫 출력 이후 생성 속도 |
| Total | 사용자가 작업을 마칠 때까지 |
자주 묻는 질문
초당 토큰만 보면 되나요?
아닙니다. 대화형 사용은 첫 응답, 배치 작업은 전체 처리량이 더 중요할 수 있습니다.
한 번만 재면 되나요?
최소 여러 번 반복해 중앙값과 최악값을 함께 보세요.
서로 다른 모델을 같은 출력으로 비교할 수 있나요?
출력 길이와 품질 차이가 있으므로 고정 제한과 업무 점수를 함께 기록하세요.
공식 출처
세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.