검증 범위2026.08.11 Ollama 공식 Quickstart·CLI·FAQ·Troubleshooting 문서의 현재 명령과 설정을 대조함

먼저 읽는 30초 요약

이 글에서 가져갈 것

  • macOS·Windows는 공식 설치 프로그램, Linux는 공식 설치 안내를 사용합니다.
  • `ollama ps`의 PROCESSOR 열로 CPU·GPU 적재 비율을 확인할 수 있습니다.
  • 로컬 모델과 `:cloud` 모델은 데이터 경로가 다르므로 이름을 확인해야 합니다.
DIAGNOSTIC 01

응답이 느릴 때의 확인 순서

느리다는 증상만으로 모델을 다시 설치하지 않습니다.

  1. 01
    반복 실행도 느린가?

    첫 실행만 느리다면 모델 적재 시간일 수 있습니다.

  2. 02
    ollama ps 확인

    PROCESSOR에서 CPU·GPU 적재 비율을 봅니다.

  3. 03
    메모리 여유 확인

    다른 고메모리 앱과 긴 대화를 닫고 다시 시험합니다.

  4. 04
    한 단계 작은 모델

    같은 질문으로 크기만 바꿔 병목을 확인합니다.

판단 기준 한 번에 하나의 조건만 바꾸고 첫 응답 지연과 연속 출력 속도를 따로 기록합니다.
SECTION 01

설치 전에 세 가지만 확인하세요

Ollama는 macOS, Windows, Linux를 지원합니다. 공식 다운로드 페이지에서 운영체제에 맞는 설치 방법을 사용하고, 비공식 패키지나 출처가 불분명한 설치 파일은 피하세요. 모델은 수 GB에서 수십 GB가 될 수 있으므로 시스템 드라이브의 여유 공간을 먼저 확인합니다.

노트북은 전원을 연결하고, 대용량 다운로드가 가능한 네트워크를 준비합니다. 회사 장비라면 프로그램 설치 권한과 보안 정책을 먼저 확인하세요. 설치 자체는 작아 보여도 이후 내려받는 모델 파일이 저장 공간의 대부분을 차지합니다.

확인은 숫자로 남기는 편이 좋습니다. 운영체제 버전, CPU·GPU 모델, 전체 RAM, 현재 여유 저장 공간을 적고 첫 모델 다운로드 뒤 공간이 얼마나 줄었는지 비교하세요. 지원 여부가 불분명하거나 여유 공간이 빠듯하면 설치를 강행하지 말고 Ollama의 최신 시스템·GPU 안내와 모델 크기를 먼저 대조합니다.

  • 운영체제와 CPU·GPU 종류 확인
  • 최소 수십 GB의 여유 저장 공간 확보
  • 공식 다운로드 주소인지 확인
  • 회사 장비라면 설치·모델 사용 승인 확인
SECTION 02

운영체제별 설치 흐름

macOS와 Windows에서는 Ollama 공식 다운로드 페이지의 설치 프로그램을 실행합니다. 설치 후 macOS 메뉴 막대 또는 Windows 작업 표시줄에 Ollama가 실행 중인지 확인합니다. 터미널이나 PowerShell에서 `ollama`를 입력했을 때 메뉴나 도움말이 열리면 명령줄 도구가 인식된 것입니다.

Linux는 배포판과 서비스 구성에 따라 차이가 있으므로 공식 Linux 설치 문서를 따릅니다. 설치 후 서비스가 실행되지 않으면 `ollama serve`로 직접 시작해 오류 메시지를 먼저 확인할 수 있습니다. 원격 서버에 설치할 때는 기본 포트를 외부에 바로 공개하지 마세요.

설치 완료의 기준은 아이콘이 보이는 것이 아니라 CLI와 로컬 서비스가 함께 응답하는 것입니다. 새 터미널에서 `ollama`가 도움말을 표시하고, 첫 모델 실행 명령이 서버에 연결되어야 합니다. Linux 서비스 관리자나 데스크톱 앱이 자동 시작을 맡는 환경에서 `ollama serve`를 중복 실행하면 포트 충돌이 날 수 있으므로 기존 프로세스를 먼저 확인하세요.

# 설치 확인
ollama

# 서버를 직접 시작해야 하는 환경
ollama serve
SECTION 03

첫 모델 다운로드와 대화 시작

아래 예시는 비교적 작은 4B급 모델을 실행합니다. 처음 실행하면 모델을 내려받은 뒤 대화 모드로 들어갑니다. 다운로드 진행률이 멈춘 것처럼 보여도 디스크 쓰기나 네트워크가 진행 중일 수 있으므로 시스템 모니터를 함께 확인하세요.

프롬프트가 나타나면 ‘이 답을 세 문장으로 설명해줘’처럼 결과를 쉽게 확인할 수 있는 질문부터 입력합니다. 응답이 끝까지 출력되고 다음 입력을 받을 수 있으면 기본 실행이 성공한 것입니다. `/bye`로 대화를 종료합니다.

첫 질문에는 개인정보나 업무 문서를 넣지 않습니다. 정답을 알고 있는 공개 주제로 한 번 답하게 하고, 같은 명령을 다시 실행해 이미 받은 모델이 재다운로드 없이 시작되는지 확인하세요. 모델 이름은 태그까지 기록하고 공식 모델 라이브러리에서 해당 이름이 계속 제공되는지 확인해야 나중에 다른 파일을 같은 모델로 착각하지 않습니다.

ollama run gemma3:4b

>>> 로컬 AI와 클라우드 AI의 차이를 세 문장으로 설명해줘.

# 종료
/bye
SECTION 04

설치와 실행이 정상인지 확인하는 법

`ollama ls`는 내려받은 모델과 파일 크기를 보여줍니다. `ollama ps`는 현재 메모리에 올라간 모델, 사용 크기, 처리 장치와 유지 시간을 표시합니다. 공식 FAQ에 따르면 PROCESSOR가 `100% GPU`면 전부 GPU에, `100% CPU`면 시스템 메모리에, 혼합 비율이면 두 장치에 나뉘어 올라간 상태입니다.

GPU가 있는데도 CPU로만 표시되면 즉시 재설치하기보다 지원되는 하드웨어인지, 그래픽 드라이버가 최신인지, 다른 앱이 VRAM을 점유하는지부터 확인하세요. 모델이 VRAM보다 크면 일부가 CPU로 이동할 수 있으며 실행은 되더라도 속도가 크게 낮아질 수 있습니다.

검증할 때는 실행 중인 바로 그 모델을 대상으로 `ollama ps`를 읽어야 합니다. 모델이 메모리에서 내려간 뒤에는 목록이 비어 있을 수 있으므로 짧은 질문을 실행하고 곧바로 확인하세요. PROCESSOR 값과 함께 첫 응답 대기 시간, 두 번째 실행 시간, 시스템 메모리 사용량을 기록하면 ‘설치는 성공했지만 실사용은 어려운’ 상태도 구분할 수 있습니다.

# 설치된 모델
ollama ls

# 현재 메모리에 올라간 모델과 처리 장치
ollama ps
SECTION 05

모델을 내려받고 정리하는 명령

대화를 바로 시작하지 않고 모델만 받을 때는 `pull`을 사용합니다. 실행 중인 모델을 메모리에서 즉시 내릴 때는 `stop`, 저장장치에서 모델 파일을 지울 때는 `rm`을 사용합니다. `stop`은 파일을 삭제하지 않으므로 다음 실행에서 다시 다운로드할 필요가 없습니다.

Ollama는 기본적으로 사용한 모델을 잠시 메모리에 유지해 다음 요청을 빠르게 처리합니다. 공식 FAQ의 현재 기본값은 5분입니다. 메모리를 바로 돌려받아야 할 때 `ollama stop 모델명`을 실행하세요.

정리 전에는 `ollama ls`에서 정확한 이름과 크기를 확인하고, `stop` 후 `ps`에서 내려갔는지 검증합니다. `rm`은 저장 파일을 지우므로 다시 사용할 때 재다운로드가 필요합니다. 디스크 공간을 확보하려는 목적이라면 삭제 전 모델명·태그와 출처를 기록하고, `ls` 결과에서 실제로 사라졌는지까지 확인해야 정리 작업이 끝납니다.

목적명령파일 삭제
모델만 다운로드ollama pull gemma3:4b아니오
설치 모델 확인ollama ls아니오
실행 모델 확인ollama ps아니오
메모리에서 내리기ollama stop gemma3:4b아니오
모델 제거ollama rm gemma3:4b예
SECTION 06

응답이 느릴 때 확인할 순서

첫 응답만 느리고 이후에는 빨라진다면 모델을 저장장치에서 메모리로 올리는 시간이 포함된 것일 수 있습니다. 매번 느리다면 `ollama ps`에서 CPU·GPU 적재 상태를 확인하고, 브라우저·게임·영상 편집기처럼 메모리를 많이 쓰는 앱을 닫은 뒤 다시 실행합니다.

대화가 길어질수록 컨텍스트 캐시에 더 많은 메모리가 필요합니다. 새 대화를 시작했을 때 속도가 회복되는지 확인하고, 필요 이상으로 큰 컨텍스트 값을 사용하지 마세요. Ollama의 현재 자동 기본값은 VRAM 규모에 따라 달라질 수 있으므로 고정 숫자를 가정하지 말고 `ollama ps`의 CONTEXT 열로 실제 값을 확인합니다.

한 번에 한 변수만 바꾸는 것이 핵심입니다. 같은 모델·프롬프트에서 첫 실행과 반복 실행을 나누고, 그다음 다른 앱 종료, 새 대화, 작은 모델 순으로 비교하세요. 모델 변경과 컨텍스트 변경을 동시에 하면 개선 원인을 알 수 없습니다. 속도가 빨라져도 답의 누락이나 형식 오류가 늘지 않았는지 같은 정답표로 다시 확인합니다.

  • 첫 실행과 반복 실행의 속도를 따로 비교
  • `ollama ps`에서 PROCESSOR 확인
  • 다른 고메모리 앱 종료
  • 새 대화로 컨텍스트 초기화
  • 더 작은 모델 또는 작은 양자화 변형 시험
SECTION 07

대표 오류와 첫 대응

명령을 찾을 수 없다는 메시지가 나오면 앱이 실행 중인지 확인한 뒤 터미널을 완전히 닫았다가 다시 엽니다. 서버 연결 오류라면 Ollama 프로세스가 실행 중인지 확인하고, 필요하면 `ollama serve`를 실행해 터미널에 표시되는 오류를 읽습니다.

다운로드 실패는 저장 공간, 프록시, 인증서, 네트워크 차단을 순서대로 확인합니다. 회사 프록시 환경에서 Ollama 공식 FAQ는 모델 다운로드에 `HTTPS_PROXY` 사용을 안내하며, 잘못된 `HTTP_PROXY` 설정은 로컬 클라이언트 연결을 방해할 수 있다고 경고합니다. 원인을 모를 때는 공식 Troubleshooting 문서에 안내된 로그 위치부터 확인하세요.

로그를 공유할 때는 사용자 이름, 파일 경로, 프롬프트와 네트워크 주소가 포함되지 않았는지 먼저 가립니다. 오류 시각과 바로 앞에 실행한 명령, Ollama·운영체제 버전을 함께 기록하면 단순 재설치보다 재현성이 높습니다. 공식 문서의 로그 위치와 진단 절차가 업데이트될 수 있으므로 오래된 블로그 명령보다 현재 Troubleshooting 페이지를 기준으로 판단하세요.

증상먼저 볼 것다음 행동
command not found설치 완료·터미널 재시작공식 설치 프로그램 재확인
서버 연결 실패Ollama 프로세스ollama serve로 오류 확인
모델 다운로드 실패공간·네트워크·프록시로그와 HTTPS_PROXY 확인
매우 느린 응답ollama ps의 PROCESSOR작은 모델·메모리 확보
메모리 부족모델 크기·컨텍스트모델 중지 후 더 작은 모델
SECTION 08

로컬 모델인지 반드시 확인하세요

Ollama 공식 문서에는 로컬 모델과 클라우드 모델이 함께 안내됩니다. 이름에 `:cloud`가 붙는 모델은 원격에서 처리되므로, 민감한 자료를 다룰 때는 실행한 모델 이름을 확인해야 합니다. Ollama는 로컬 실행 시 프롬프트와 데이터를 보지 않는다고 안내하지만, 클라우드 모델과 웹 검색은 외부 서비스를 사용합니다.

완전한 로컬 전용 구성이 필요하면 공식 FAQ에 따라 `~/.ollama/server.json`의 `disable_ollama_cloud` 설정 또는 운영체제 서비스에 적용한 `OLLAMA_NO_CLOUD=1` 환경 변수를 사용할 수 있습니다. 이미 실행 중인 앱과 별도의 서버를 중복 실행하지 말고, 설정을 바꾼 뒤 Ollama 앱 또는 서비스를 재시작해 로그에서 클라우드 비활성화 상태를 확인합니다.

설정만 저장하고 끝내지 말고 기능 경계를 시험하세요. `:cloud`가 없는 로컬 모델로 공개 질문이 계속 처리되는지 확인한 뒤, 네트워크를 끊은 상태에서도 같은 요청이 성공하는지 비교합니다. 별도 UI나 플러그인을 연결했다면 그 프로그램의 웹 검색·텔레메트리·동기화 설정은 Ollama 설정과 독립적일 수 있으므로 따로 점검해야 합니다.

# ~/.ollama/server.json
{
  "disable_ollama_cloud": true
}

# 저장 후 Ollama 앱 또는 서비스를 재시작하고
# 모델 이름에 :cloud가 없는지 확인
ollama run gemma3:4b
SECTION 09

설치 후 기록해 둘 정보

문제가 생긴 뒤 기억에 의존하지 않도록 설치 날짜, 운영체제 버전, GPU와 메모리, Ollama 버전, 모델의 정확한 이름을 기록하세요. 모델명 뒤의 태그가 다르면 파일과 성능 특성도 달라질 수 있습니다.

업데이트 뒤 결과가 달라지면 같은 테스트 질문을 다시 실행하고 변경 내용을 기록합니다. 중요한 업무에 사용한다면 자동 업데이트 직후 곧바로 운영에 투입하지 말고 공개 자료로 기본 시험을 반복하세요.

기록에는 성공 사례뿐 아니라 실패 조건도 남깁니다. 어떤 모델과 문맥 길이에서 메모리 부족이 났는지, GPU 적재가 언제 CPU 혼합으로 바뀌었는지, 로그 위치와 복구 방법을 적어 두세요. 업데이트 전후에 `ollama ls`, `ollama ps`, 고정 질문 결과를 비교하면 회귀가 발생했을 때 이전 상태로 돌아가거나 업무 적용을 멈출 근거가 생깁니다.

FAQ

자주 묻는 질문

`ollama stop`과 `ollama rm`은 무엇이 다른가요?

stop은 실행 중인 모델을 메모리에서 내리지만 다운로드한 파일은 남깁니다. rm은 저장장치의 모델 파일을 삭제합니다. 실제로 적용할 때는 본문의 ‘설치 전에 세 가지만 확인하세요’ 절차를 따라 한 조건씩 확인하고 결과를 기록하세요.

GPU가 없어도 실행할 수 있나요?

CPU와 시스템 메모리로 실행할 수 있는 모델이 있지만 일반적으로 더 느립니다. 작은 모델로 먼저 확인하고 `ollama ps`에서 실제 처리 장치를 확인하세요. 실제로 적용할 때는 본문의 ‘운영체제별 설치 흐름’ 절차를 따라 한 조건씩 확인하고 결과를 기록하세요.

모델 파일은 어디에 저장되나요?

공식 FAQ 기준으로 macOS는 `~/.ollama/models`, Linux 표준 설치는 `/usr/share/ollama/.ollama/models`, Windows는 사용자 폴더 아래 `.ollama\models`입니다. `OLLAMA_MODELS`로 위치를 바꿀 수 있습니다.

업데이트는 어떻게 하나요?

macOS와 Windows 앱은 업데이트를 내려받은 뒤 메뉴에서 재시작해 적용할 수 있습니다. Linux는 공식 FAQ의 현재 설치 명령을 다시 실행하는 방식을 안내합니다. 실제로 적용할 때는 본문의 ‘설치와 실행이 정상인지 확인하는 법’ 절차를 따라 한 조건씩 확인하고 결과를 기록하세요.

공식 출처

세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.

Ollama Quickstart Ollama CLI Reference Ollama FAQ Ollama Troubleshooting Ollama Context Length Ollama Download

이어서 읽기

LM Studio는 로컬인데 왜 인터넷 연결이 필요했을까모델 다운로드 실패와 로컬 실행 실패를 분리한 방법