먼저 읽는 30초 요약
이 글에서 가져갈 것
- macOS·Windows는 공식 설치 프로그램, Linux는 공식 설치 안내를 사용합니다.
- `ollama ps`의 PROCESSOR 열로 CPU·GPU 적재 비율을 확인할 수 있습니다.
- 로컬 모델과 `:cloud` 모델은 데이터 경로가 다르므로 이름을 확인해야 합니다.
응답이 느릴 때의 확인 순서
느리다는 증상만으로 모델을 다시 설치하지 않습니다.
- 01반복 실행도 느린가?
첫 실행만 느리다면 모델 적재 시간일 수 있습니다.
- 02
ollama ps확인PROCESSOR에서 CPU·GPU 적재 비율을 봅니다.
- 03메모리 여유 확인
다른 고메모리 앱과 긴 대화를 닫고 다시 시험합니다.
- 04한 단계 작은 모델
같은 질문으로 크기만 바꿔 병목을 확인합니다.
설치 전에 세 가지만 확인하세요
Ollama는 macOS, Windows, Linux를 지원합니다. 공식 다운로드 페이지에서 운영체제에 맞는 설치 방법을 사용하고, 비공식 패키지나 출처가 불분명한 설치 파일은 피하세요. 모델은 수 GB에서 수십 GB가 될 수 있으므로 시스템 드라이브의 여유 공간을 먼저 확인합니다.
노트북은 전원을 연결하고, 대용량 다운로드가 가능한 네트워크를 준비합니다. 회사 장비라면 프로그램 설치 권한과 보안 정책을 먼저 확인하세요. 설치 자체는 작아 보여도 이후 내려받는 모델 파일이 저장 공간의 대부분을 차지합니다.
- 운영체제와 CPU·GPU 종류 확인
- 최소 수십 GB의 여유 저장 공간 확보
- 공식 다운로드 주소인지 확인
- 회사 장비라면 설치·모델 사용 승인 확인
운영체제별 설치 흐름
macOS와 Windows에서는 Ollama 공식 다운로드 페이지의 설치 프로그램을 실행합니다. 설치 후 macOS 메뉴 막대 또는 Windows 작업 표시줄에 Ollama가 실행 중인지 확인합니다. 터미널이나 PowerShell에서 `ollama`를 입력했을 때 메뉴나 도움말이 열리면 명령줄 도구가 인식된 것입니다.
Linux는 배포판과 서비스 구성에 따라 차이가 있으므로 공식 Linux 설치 문서를 따릅니다. 설치 후 서비스가 실행되지 않으면 `ollama serve`로 직접 시작해 오류 메시지를 먼저 확인할 수 있습니다. 원격 서버에 설치할 때는 기본 포트를 외부에 바로 공개하지 마세요.
# 설치 확인
ollama
# 서버를 직접 시작해야 하는 환경
ollama serve첫 모델 다운로드와 대화 시작
아래 예시는 비교적 작은 4B급 모델을 실행합니다. 처음 실행하면 모델을 내려받은 뒤 대화 모드로 들어갑니다. 다운로드 진행률이 멈춘 것처럼 보여도 디스크 쓰기나 네트워크가 진행 중일 수 있으므로 시스템 모니터를 함께 확인하세요.
프롬프트가 나타나면 ‘이 답을 세 문장으로 설명해줘’처럼 결과를 쉽게 확인할 수 있는 질문부터 입력합니다. 응답이 끝까지 출력되고 다음 입력을 받을 수 있으면 기본 실행이 성공한 것입니다. `/bye`로 대화를 종료합니다.
ollama run gemma3:4b
>>> 로컬 AI와 클라우드 AI의 차이를 세 문장으로 설명해줘.
# 종료
/bye설치와 실행이 정상인지 확인하는 법
`ollama ls`는 내려받은 모델과 파일 크기를 보여줍니다. `ollama ps`는 현재 메모리에 올라간 모델, 사용 크기, 처리 장치와 유지 시간을 표시합니다. 공식 FAQ에 따르면 PROCESSOR가 `100% GPU`면 전부 GPU에, `100% CPU`면 시스템 메모리에, 혼합 비율이면 두 장치에 나뉘어 올라간 상태입니다.
GPU가 있는데도 CPU로만 표시되면 즉시 재설치하기보다 지원되는 하드웨어인지, 그래픽 드라이버가 최신인지, 다른 앱이 VRAM을 점유하는지부터 확인하세요. 모델이 VRAM보다 크면 일부가 CPU로 이동할 수 있으며 실행은 되더라도 속도가 크게 낮아질 수 있습니다.
# 설치된 모델
ollama ls
# 현재 메모리에 올라간 모델과 처리 장치
ollama ps모델을 내려받고 정리하는 명령
대화를 바로 시작하지 않고 모델만 받을 때는 `pull`을 사용합니다. 실행 중인 모델을 메모리에서 즉시 내릴 때는 `stop`, 저장장치에서 모델 파일을 지울 때는 `rm`을 사용합니다. `stop`은 파일을 삭제하지 않으므로 다음 실행에서 다시 다운로드할 필요가 없습니다.
Ollama는 기본적으로 사용한 모델을 잠시 메모리에 유지해 다음 요청을 빠르게 처리합니다. 공식 FAQ의 현재 기본값은 5분입니다. 메모리를 바로 돌려받아야 할 때 `ollama stop 모델명`을 실행하세요.
| 목적 | 명령 | 파일 삭제 |
|---|---|---|
| 모델만 다운로드 | ollama pull gemma3:4b | 아니오 |
| 설치 모델 확인 | ollama ls | 아니오 |
| 실행 모델 확인 | ollama ps | 아니오 |
| 메모리에서 내리기 | ollama stop gemma3:4b | 아니오 |
| 모델 제거 | ollama rm gemma3:4b | 예 |
응답이 느릴 때 확인할 순서
첫 응답만 느리고 이후에는 빨라진다면 모델을 저장장치에서 메모리로 올리는 시간이 포함된 것일 수 있습니다. 매번 느리다면 `ollama ps`에서 CPU·GPU 적재 상태를 확인하고, 브라우저·게임·영상 편집기처럼 메모리를 많이 쓰는 앱을 닫은 뒤 다시 실행합니다.
대화가 길어질수록 컨텍스트 캐시에 더 많은 메모리가 필요합니다. 새 대화를 시작했을 때 속도가 회복되는지 확인하고, 필요 이상으로 큰 컨텍스트 값을 사용하지 마세요. 공식 FAQ에는 기본 컨텍스트가 4096 토큰으로 안내되어 있으며 환경 변수나 실행 설정으로 바꿀 수 있습니다.
- 첫 실행과 반복 실행의 속도를 따로 비교
- `ollama ps`에서 PROCESSOR 확인
- 다른 고메모리 앱 종료
- 새 대화로 컨텍스트 초기화
- 더 작은 모델 또는 작은 양자화 변형 시험
대표 오류와 첫 대응
명령을 찾을 수 없다는 메시지가 나오면 앱이 실행 중인지 확인한 뒤 터미널을 완전히 닫았다가 다시 엽니다. 서버 연결 오류라면 Ollama 프로세스가 실행 중인지 확인하고, 필요하면 `ollama serve`를 실행해 터미널에 표시되는 오류를 읽습니다.
다운로드 실패는 저장 공간, 프록시, 인증서, 네트워크 차단을 순서대로 확인합니다. 회사 프록시 환경에서 Ollama 공식 FAQ는 모델 다운로드에 `HTTPS_PROXY` 사용을 안내하며, 잘못된 `HTTP_PROXY` 설정은 로컬 클라이언트 연결을 방해할 수 있다고 경고합니다. 원인을 모를 때는 공식 Troubleshooting 문서에 안내된 로그 위치부터 확인하세요.
| 증상 | 먼저 볼 것 | 다음 행동 |
|---|---|---|
| command not found | 설치 완료·터미널 재시작 | 공식 설치 프로그램 재확인 |
| 서버 연결 실패 | Ollama 프로세스 | ollama serve로 오류 확인 |
| 모델 다운로드 실패 | 공간·네트워크·프록시 | 로그와 HTTPS_PROXY 확인 |
| 매우 느린 응답 | ollama ps의 PROCESSOR | 작은 모델·메모리 확보 |
| 메모리 부족 | 모델 크기·컨텍스트 | 모델 중지 후 더 작은 모델 |
로컬 모델인지 반드시 확인하세요
Ollama 공식 문서에는 로컬 모델과 클라우드 모델이 함께 안내됩니다. 이름에 `:cloud`가 붙는 모델은 원격에서 처리되므로, 민감한 자료를 다룰 때는 실행한 모델 이름을 확인해야 합니다. Ollama는 로컬 실행 시 프롬프트와 데이터를 보지 않는다고 안내하지만, 클라우드 모델과 웹 검색은 외부 서비스를 사용합니다.
완전한 로컬 전용 구성이 필요하면 공식 FAQ에 따라 `~/.ollama/server.json`의 `disable_ollama_cloud` 또는 `OLLAMA_NO_CLOUD=1` 설정을 사용할 수 있습니다. 설정을 바꾼 뒤 Ollama를 재시작하고 로그에서 클라우드 비활성화 상태를 확인합니다.
# macOS·Linux 예시: 현재 셸에서 클라우드 기능 비활성화
OLLAMA_NO_CLOUD=1 ollama serve
# 로컬 실행 예시 — 모델 이름에 :cloud가 없는지 확인
ollama run gemma3:4b설치 후 기록해 둘 정보
문제가 생긴 뒤 기억에 의존하지 않도록 설치 날짜, 운영체제 버전, GPU와 메모리, Ollama 버전, 모델의 정확한 이름을 기록하세요. 모델명 뒤의 태그가 다르면 파일과 성능 특성도 달라질 수 있습니다.
업데이트 뒤 결과가 달라지면 같은 테스트 질문을 다시 실행하고 변경 내용을 기록합니다. 중요한 업무에 사용한다면 자동 업데이트 직후 곧바로 운영에 투입하지 말고 공개 자료로 기본 시험을 반복하세요.
자주 묻는 질문
`ollama stop`과 `ollama rm`은 무엇이 다른가요?
stop은 실행 중인 모델을 메모리에서 내리지만 다운로드한 파일은 남깁니다. rm은 저장장치의 모델 파일을 삭제합니다.
GPU가 없어도 실행할 수 있나요?
CPU와 시스템 메모리로 실행할 수 있는 모델이 있지만 일반적으로 더 느립니다. 작은 모델로 먼저 확인하고 `ollama ps`에서 실제 처리 장치를 확인하세요.
모델 파일은 어디에 저장되나요?
공식 FAQ 기준으로 macOS는 `~/.ollama/models`, Linux 표준 설치는 `/usr/share/ollama/.ollama/models`, Windows는 사용자 폴더 아래 `.ollama\models`입니다. `OLLAMA_MODELS`로 위치를 바꿀 수 있습니다.
업데이트는 어떻게 하나요?
macOS와 Windows 앱은 업데이트를 내려받은 뒤 메뉴에서 재시작해 적용할 수 있습니다. Linux는 공식 FAQ의 현재 설치 명령을 다시 실행하는 방식을 안내합니다.
공식 출처
세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.