먼저 읽는 30초 요약
이 글에서 가져갈 것
- 로컬 실행은 개인정보 통제와 오프라인 사용에 유리하지만, 자동으로 완전한 보안을 보장하지는 않습니다.
- 처음에는 GUI 또는 CLI 도구 하나와 3B~8B급 양자화 모델 하나만 선택하는 편이 좋습니다.
- 모델 순위보다 내 문서와 질문으로 정확도·속도·일관성을 직접 비교해야 합니다.
질문이 답이 되기까지
실선은 기본 로컬 경로, 점선은 선택적 외부 기능입니다.
내 컴퓨터는 어느 등급일까?
세 항목 중 가장 낮은 등급을 기준으로 보수적으로 안내합니다.
- 모델 후보
- 3B–8B Q4
- 추천 작업
- 대화·번역·일반 요약
- 먼저 확인
- 큰 모델과 긴 컨텍스트는 메모리 여유를 확인해야 합니다.
제약 기준: CPU · RAM · GPU
| 등급 | CPU 기준 예시 | RAM | GPU 기준 예시 | 모델 후보 |
|---|---|---|---|---|
| 체험 | 구형·지원 확인 필요 | 8GB | CPU 실행 가능 | 1B–3B Q4 |
| 입문 | 최근 4–6코어·Apple M1/M2 | 16GB | 내장·통합·VRAM 4–6GB | 3B–8B Q4 |
| 활용 | 최근 8코어+·Apple Pro급 | 32GB | VRAM 8–12GB | 8B–14B Q4 |
| 확장 | 고성능 12코어+·Apple Max급 | 64GB+ | VRAM 16–24GB+ | 14B–32B Q4 |
중요: 구매 보증이나 공통 공식 최소사양이 아닙니다. CPU 세대·명령어, 메모리 대역폭, 컨텍스트 길이, 양자화와 실행 도구에 따라 결과가 달라집니다. 새 장비를 사기 전에 작은 모델로 직접 시험하세요.
로컬 AI를 한 문장으로 이해하기
ChatGPT 같은 일반적인 클라우드 서비스는 질문을 원격 서버로 보내고 그곳의 모델이 답을 생성합니다. 로컬 AI는 모델 가중치와 실행 프로그램을 내 컴퓨터에 저장하고, 답을 만드는 추론 과정을 기기 안에서 수행합니다. 모델 다운로드가 끝난 뒤에는 인터넷을 끊어도 기본적인 대화와 요약을 계속할 수 있습니다.
이 차이는 데이터 경로와 비용 구조를 바꿉니다. 반복적인 API 호출 비용 없이 모델을 여러 번 실행할 수 있고, 파일을 외부 서비스에 전송하지 않는 구성을 만들 수 있습니다. 대신 모델 업데이트, 저장 공간, 메모리 관리, 접근 통제는 사용자의 책임이 됩니다.
클라우드보다 유리한 경우와 불리한 경우
개인 기록, 내부 초안, 공개 전 문서처럼 외부 전송을 최소화해야 하는 작업은 로컬 실행의 장점이 분명합니다. 네트워크가 불안정한 현장이나 동일한 프롬프트를 수백 번 반복하는 개발 테스트에서도 유용합니다. 모델과 시스템 프롬프트를 자유롭게 바꾸며 실험할 수 있다는 점도 큽니다.
반면 최신 대형 클라우드 모델의 추론 품질, 웹 검색, 대규모 문맥, 여러 도구를 한꺼번에 사용하는 기능이 필요하면 로컬 환경이 불리할 수 있습니다. 특히 작은 모델은 그럴듯하지만 틀린 답을 만들 가능성이 있고, 큰 모델은 메모리와 전력을 많이 요구합니다. 중요한 판단은 사람이 원문과 대조해야 합니다.
| 기준 | 로컬 AI | 클라우드 AI |
|---|---|---|
| 데이터 경로 | 구성에 따라 기기 안에서 처리 | 서비스 제공자의 서버로 전송 |
| 인터넷 | 다운로드 후 오프라인 사용 가능 | 대부분 연결 필요 |
| 비용 | 장비·전기·관리 비용 | 구독 또는 사용량 비용 |
| 성능 | 내 장비와 모델 크기에 좌우 | 대형 인프라 활용 |
| 관리 | 업데이트와 보안을 직접 담당 | 제공자가 인프라 관리 |
이런 업무에서 먼저 시험해 보세요
첫 프로젝트는 정답이 하나뿐인 고위험 업무보다 결과를 사람이 쉽게 검토할 수 있는 작업이 좋습니다. 예를 들어 이미 알고 있는 문서를 요약하거나, 공개 자료를 정리하거나, 문장 표현을 여러 가지로 바꾸는 작업은 품질을 판단하기 쉽습니다.
회사 문서를 사용하려면 조직의 보안 정책과 모델 라이선스를 먼저 확인해야 합니다. ‘내 PC에서 실행한다’는 사실만으로 회사 데이터 사용 승인이 생기는 것은 아닙니다.
- 회의 메모를 항목별로 정리하고 원문과 대조하기
- 공개된 기술 문서에서 질문·답변 초안 만들기
- 이메일과 보고서의 문체를 바꾸되 사실은 사람이 확인하기
- 개발 중인 애플리케이션의 반복적인 응답 형식 테스트
- 인터넷이 없는 환경에서 번역·교정·아이디어 정리하기
도구는 사용 방식으로 고릅니다
터미널 명령어에 익숙하고 다른 프로그램과 연결할 계획이라면 Ollama가 단순합니다. 모델 검색과 설정을 화면에서 처리하고 싶다면 LM Studio 같은 데스크톱 도구가 편합니다. 더 세밀한 성능 옵션과 다양한 하드웨어 백엔드를 직접 조절하려면 llama.cpp가 적합합니다.
처음부터 세 도구를 모두 설치할 필요는 없습니다. 같은 모델이라도 실행 도구와 설정이 달라지면 결과 비교가 어려워집니다. 첫 주에는 도구 하나를 고정하고 모델만 바꾸는 편이 문제 원인을 찾기 쉽습니다.
| 도구 | 잘 맞는 사용자 | 처음 느낄 수 있는 장벽 |
|---|---|---|
| Ollama | 간단한 명령어와 API 연결이 필요한 사용자 | 터미널 사용 |
| LM Studio | 화면에서 모델을 찾고 실행하려는 사용자 | 옵션과 모델 종류가 많음 |
| llama.cpp | 성능 옵션과 실행 방식을 세밀하게 조정하려는 사용자 | 명령어와 개념 학습 |
첫 모델은 작게 시작합니다
모델 이름에 붙는 3B, 8B, 14B 같은 표기는 대략적인 파라미터 규모를 뜻합니다. 숫자가 커질수록 항상 내 작업에서 더 좋은 것은 아니며, 필요한 메모리와 응답 지연도 함께 증가합니다. 처음에는 3B~8B급의 4비트 전후 양자화 모델로 전체 흐름을 확인하는 편이 안전합니다.
저장장치에 모델 파일이 들어간다고 해서 원활히 실행되는 것은 아닙니다. 실행 중에는 모델 가중치 외에도 대화 문맥을 위한 캐시와 프로그램, 운영체제가 메모리를 사용합니다. 목표 모델보다 한 단계 작은 모델로 시작해 실제 문서 길이와 질문으로 테스트한 뒤 크기를 늘리세요.
30분 안에 첫 대화를 만드는 순서
Ollama를 선택했다면 공식 다운로드 페이지에서 운영체제에 맞는 설치 프로그램을 받고, 설치가 끝난 뒤 터미널 또는 PowerShell을 엽니다. 아래 명령은 예시로 4B급 모델을 내려받아 대화를 시작합니다. 모델 이름과 제공 여부는 실행 시점의 공식 모델 목록에서 다시 확인하세요.
첫 다운로드는 수 GB의 네트워크와 저장 공간을 사용할 수 있습니다. 다운로드가 끝난 뒤 질문 프롬프트가 보이고 답이 생성되면 기본 설치는 성공한 것입니다. 대화를 끝낼 때는 `/bye`를 입력합니다.
# 첫 모델 다운로드와 대화 시작
ollama run gemma3:4b
# 대화 종료
/bye좋은 모델인지 평가하는 작은 시험
인터넷의 종합 순위만 보고 모델을 고르면 실제 업무와 맞지 않을 수 있습니다. 자신이 자주 다루는 공개 문서 한 개와 정답을 알고 있는 질문 다섯 개를 준비하세요. 같은 시스템 프롬프트와 설정으로 모델마다 세 번씩 실행하면 일관성과 오류 유형을 비교할 수 있습니다.
속도는 첫 글자가 나올 때까지 걸린 시간과 답변이 이어지는 체감 속도를 따로 기록합니다. 품질은 사실 정확성, 지시 준수, 한국어 자연스러움, 인용한 근거의 일치 여부로 나눠 평가하세요. 긴 답 하나보다 짧은 반복 시험이 모델 특성을 더 잘 보여줍니다.
- 사실 질문: 원문에 있는 숫자와 이름을 정확히 찾는가
- 요약 질문: 핵심을 빠뜨리거나 없는 내용을 추가하지 않는가
- 형식 질문: 표·JSON·목록처럼 요청한 구조를 지키는가
- 거절 시험: 문서에 없는 정보를 추측하지 않고 모른다고 말하는가
- 반복 시험: 같은 질문 세 번의 결론이 크게 달라지지 않는가
첫 주 운영 체크리스트
첫날의 목표는 최고 성능이 아니라 재현 가능한 기준선을 만드는 것입니다. 도구 버전, 모델 이름, 양자화 종류, 컨텍스트 설정, 테스트 질문을 한 문서에 기록하세요. 나중에 업데이트로 결과가 변했을 때 원인을 찾을 수 있습니다.
민감한 자료는 이 기본 시험이 끝난 뒤에 검토합니다. 네트워크 사용, 로그 저장 위치, 자동 백업, 플러그인 연결을 확인하기 전에는 공개 자료만 사용하세요.
- 도구 하나만 설치
- 작은 모델 하나만 다운로드
- 공개 문서로 기본 시험
- 메모리 사용과 응답 시간 기록
- 네트워크·로그·업데이트 설정 확인
자주 묻는 질문
인터넷을 완전히 끊어도 사용할 수 있나요?
모델과 실행 프로그램이 이미 설치되어 있고 웹 검색이나 외부 도구를 사용하지 않는다면 기본 추론은 가능합니다. 모델 다운로드, 업데이트, 클라우드 모델, 웹 검색은 네트워크가 필요합니다.
무료 모델이면 업무에 마음대로 사용해도 되나요?
아닙니다. 공개 다운로드 가능 여부와 상업적 사용 허용 여부는 다릅니다. 모델 카드와 라이선스, 조직 정책을 각각 확인해야 합니다.
작은 모델도 문서 검색에 쓸 수 있나요?
가능하지만 문서를 나누고 관련 부분을 찾는 검색 구조가 필요할 수 있습니다. 첫 단계에서는 짧은 공개 문서를 직접 입력해 품질을 확인한 뒤 RAG 구성을 검토하세요.
공식 출처
세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.