PRIVATE · PRACTICAL · LOCAL
AI를 빌리지 않고,
내 컴퓨터에서.
광고 문구 대신 직접 확인한 설치법, 모델 선택 기준, 장비별 현실적인 성능을 정리합니다. 처음 시작하는 사람도 실패하지 않는 한국어 로컬 AI 가이드.
$ ollama run gemma3:4b
pulling manifest ··· done
loading model locally ··· done
› 내 문서는 어디로 전송돼?
이 대화는 이 컴퓨터 안에서 처리됩니다.
EDITOR'S PICK
처음 읽을 글
FIRSTNO CLOUD REQUIRED
로컬 AI, 무엇이고 어디서부터 시작해야 할까?
클라우드 AI와의 차이부터 도구·모델 선택, 첫 실행 후 평가 방법까지 초보자 관점에서 정리했습니다.
가이드 읽기 →내 컴퓨터는 어느 등급일까?
세 항목 중 가장 낮은 등급을 기준으로 보수적으로 안내합니다.
대화·번역·일반 요약
제약 기준: CPU · RAM · GPU
간이 판단 기준이며 실제 속도와 호환성은 모델·도구에 따라 달라집니다.
전체 등급표와 설명 보기 →GUIDE LIBRARY
가이드 한눈에 보기
설치부터 장비 선택까지, 필요한 글만 빠르게 찾으세요.
로컬 AI, 무엇이고 어디서부터 시작해야 할까?
클라우드 AI와의 차이부터 도구·모델 선택, 첫 실행 후 평가 방법까지 초보자 관점에서 정리했습니다.
Ollama 설치부터 첫 모델 실행까지
Mac·Windows·Linux 설치, 첫 대화, GPU 적재 확인, 모델 관리와 대표 오류 해결을 한 흐름으로 설명합니다.
RAM·VRAM으로 고르는 로컬 모델 크기
파라미터·양자화·컨텍스트·메모리 여유분을 함께 보고, 내 장비에서 쓸 모델을 단계적으로 고르는 방법입니다.
로컬이면 무조건 안전할까? 개인정보 체크리스트
모델·앱·플러그인·로그·네트워크를 각각 확인해 업무 문서의 실제 데이터 경로를 점검합니다.
LM Studio로 첫 로컬 모델 실행하기
설치 조건 확인부터 모델 검색·양자화 선택·메모리 적재·오프라인 사용까지 화면 중심으로 안내합니다.
Ollama API로 첫 로컬 AI 앱 만들기
localhost API 호출, 대화 메시지, 스트리밍, JSON 구조화 출력과 운영 전 보안 점검을 설명합니다.
내 문서를 찾고 답하는 로컬 RAG 입문
문서 추출·청크·임베딩·검색·답변의 전체 흐름과 작은 검증 세트를 만드는 방법을 정리했습니다.
GGUF와 Q4·Q5 양자화, 무엇을 골라야 할까?
GGUF 파일과 양자화 표기의 의미, 메모리·품질의 교환관계, 내 장비에서 비교하는 절차를 설명합니다.
로컬 LLM, 순위표 대신 내 업무로 평가하는 법
고정 질문 세트, 반복 실행, 정확도·형식·속도 기록과 모델 교체 기준을 실전 체크리스트로 제시합니다.
로컬 AI용 Mac vs NVIDIA PC, 어떻게 고를까?
통합 메모리와 전용 VRAM, 이동성·확장성·소프트웨어 호환성을 실제 작업 기준으로 비교합니다.
오래된 노트북으로 로컬 AI 시작하기
교체 전에 CPU 기능·RAM·저장 공간을 확인하고 작은 모델로 가능 범위를 찾는 실전 가이드입니다.
Open WebUI 설치하고 Ollama에 연결하기
Docker로 Open WebUI를 띄우고 로컬 Ollama 연결과 데이터 보관 위치를 확인합니다.
llama.cpp 설치와 GGUF 모델 실행
공식 바이너리 또는 빌드로 llama.cpp를 준비하고 GGUF 모델을 CLI와 로컬 서버로 실행합니다.
한국어 로컬 모델, 어떻게 비교해야 할까?
한국어 이해·요약·존댓말·근거 일치를 고정 질문으로 비교하는 평가 방법입니다.
컨텍스트 길이와 KV 캐시 이해하기
긴 문맥이 메모리와 속도에 미치는 영향을 이해하고 필요한 만큼만 설정합니다.
로컬 AI로 PDF 안전하게 요약하기
텍스트 추출부터 분할 요약, 페이지 근거 확인과 삭제까지 재현 가능한 흐름을 만듭니다.
로컬 음성인식 Whisper 입문
ffmpeg와 Whisper를 설치하고 짧은 공개 음성으로 전사 품질과 처리 시간을 확인합니다.
로컬 AI API를 안전하게 공개하는 법
localhost와 외부 공개의 차이를 이해하고 인증·TLS·방화벽·제한을 계층별로 적용합니다.
로컬 LLM 속도 측정: 첫 응답과 토큰 생성
로드 시간·첫 토큰 지연·생성 속도를 나눠 재현 가능한 성능 기록을 만듭니다.
로컬 AI용 중고 PC·GPU 구매 체크리스트
VRAM·전원·냉각·상태·호환성을 확인하고 실제 모델 테스트로 중고 구매 위험을 줄입니다.
그룹 이미지: Unsplash
ZERO TO LOCAL
오늘, 30분이면
시작할 수 있습니다.
- 01
내 컴퓨터 확인
메모리와 그래픽 메모리를 기준으로 현실적인 모델 크기를 고릅니다.
- 02
도구 하나 설치
처음이라면 복잡한 조합보다 Ollama 또는 LM Studio 하나로 시작합니다.
- 03
작은 모델부터
3B~8B급 양자화 모델로 속도와 품질을 먼저 체감합니다.
“
빠른 것보다 재현되는 것을 기록합니다.
모든 가이드는 테스트 환경, 확인 날짜, 공식 출처를 함께 남깁니다. 협찬 여부도 숨기지 않습니다.