PRIVATE · PRACTICAL · LOCAL
AI를 빌리지 않고,
내 컴퓨터에서.
보유한 PC들로 로컬 AI를 직접 설정하며 생긴 질문과 실패, 수정 과정을 기록합니다. 성공한 명령뿐 아니라 왜 작동하지 않았고 어떻게 다시 검증했는지까지 남깁니다.
$ ollama run gemma3:4b
pulling manifest ··· done
loading model locally ··· done
› 내 문서는 어디로 전송돼?
이 대화는 이 컴퓨터 안에서 처리됩니다.
SERIES 01
설정 기록 첫 글
OPSFIELD NOTE 01
왜 한 대가 아니라 여러 PC를 묶게 되었나
한 장비에 대화·문서 처리·백그라운드 작업을 몰아넣었을 때 생긴 충돌에서 다중 PC 운영망 설계가 시작됐습니다.
가이드 읽기 →내 컴퓨터는 어느 등급일까?
세 항목 중 가장 낮은 등급을 기준으로 보수적으로 안내합니다.
대화·번역·일반 요약
제약 기준: CPU · RAM · GPU
간이 판단 기준이며 실제 속도와 호환성은 모델·도구에 따라 달라집니다.
전체 등급표와 설명 보기 →FIELD NOTES & GUIDES
설정 과정 한눈에 보기
처음 설치한 날부터 여러 PC를 운영하기까지, 실제 과정과 관련 가이드를 함께 정리합니다.
설정 과정
실제로 궁금했고, 막혔고, 수정한 순서대로 기록합니다.
SQLite로 로컬 AI 작업 조정자를 만든 이유
작업·워커·임대 상태를 한곳에 보존하고 ‘선택→소유권 부여→상태 변경’을 하나의 트랜잭션으로 처리했습니다.
‘정상’ 표시 대신 워커가 보고해야 할 것
단순 ping 대신 역할·모델·RAM·온도 상태·전원·사용자 활동과 현재 작업을 heartbeat에 담았습니다.
왜 한 대가 아니라 여러 PC를 묶게 되었나
한 장비에 대화·문서 처리·백그라운드 작업을 몰아넣었을 때 생긴 충돌에서 다중 PC 운영망 설계가 시작됐습니다.
보유 장비를 성능이 아닌 역할로 나누는 법
CPU 이름보다 메모리 여유·냉각·전원·네트워크·사용자 충돌을 기록해 조정자와 워커 역할을 배치합니다.
관련 가이드
설정 기록을 이해하거나 직접 따라 할 때 필요한 참고 자료입니다.
기록된 IP·모델·서비스 상태를 그대로 믿지 않게 된 이유
표면 로그는 빠르게 남지만 실시간 상태와 달라질 수 있어, 운영은 재검증 루프가 필요하다는 실전 결론입니다.
Hermes를 설치하고도 자동 시작을 꺼 둔 이유
모든 모델을 부팅 시 자동 로드하면 RAM과 시작 안정성에 불리할 수 있어, Hermes를 수동 시작으로 둔 이유를 정리합니다.
재부팅 뒤 경로가 달라지지 않게 한 설정
재부팅 후 모델 경로가 바뀌면 서비스는 살아도 실행 지점이 어긋납니다. 경로 고정을 통해 운영 신뢰도를 올립니다.
HDD·보조 SSD를 붙인 뒤 마운트와 쓰기 분리한 이유
추가 스토리지가 늘어난 뒤에도 읽기/쓰기 경로가 바뀌면 추론은 되더라도 기록이 비정상일 수 있습니다.
서비스는 실행 중인데 모델 요청은 실패했던 날
서버 프로세스는 떠 있어도 모델 라우팅·리소스 상태가 맞지 않으면 요청은 계속 실패할 수 있는 원인을 정리합니다.
포트를 열기 전에 사설 연결부터 만든 이유
포트 공개는 최종 단계입니다. 사설 연결과 접근 경로를 먼저 만들고 나서 공개해야 재설정 비용이 줄어듭니다.
모델 이름과 태그가 달라 워커 등록이 실패한 과정
한 글자 차이의 태그, 잘못된 베이스명, 잘못된 양자화가 워커 등록을 막는 실제 사례를 정리합니다.
localhost는 되는데 다른 PC가 못 쓰던 이유
동일 네트워크에서도 바인딩 주소, 방화벽, 포트 노출 규칙이 다르면 접근은 즉시 끊깁니다.
모델 다운로드 실패와 로컬 실행 실패를 분리한 방법
같은 증상이더라도 다운로드 실패와 런타임 실패는 서로 다른 대역입니다. 먼저 원인 구간을 구분하면 대응 속도가 빨라집니다.
LM Studio는 로컬인데 왜 인터넷 연결이 필요했을까
LM Studio에서 모델이 로컬 실행되더라도 어떤 구간은 네트워크를 요구하고, 어디부터 오프라인 동작인지 구분해 점검합니다.
로컬 AI용 중고 PC·GPU 구매 체크리스트
VRAM·전원·냉각·상태·호환성을 확인하고 실제 모델 테스트로 중고 구매 위험을 줄입니다.
로컬 AI API를 안전하게 공개하는 법
localhost와 외부 공개의 차이를 이해하고 인증·TLS·방화벽·제한을 계층별로 적용합니다.
Open WebUI 설치하고 Ollama에 연결하기
Docker로 Open WebUI를 띄우고 로컬 Ollama 연결과 데이터 보관 위치를 확인합니다.
Ollama API로 첫 로컬 AI 앱 만들기
localhost API 호출, 대화 메시지, 스트리밍, JSON 구조화 출력과 운영 전 보안 점검을 설명합니다.
오래된 노트북으로 로컬 AI 시작하기
교체 전에 CPU 기능·RAM·저장 공간을 확인하고 작은 모델로 가능 범위를 찾는 실전 가이드입니다.
로컬 AI용 Mac vs NVIDIA PC, 어떻게 고를까?
통합 메모리와 전용 VRAM, 이동성·확장성·소프트웨어 호환성을 실제 작업 기준으로 비교합니다.
로컬 음성인식 Whisper 입문
ffmpeg와 Whisper를 설치하고 짧은 공개 음성으로 전사 품질과 처리 시간을 확인합니다.
내 문서를 찾고 답하는 로컬 RAG 입문
문서 추출·청크·임베딩·검색·답변의 전체 흐름과 작은 검증 세트를 만드는 방법을 정리했습니다.
로컬 LLM 속도 측정: 첫 응답과 토큰 생성
로드 시간·첫 토큰 지연·생성 속도를 나눠 재현 가능한 성능 기록을 만듭니다.
로컬 LLM, 순위표 대신 내 업무로 평가하는 법
고정 질문 세트, 반복 실행, 정확도·형식·속도 기록과 모델 교체 기준을 실전 체크리스트로 제시합니다.
로컬 AI로 PDF 안전하게 요약하기
텍스트 추출부터 분할 요약, 페이지 근거 확인과 삭제까지 재현 가능한 흐름을 만듭니다.
LM Studio로 첫 로컬 모델 실행하기
설치 조건 확인부터 모델 검색·양자화 선택·메모리 적재·오프라인 사용까지 화면 중심으로 안내합니다.
llama.cpp 설치와 GGUF 모델 실행
공식 바이너리 또는 빌드로 llama.cpp를 준비하고 GGUF 모델을 CLI와 로컬 서버로 실행합니다.
한국어 로컬 모델, 어떻게 비교해야 할까?
한국어 이해·요약·존댓말·근거 일치를 고정 질문으로 비교하는 평가 방법입니다.
GGUF와 Q4·Q5 양자화, 무엇을 골라야 할까?
GGUF 파일과 양자화 표기의 의미, 메모리·품질의 교환관계, 내 장비에서 비교하는 절차를 설명합니다.
컨텍스트 길이와 KV 캐시 이해하기
긴 문맥이 메모리와 속도에 미치는 영향을 이해하고 필요한 만큼만 설정합니다.
Ollama 설치부터 첫 모델 실행까지
Mac·Windows·Linux 설치, 첫 대화, GPU 적재 확인, 모델 관리와 대표 오류 해결을 한 흐름으로 설명합니다.
RAM·VRAM으로 고르는 로컬 모델 크기
파라미터·양자화·컨텍스트·메모리 여유분을 함께 보고, 내 장비에서 쓸 모델을 단계적으로 고르는 방법입니다.
로컬이면 무조건 안전할까? 개인정보 체크리스트
모델·앱·플러그인·로그·네트워크를 각각 확인해 업무 문서의 실제 데이터 경로를 점검합니다.
로컬 AI, 무엇이고 어디서부터 시작해야 할까?
클라우드 AI와의 차이부터 도구·모델 선택, 첫 실행 후 평가 방법까지 초보자 관점에서 정리했습니다.
그룹 이미지: Unsplash
READING ORDER
이 기록을 읽는
순서입니다.
- 01
장비 확인
보유한 PC의 메모리·전원·냉각과 사용 시간을 먼저 기록합니다.
- 02
첫 모델 실행
도구 하나와 작은 모델 하나로 재현 가능한 기준선을 만듭니다.
- 03
장비 연결
localhost와 네트워크 문제를 분리하고 승인된 장비만 연결합니다.
- 04
작업 분배
사용자 요청과 백그라운드 작업의 역할·우선순위를 나눕니다.
- 05
장애 복구
재부팅과 단절을 일부러 만들어 요청과 결과가 보존되는지 확인합니다.
“
빠른 것보다 재현되는 것을 기록합니다.
모든 가이드는 테스트 환경, 확인 날짜, 공식 출처를 함께 남깁니다. 협찬 여부도 숨기지 않습니다.