검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음

먼저 읽는 30초 요약

이 글에서 가져갈 것

  • 공개 자료에서 10~20개의 한국어 평가 질문을 만듭니다.
  • 모델 외의 프롬프트·온도·문맥·양자화를 고정합니다.
  • 자연스러움과 사실 정확성을 별도 점수로 기록합니다.
KOREAN TEST 01

한국어 모델 비교 루프

자연스러움과 정확성을 분리합니다.

  1. 01
    SET

    한국어 고정 질문

  2. 02
    REPEAT

    같은 조건 3회

  3. 03
    SCORE

    사실·언어·형식

  4. 04
    SELECT

    치명 오류 확인

활용 기준 모델 이름·버전·양자화와 답변 원문을 함께 남깁니다.
SECTION 01

한국어 작업을 분해합니다

문서 요약, 정보 추출, 존댓말, 띄어쓰기, 표 출력은 서로 다른 능력입니다. 실제 사용할 작업의 비율대로 평가 세트를 구성합니다.

SECTION 02

정답과 금지 조건을 만듭니다

각 질문에 반드시 포함할 사실과 문서에 없는 내용을 추측하면 실패라는 조건을 적습니다. 공개 자료나 익명화 자료를 사용합니다.

SECTION 03

조건을 고정해 반복합니다

같은 런타임과 양자화, 시스템 프롬프트, 온도에서 세 번씩 실행합니다. 모델 이름과 버전, 날짜도 기록합니다.

SECTION 04

언어 품질과 사실을 분리합니다

매끄러운 한국어가 정확한 답을 뜻하지 않습니다. 사실 일치, 지시 준수, 표현 자연스러움, 반복 일관성과 속도를 각각 점수화합니다.

항목확인 질문
사실이름·수치가 원문과 같은가
요약핵심 누락·추가가 없는가
언어존댓말과 용어가 일관적인가
형식요청한 표·JSON을 지키는가
FAQ

자주 묻는 질문

영어 벤치마크 점수가 높으면 한국어도 좋은가요?

반드시 그렇지 않습니다. 한국어 실제 작업으로 별도 확인해야 합니다.

번역 평가만 하면 되나요?

아닙니다. 한국어 원문 요약과 정보 추출, 어투까지 포함하세요.

몇 번 실행해야 하나요?

처음에는 각 질문을 세 번 반복해 변동을 확인하는 편이 실용적입니다.

공식 출처

세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.

Ollama Chat API LM Studio 모델 다운로드 가이드

이어서 읽기

GGUF와 Q4·Q5 양자화, 무엇을 골라야 할까?컨텍스트 길이와 KV 캐시 이해하기