검증 범위2026.08.04 공식 문서 기준으로 설치·명령·보안 범위를 대조했으며 장비별 성능 수치는 일반화하지 않음
먼저 읽는 30초 요약
이 글에서 가져갈 것
- 공개 자료에서 10~20개의 한국어 평가 질문을 만듭니다.
- 모델 외의 프롬프트·온도·문맥·양자화를 고정합니다.
- 자연스러움과 사실 정확성을 별도 점수로 기록합니다.
KOREAN TEST 01
한국어 모델 비교 루프
자연스러움과 정확성을 분리합니다.
- 01SET
한국어 고정 질문
- 02REPEAT
같은 조건 3회
- 03SCORE
사실·언어·형식
- 04SELECT
치명 오류 확인
한국어 작업을 분해합니다
문서 요약, 정보 추출, 존댓말, 띄어쓰기, 표 출력은 서로 다른 능력입니다. 실제 사용할 작업의 비율대로 평가 세트를 구성합니다.
정답과 금지 조건을 만듭니다
각 질문에 반드시 포함할 사실과 문서에 없는 내용을 추측하면 실패라는 조건을 적습니다. 공개 자료나 익명화 자료를 사용합니다.
조건을 고정해 반복합니다
같은 런타임과 양자화, 시스템 프롬프트, 온도에서 세 번씩 실행합니다. 모델 이름과 버전, 날짜도 기록합니다.
언어 품질과 사실을 분리합니다
매끄러운 한국어가 정확한 답을 뜻하지 않습니다. 사실 일치, 지시 준수, 표현 자연스러움, 반복 일관성과 속도를 각각 점수화합니다.
| 항목 | 확인 질문 |
|---|---|
| 사실 | 이름·수치가 원문과 같은가 |
| 요약 | 핵심 누락·추가가 없는가 |
| 언어 | 존댓말과 용어가 일관적인가 |
| 형식 | 요청한 표·JSON을 지키는가 |
자주 묻는 질문
영어 벤치마크 점수가 높으면 한국어도 좋은가요?
반드시 그렇지 않습니다. 한국어 실제 작업으로 별도 확인해야 합니다.
번역 평가만 하면 되나요?
아닙니다. 한국어 원문 요약과 정보 추출, 어투까지 포함하세요.
몇 번 실행해야 하나요?
처음에는 각 질문을 세 번 반복해 변동을 확인하는 편이 실용적입니다.
공식 출처
세부 동작과 최신 버전은 아래 원문을 함께 확인하세요.