측정 방법
이 벤치마크는 같은 원문과 용어집을 번역했을 때 모델·프롬프트 조합별로 얼마나 많은 오류가 발생하는지 비교합니다.
평가 방식
모든 조합에 동일한 원문과 용어집을 사용합니다. 참가자가 변경할 수 있는 것은 모델과 프롬프트뿐입니다.
심판 모델은 번역문에서 오류를 찾아 다음 정보를 기록합니다.
- 오류 유형
- 심각도:
minor/major/critical - 해당 위치와 사유
점수는 발견된 오류를 바탕으로 계산합니다. minor = 1, major = 5, critical = 25 로 감점한 뒤 전체 번역 분량을 기준으로 1,000자당 감점으로 정규화합니다.
같은 번역문을 3회 독립 채점하고 중앙값을 최종 결과로 사용합니다. 세 번의 채점 결과도 함께 공개합니다.
평가 항목
오류는 다음 6개 항목 중 하나로 분류합니다.
- 정확성오역, 누락, 임의 추가, 미번역
- 유창성문법, 맞춤법, 구두점
- 일관성용어, 문체, 설정의 일관성
- 문화적합도가·무협 개념, 수사, 문화적 표현
- 문체보존문체, 리듬, 화계, 경어
- 용어집준수지정된 용어집 준수 여부
하나의 오류에는 하나의 항목만 적용하며, 항목별 추가 가중치는 없습니다.
비교 가능한 범위
원문·용어집·심판 모델·채점 기준·감점 배수를 하나의 평가 기준 버전으로 고정합니다. 이 중 하나라도 변경되면 새로운 기준으로 구분하며, 서로 다른 기준에서 나온 점수는 직접 비교하지 않습니다.
현재 기준은 베타입니다. 기준이 변경되면 저장된 번역문 전체를 새 기준으로 다시 채점합니다.
샘플
평가에는 공개 샘플과 비공개 샘플을 함께 사용합니다.
비공개 샘플의 원문·번역문·오류 내역은 공개하지 않고 점수에만 반영합니다. 공개 샘플에 과도하게 최적화된 프롬프트를 방지하기 위한 장치입니다.
현재 한계
- 아직 사람의 번역 품질 평가와 비교하지 않았습니다.
- 심판과 참가 모델에 Gemini 계열이 함께 포함되어 있어 계열 편향 가능성이 있습니다.
- 1 : 5 : 25 감점 비율은 경험적으로 정한 값이며 검증된 기준은 아닙니다.
- 동일 번역문을 반복 채점해도 결과에 편차가 발생합니다.
- 현재 결과는 사용된 샘플에 대한 결과이며 다른 작품에서도 같은 순위가 유지된다는 보장은 없습니다.
- 실제 앱의 번역 입력 형식과 벤치마크 입력 형식에는 차이가 있습니다.
참가 방법
번역과 채점에는 참가자의 API 키를 사용합니다. 현재 Gemini Pro 를 사용할 수 있는 Google API 키가 필요하며 무료 티어는 지원하지 않습니다.
가성비 탭
가성비 탭은 정확도와 비용의 Pareto frontier 를 보여줍니다. 자신보다 저렴하면서 점수도 높은 조합이 존재하는 경우 목록에서 제외합니다. 75점 미만 조합도 제외합니다.
잘못된 실행 처리
번역 결과가 한국어가 아니면 채점하지 않고 실패 처리합니다. 실패한 실행은 제출 횟수에 포함하지 않습니다.