공지

[08.26 패치] 번역 성능 리더보드 추가 - 프롬프트 적용,모델 단가표 등

관리자·조회 42(수정됨)2026-08-26 08:09

[업데이트 내역]

1. 번역 성능 리더보드 공개 (실험실)

- 같은 원문·용어집을 기준으로 모델과 프롬프트 조합별 번역 결과를 비교할 수 있습니다.
- 중국어 → 한국어 32개 조합이 등록되어 있으며, 샘플 3편(총 4,240자)을 기준으로 평가했습니다.
- 가성비 · 품질 · 최저가 · 최신순으로 확인할 수 있습니다.
- 상단 메뉴 「실험실」에서 이용할 수 있습니다.

 

2. 조합별 상세 결과

- 어떤 문장에서 어떤 오류가 발견됐는지 원문·번역문과 함께 확인할 수 있습니다.
- 각 조합에서 사용한 프롬프트 전문도 공개됩니다.
- 내 번역 설정에 적용
- 원하는 조합의 프롬프트를 내 번역 설정에 바로 적용할 수 있습니다.
- 기존 프롬프트는 자동으로 백업되며 언제든 되돌릴 수 있습니다.

 

3. 내 프롬프트로 도전

- 직접 작성한 프롬프트를 제출해 리더보드에서 성능을 비교할 수 있습니다.
- 한 번에 최대 2개 모델을 선택할 수 있습니다.
- 번역과 채점 비용은 제출자의 API 키에서 사용됩니다. Gemini Pro 사용이 가능한 Google API 키가 필요하며 무료 티어는 지원하지 않습니다.
- 모델 1개 기준 약 1,300원(번역 약 30원 + 알파 + 채점 약 1,270원)이 소요됩니다.
- 제출 한도는 하루 60회 · 주 200회이며, 가입 7일 미만 계정은 하루 12회입니다.

 

4. 모델 단가표

- 참가 가능한 30개 모델의 입력·출력 단가를 원화 기준으로 정리했습니다.
- 리더보드와 제출 화면의 「모델 단가」에서 확인할 수 있습니다.

 

5. 참고 및 주의사항

- 현재 결과는 사람이 검증하지 않은 AI기반 자동 평가 점수입니다. 절대적인 번역 품질보다는 같은 조건에서 조합 간 성능을 비교하는 용도로 봐주세요.
- Gemini 2.5 Pro가 각 번역을 3회 평가하며, 그중 중앙값을 최종 결과로 사용합니다.
- 현재 베타 기능으로, 평가 기준이 변경될 경우 전체 결과가 다시 채점될 수 있습니다.
- 일본어·영어 리더보드도 추후 추가할 예정입니다.

....


프롬프트와 모델 조합별로 번역 성능을 점수로 메겨보고자 관련 기능을 직접 구현해봤습니다.
테스트 결과를 봤을때 주목할만점은

- 주로 사용하던 Gemini 3.1 flash lite가 확실히 가성비가 뛰어남
- gpt 5.6 luna가 최근 가격인하를 해서 gemini 3.1 flash lite와 비용대비 번역 성능이 거의 동급이라는점
- Grok 4.3이 생각보다 비용대비 성능이 뛰어나다는점(물론 위 두모델에 비교해선 비용이나 성능 모두 열세)
- pro와 최신 경량 모델의 번역성능이 크게 차이나지 않는다는점

정도인것 같습니다.


참고로 직접 프롬프트를 테스트를 할 수 도 있는데 한번당 비용이 거의 1000~1500원 소모되니 주의하시길 바랍니다.

또한 직접 테스트한 프롬프트나 리더보드에 있는 프롬프트를 소설번역기에 적용도 가능하니 참고하세요.

---
링크:
https://fictiondbs.com/lab/zh-ko/value

댓글