2026년 최고의 AI 번역 모델: 품질, 용어, API 비용
텍스트 작업을 위한 GPT, Gemini, Claude, DeepSeek, HY-MT2, DeepL, Google Translation을 비교합니다. 토큰과 문자를 혼동하지 않고 번역·검토 예산을 세우세요.

“백업을 삭제하지 마세요”는 짧은 문장입니다. 유창해도 “않다”를 빠뜨린 번역은 실패입니다. 제품 문구와 문서의 모델을 고를 때는 의미, 용어, 형식, 사람이 결과를 고치는 데 쓸 시간을 함께 따져야 합니다.
8K 컨텍스트에 들어가는 텍스트라면 OpenRouter에 표시된 Tencent Cloud 엔드포인트의 HY-MT2-7B를 저비용 전문 후보로 시험하겠습니다. GPT-5.6 Luna와 DeepSeek V4 Flash는 범용 모델 대안입니다. 전용 번역 작업에서는 범용 챗봇이 항상 더 낫다고 가정하지 않고 DeepL의 품질 최적화 옵션과 Google Cloud Translation도 비교하겠습니다. 이 글에서 어느 모델도 모든 언어의 정확도 승자로 입증되지 않았습니다.
문서와 가격은 2026년 9월 4일에 확인했습니다. 공개 자료와 예산 계산 사례를 바탕으로 한 비교이며 여러 모델을 직접 번역 시험한 결과가 아닙니다. 실용 예시는 영어·중국어 제품 콘텐츠에 초점을 둡니다. 음성 번역, 통역, 번역 앱 구독은 범위 밖입니다.
먼저 서비스 유형 고르기
| 선택지 | 후보에 넣는 이유 | 확인할 사항 |
|---|---|---|
| GPT-5.6 Luna | 첫 번역 단계의 낮은 표시 토큰 비용 | 의미, 자리표시자, 실제 과금 출력 |
| DeepSeek V4 Flash | 비혼잡 시간에 더 저렴한 저비용 범용 모델 | 실행 시간, 추론 구성, 검토 부담 |
| Gemini 3.8 Flash | Google 범용 모델 API의 대안 | 도입 요금과 전체 실행 토큰 사용량 |
| Claude Sonnet 5 | 지침 준수와 수정의 고비용 비교 후보 | 실제 콘텐츠 편집을 줄이는가? |
| HY-MT2-7B | 저렴한 호스팅 전문 모델 또는 다운로드 가능한 가중치 | 호스팅 길이 제한, 배포 비용, 언어 쌍 |
| DeepL 품질 최적화 | 번역 전용 제어와 용어집 작업 | 언어 지원, 요금제, 요청 모델 동작 |
| Google Cloud Translation | 번역 API의 NMT와 Translation LLM 엔드포인트 | 사용 엔드포인트와 과금 문자 수 |
이들은 제공 방식이 다릅니다. 다운로드한 모델에 무료 호스팅 서비스가 따라오는 것은 아닙니다. DeepL API는 공개 가중치 체크포인트가 아니며, Google Cloud Translation은 Gemini와 엔드포인트나 과금 방식이 다릅니다. 비용을 비교할 때 이런 차이를 유지하세요.
토큰 과금 번역 비용
아래 수치는 표준 비캐시 텍스트 입력의 토큰 100만 개당 USD입니다. 마지막 열은 표시된 구간 안에서 나눈 입력 200만, 과금 대상 출력 200만 토큰을 가정합니다. 고정된 페이지 수나 중국어 글자 수에서 환산한 것이 아니라 독립적인 사용량 가정입니다.
| 모델 | 입력 / 1M | 출력 / 1M | 비용 예시 |
|---|---|---|---|
| HY-MT2-7B · OpenRouter 경유 Tencent Cloud | $0.074 | $0.295 | $0.738 |
| GPT-5.6 Luna | $0.20 | $1.20 | $2.80 |
| DeepSeek V4 Flash, 피크 | $0.44 | $1.32 | $3.52 |
| Gemini 3.8 Flash | $0.75 | $3.75 | $9 |
| Claude Sonnet 5 | $2 | $10 | $24 |
Luna는 짧은 컨텍스트 구간입니다. DeepSeek 요청이 모두 비혼잡 요금 조건을 충족하면 예시는 $1.76으로 낮아집니다. 평일 피크 시간은 01:0004:00 및 06:0010:00 UTC입니다. Gemini 도입 요금은 2026년 12월 31일에 끝나고 공지된 이후 요율은 예시를 $18로 두 배 올립니다. 세금, 추가 도구, 재시도, 사람의 검토는 제외했습니다.
이 표는 저비용 후보를 고른 이유를 설명할 뿐 번역 품질을 입증하지 않습니다. 용어 지침을 무시하는 모델은 몇 분의 수정만으로 API 절감액을 없앨 수 있습니다. 버튼 하나를 번역하려고 설명서 전체를 보내도, 버튼과 의미를 설명하는 몇 문장만 보내는 것보다 비쌀 수 있습니다.
전용 번역 서비스에서는 계산법이 달라집니다
DeepL: 용어집은 작업 기능이지 품질 보장이 아닙니다
DeepL 텍스트 API는 품질·지연 시간 중심의 모델 옵션, 컨텍스트, 용어집 제어를 제공합니다. context 매개변수는 과금되지 않지만 범용 LLM은 일반적으로 제공한 컨텍스트를 입력 토큰으로 계산합니다. 용어집은 요청한 언어 쌍과 일치해야 하며 사용하려면 원본 언어를 지정해야 합니다.
따라서 주변 제품 정보에 따라 의미가 달라지는 짧은 문자열을 비교할 때 DeepL이 유용합니다. 정확한 언어와 옵션 지원 여부를 확인하세요. 한 대상 언어에서 제공되는 제어 기능이 다른 언어에도 자동으로 제공되는 것은 아닙니다. 소비자 구독 가격이나 무관한 리전의 견적을 가져오지 말고 자신의 API 요금제 요율을 사용하세요.
정립된 용어집 절차가 연동과 검토 작업을 줄인다면 이런 서비스를 선택하겠습니다. 실제 자료를 시험하지 않고 영어·중국어 번역에서 가장 정확하다고 부르지는 않겠습니다.
Google Cloud Translation: 토큰이 아니라 문자
Google 번역 요금은 해당 월별 허용량 이후 NMT 입력 문자 100만 자당 $20을 표시합니다. 표준 Translation LLM 텍스트 엔드포인트는 입력 문자 100만 자당 $10, 출력 문자 100만 자당 $10입니다. 적응형 번역과 서식 있는 문서는 가격이 다릅니다.
가상의 입력 100만 자와 출력 100만 자라면 Translation LLM 사용료는 $20입니다. NMT도 적용 가능한 크레딧 전에는 $20입니다. 앞 표의 입력 토큰 200만 개와 출력 토큰 200만 개와 같은 작업량이 아닙니다.
Google은 제출한 공백과 번역하지 않은 문자를 포함한 유니코드 코드 포인트를 셉니다. 10페이지 파일은 LLM의 토큰 가격과 직접 비교할 수 있는 과금 단위가 아닙니다. 예산을 만들기 전에 엔드포인트와 제출 콘텐츠의 문자 수를 확인하세요.
HY-MT2: 저렴한 호스팅 전문 모델 또는 자체 배포
OpenRouter는 Tencent Cloud 엔드포인트를 위 요율과 함께 표시하며 컨텍스트는 8,192토큰, 최대 완성은 4,096토큰입니다. 짧고 반복적인 번역 작업에서 HY-MT2-7B를 시험할 이유입니다. 긴 설명서는 주의해서 나눠야 하며 용어집과 컨텍스트의 오버헤드도 토큰에 포함됩니다. 예시는 적용 가능한 플랫폼 비용을 제외하며 자체 호스팅 견적이 아닙니다.
Tencent의 HY-MT2-7B 모델 카드는 전용 번역 모델과 용어, 문체, 구조화 콘텐츠 예시를 제공합니다. 배포 제어가 중요하고 팀이 추론 환경을 관리할 수 있다면 평가할 가치가 있습니다.
모델 카드의 비교는 공급자가 보고한 근거이며 사용자 문서에 대한 독립적인 판정이 아닙니다. 컴퓨팅, 유휴 용량, 업그레이드, 검토를 예산에 포함하세요. 작은 모델이나 양자화 변형도 따로 확인해야 합니다. 다른 체크포인트의 결과가 자동으로 옮겨오지 않습니다.
번역을 사용할 수 있는지 판단하는 방법
WMT 번역 평가는 지정된 과제와 언어 쌍을 중심으로 구성됩니다. MT Metrics Eval 도구 모음은 일부 언어 쌍의 MQM 등 사람·자동 점수를 제공합니다. 어느 쪽도 서로 다른 연도, 언어, 모델 버전을 하나의 보편적인 순위로 합칠 근거는 아닙니다.
제품팀에는 근거 없는 대표 점수보다 작은 승인 검사가 더 유용할 수 있습니다. 다음 가상의 영어 UI 문자열을 생각해 봅시다.
Do not delete the backup until the export is complete. Your trial ends on September 30. Contact {support_email} for help.
모든 후보에 같은 용어집과 제품 맥락을 제공합니다. 쓸 수 있는 중국어 번역은 금지 표현, 사건 순서, 날짜, 정확한 자리표시자를 보존해야 합니다. “체험판 종료”를 “구독 갱신”으로 바꾸면 안 됩니다. 원문에 없는 결제 사건을 지어내는 것이기 때문입니다.
그다음 반복되는 제품 용어가 있는 문단과 키, 링크, 화면 문자열이 포함된 구조화 파일을 확인하세요. 결과를 파싱하고 자리표시자를 비교한 뒤 이중 언어 검토자가 의미를 살펴보게 합니다. 문법, 타이포그래피, 선호 문체도 중요하지만 바뀐 금액이나 빠진 조건을 가려서는 안 됩니다.
검토자에게 중대한 의미 오류와 사소한 수정을 따로 기록하게 하세요. 가능하다면 모델 이름을 숨깁니다. 보기 좋은 한 가지 예시로는 부족합니다. 최고 출력만 선택하지 말고 실패하거나 어색한 결과도 검토 세트에 남기세요.
승자를 고르기 전에 수정 예산 세우기
AILesson 모델 가격 계산기에서 토큰 과금 후보를 비교하세요. 입력과 출력에 각각 2를 넣으면 해당 카탈로그 요율로 가정한 사용량이 재현됩니다. 모델 이름만 보지 말고 호스팅 엔드포인트를 맞추세요. 계산기는 DeepL 요금제 비용, Google Translation 문자 청구, HY-MT2 자체 호스팅 비용을 추정하지 않습니다.
전체 문서로 확대하기 전에 표본을 실행하고 실제 토큰 사용량을 확인하세요. 토크나이저와 번역 방향에 따라 수가 달라집니다. 두 번째 모델이 번역을 검토한다면 일반적으로 원문과 첫 출력, 지침을 입력으로 받습니다. 검토는 출력만 발생하는 무료 단계가 아닙니다.
예시 사용량에서 Sonnet은 Luna보다 $21.20 비쌉니다. 검토자 비용을 시간당 $30로 가정하면 전체 일괄 작업에서 42.4분을 절약하면 차액을 상쇄합니다. 이는 손익분기 계산이지 Sonnet의 실제 이점을 측정한 결과가 아닙니다. 두 후보의 검토량이 같다면 저렴한 모델이 더 나은 구매입니다.
중요도가 낮은 짧은 초안에는 호스팅 HY-MT2와 저비용 범용 모델 하나를 비교하세요. 공개 제품 텍스트에는 전용 서비스와 범용 모델을 같은 용어집·오류 목록으로 비교합니다. 중요한 의미는 사람이 승인해야 합니다. 가장 매끄럽게 들리는 출력이 아니라 원문이 실제로 말한 내용을 보존하면서 총비용이 가장 낮은 선택지를 고르세요.
참고 자료
- OpenAI 요금, DeepSeek 요금, Gemini 3.8 Flash 안내서, Anthropic 요금: 토큰 요율과 조건입니다.
- DeepL 텍스트 번역 API: 컨텍스트, 용어집, 모델 옵션입니다.
- Google Cloud Translation 요금: 문자 기반 엔드포인트와 문서별 차이입니다.
- HY-MT2-7B 모델 카드: 전문 모델과 배포 정보입니다.
- OpenRouter의 HY-MT2-7B: 가격이 표시된 Tencent Cloud 엔드포인트와 제한입니다.
- WMT25 번역 과제와 MT Metrics Eval: 평가 범위와 사람 평가 자료입니다.







