모든 게시글로 돌아가기
게시글

2026년 최고의 AI 음성 인식 모델: 정확도, 가격, 가치

작성자:

시간당 API 비용, 정확도, 실용적 제한으로 음성 텍스트 변환 모델을 비교합니다. 녹음, 회의, 다국어 작업에 맞는 가성비 후보를 찾아보세요.

파형 화면, 나타나는 전사문 띠, 작은 가격표가 있는 소형 오디오 녹음기

녹음 100시간을 전사하는 데 Groq의 Whisper Large V3 Turbo는 추가 비용 전 $4, Mistral의 Voxtral Mini Transcribe 2는 $18이 듭니다. 낮은 청구액은 매력적이지만 더 나은 구매인지는 필요한 전사문에 달려 있습니다. 검색 가능한 텍스트, 화자 표시 회의록, 녹음과 맞아야 하는 자막은 요구 사항이 다릅니다.

기본 녹음 음성 인식의 저비용 후보로는 Groq의 Whisper Large V3 Turbo를 선택합니다. 화자 표시와 단어 단위 타임스탬프가 필요한 회의에는 Voxtral Mini Transcribe 2를 비용 우선 후보로 고르고, 최저 기본 요율보다 전사 오류 감소가 중요하다면 ElevenLabs Scribe v2와 비교할 가치가 있습니다. 아래에서 이 선택의 가격과 근거를 설명합니다.

MAI-Transcribe-2는 가격과 공개 정확도 면에서 눈에 띄는 신제품이지만 기본 운영 추천은 아닙니다. Azure 연동이 SLA 없이 공개 프리뷰 단계이고 Microsoft가 운영 환경에 사용하지 말라고 권고하기 때문입니다. 이 제한은 벤치마크 점수만큼 중요합니다.

가격과 문서는 2026년 9월 4일에 확인했습니다. 공개 API 문서와 독립 벤치마크를 편집 관점에서 비교하며 모든 모델을 직접 시험했다는 주장이 아닙니다. 완성된 녹음 파일에 초점을 두고 회의 앱 구독과 실시간 음성 에이전트는 제외합니다.

음성 인식 API 가격 한눈에 보기

비교 단위는 특정 공급자가 특정 모드로 제공하는 모델입니다. “Whisper 가격”만으로는 충분히 구체적이지 않습니다. 오픈 웨이트, 호스팅 API, 같은 가중치를 사용하는 데스크톱 앱의 비용은 서로 다릅니다.

다음은 파일 전사의 공개 기본 사용 요율이며 청구액을 보장하지 않습니다. 금액은 USD입니다. 세금, 저장 공간, 재시도, 선택 기능, 무료 크레딧, 협상 할인은 제외했습니다. “약”은 토큰 기반 추정치이고 Scribe 행은 요금제 비용이나 크레딧 전 사용 가치입니다.

모델과 서비스오디오 시간당 기본 비용100시간 기본 사용료주요 조건
Whisper Large V3 Turbo · Groq$0.04$4요청당 최소 10초 과금
MAI-Transcribe-2 · Microsoft$0.10$10할인 가격, Azure 연동은 프리뷰
Soniox · 비동기 파일 API약 $0.10약 $10오디오·텍스트 토큰 과금
Whisper Large V3 · Groq$0.111$11.10Turbo와 다른 모델
Qwen3 ASR Flash Filetrans · Alibaba Cloud$0.126$12.60싱가포르 요율: 초당 $0.000035
GPT-4o Mini Transcribe · OpenAI약 $0.18약 $18공식 추정 요율
Voxtral Mini Transcribe 2 · Mistral$0.18$18분당 $0.003
Universal-3.5 Pro · AssemblyAI$0.21$21사전 녹음 모델, Streaming 아님
Scribe v2 · ElevenLabs$0.22사용 가치 $22요금제와 유료 부가 기능 확인
Nova-3 · Deepgram$0.258 / $0.312$25.80 / $31.20사전 녹음 단일 언어 / 다국어
GPT-Transcribe · OpenAI$0.27$27분당 $0.0045
Gemini 3.5 Transcribe · Google약 $0.30약 $30개발자 API, 오디오 입력과 텍스트 출력
GPT-4o Transcribe · OpenAI약 $0.36약 $36공식 추정 요율

서비스의 지역과 언어가 맞는다면 더 저렴한 후보도 확인할 수 있습니다. StepFun은 StepAudio 2.5 ASR을 시간당 CNY 0.15, 즉 100시간에 CNY 15로 표시합니다. 환산 가격이 전 세계에서 가장 저렴한 옵션을 입증하는 것처럼 보이지 않도록 원래 통화를 유지했습니다.

공개 요율이 있는 대표 후보 목록이며 시장의 모든 음성 서비스를 다루지는 않습니다. 기존 클라우드 계약, 필수 배포 리전, 전문 어휘에 따라 다른 후보가 적합할 수 있습니다.

정확도 순위가 실제로 측정하는 것

OpenRouter 음성 인식 순위는 사람들이 사용하는 모델을 찾는 데 도움이 됩니다. 요청량을 순위로 표시할 뿐 전사 정확도를 측정하지 않습니다. 인기 모델은 살펴볼 가치가 있지만 고객 이름을 정확히 알아듣는다는 증거는 아닙니다.

같은 조건의 품질 신호로 다음 표는 Artificial Analysis가 공개한 비스트리밍 AA-WER v2 스냅샷입니다.

모델과 시험 공급자단어 오류율, 낮을수록 좋음
MAI-Transcribe-2 · Microsoft2.0%
Scribe v2 · ElevenLabs2.2%
Gemini 3.5 Transcribe · Google2.6%
GPT-Transcribe · OpenAI3.3%
Voxtral Mini Transcribe 2 · Mistral3.6%
Whisper Large V3 Turbo · Groq4.6%

단어 오류율은 기준 전사문과 비교해 대체, 삭제, 삽입을 셉니다. 특정 문장이 맞을 확률이 아닙니다. 잘못된 금액이나 빠진 “않다” 하나가 무해한 서식 차이 여러 개보다 중요할 수 있습니다.

벤치마크 방법론은 세 데이터셋에서 약 8시간 분량을 50%, 25%, 25% 비중으로 사용합니다. 영어 의회 연설과 실적 발표가 포함되고, 일부 긴 파일은 모델 한도에 맞게 나뉩니다. 이 결과는 중국어, 아랍어 또는 모든 언어의 승자를 입증하지 않습니다. 화자 레이블이 맞는지도 측정하지 않습니다.

자신의 오디오 표본을 건너뛰는 대신 후보를 좁히는 데 표를 사용하세요. 점수에는 모델 버전과 공급자를 함께 표시합니다. 예를 들어 Universal-3 Pro의 결과를 Universal-3.5 Pro 점수로 바꾸면 안 됩니다.

어떤 모델을 선택할까?

Groq의 Whisper Turbo: 기본 전사문을 위한 저비용 후보

100시간에 $4이므로 검색 가능한 녹음 보관소나 첫 전사문을 위해 가장 먼저 평가하겠습니다. 낮은 호스팅 가격과 문서화된 API가 장점이며 오류가 무시할 만하다는 약속은 아닙니다.

Groq 문서는 Turbo와 Large V3를 구분합니다. Turbo는 다국어 전사를 지원하지만 번역 엔드포인트는 지원하지 않습니다. 10초보다 짧은 요청도 10초 비용을 냅니다. 인터뷰에서는 작은 차이지만 오디오를 아주 짧게 나누는 파이프라인에서는 중요합니다.

저렴한 텍스트가 주된 결과물이고 표본이 검토를 통과할 때 선택하세요. 신뢰할 수 있는 “누가 무엇을 말했는가”가 필요하다면 기본 전사 요율을 완성된 작업 비용으로 보지 말고 완전한 화자 표시 솔루션을 비교해야 합니다.

Voxtral과 Scribe: 회의 기능 또는 더 적은 텍스트 오류

화자 표시 회의에는 Voxtral Mini Transcribe 2를 비용 우선 후보로 평가하겠습니다. Mistral은 화자 분리, 단어 단위 타임스탬프, 13개 지원 언어를 문서화합니다. 화자 분리는 말한 사람을 나눠 발언을 올바른 사람에게 연결하는 기능입니다.

중요한 제한이 있습니다. Mistral에 따르면 말이 겹치면 일반적으로 한 화자의 전사문만 생성됩니다. 화자 레이블이 있다고 동시에 말한 모든 사람을 완전히 기록한다고 생각하면 안 됩니다.

Scribe v2는 이 둘 중 정확도 중심 대안입니다. 표시된 기본 사용 비용은 100시간에서 $4만 더 높고 위 스냅샷의 WER은 더 낮습니다. 편집 시간이 중요하다면 직접 비교할 이유입니다. ElevenLabs는 주요 용어 프롬프팅과 엔터티 감지에 별도 요금을 부과합니다. 시간당 $0.22만 보지 말고 실제 요금제와 선택 기능을 비교하세요. 벤치마크만으로 어느 서비스가 회의 화자를 더 정확히 표시하는지는 알 수 없습니다.

MAI-Transcribe-2: 강력한 프리뷰이지만 운영 기본값은 아님

Microsoft의 9월 3일 출시 발표는 2026년 말까지 시간당 $0.10을 제시합니다. 품질 스냅샷과 함께 보면 매력적인 실험용 가격·정확도 후보입니다.

하지만 Azure Speech 문서는 연동을 SLA가 없고 운영 작업에 권장되지 않는 공개 프리뷰로 명시합니다. 필요한 지역과 약관이 맞는다면 프로토타입에서 평가하세요. 할인 가격만으로 무인 운영 파이프라인을 만들거나 2027년에도 같은 가격이라고 가정하면 안 됩니다.

OpenAI와 Google: 전용 음성 인식 모델 비교하기

OpenAI에서는 GPT-Transcribe가 이 비교의 최신 전용 후보입니다. GPT-4o Mini Transcribe는 시간당 약 $0.18의 더 저렴한 대안입니다. “4o”라는 이름이 익숙하다고 기존 GPT-4o Transcribe가 가장 잘 맞는다고 가정하기 전에 이 둘을 비교하겠습니다.

Gemini 3.5 Transcribe는 화자 분리와 단어 타임스탬프가 있는 또 다른 전용 후보입니다. Google의 분당 약 $0.005 추정치는 오디오 입력과 텍스트 출력을 결합하며 입력 비용만 뜻하지 않습니다. 이미 Google API를 사용한다면 비교할 가치가 있지만 Transcribe Live나 오디오를 첨부한 일반 Gemini 채팅과 같은 제품은 아닙니다.

Soniox, Qwen, AssemblyAI, Deepgram: 다른 후보를 남길 이유

Soniox는 저비용 비교에 포함할 만하지만 시간당 약 $0.10은 추정치입니다. 과금에는 오디오 입력, 제공한 텍스트 맥락, 텍스트 출력이 포함됩니다. 출력이 늘거나 번역을 추가하면 청구액이 달라집니다.

중국어 작업에서는 영어 벤치마크 순서를 확대 적용하지 말고 Qwen을 표본에 포함하세요. Alibaba Cloud 파일 전사 요율은 리전과 정확한 모델에 따라 다릅니다. 오픈 웨이트 Qwen3-ASR-1.7B는 별도 배포 선택지이며 Flash API의 다른 이름이 아닙니다. 로컬 호스팅은 호출당 API 비용을 없애지만 하드웨어·유지 관리 비용까지 없애지는 않습니다.

AssemblyAI의 현재 모델 문서는 사전 녹음 오디오용 Universal-3.5 Pro를 시간당 $0.21, Universal-2를 $0.15로 표시합니다. 오래된 벤치마크 점수를 가져오지 말고 언어 지원과 정확한 버전을 확인하세요. Deepgram의 Nova-3 가격은 사전 녹음 오디오의 화자 분리를 포함하고 다국어 기본 요율이 단일 언어보다 높습니다. 둘 다 최저 기본 요율에서 이기지 않더라도 기능이 같은 회의 비교에 포함할 수 있습니다.

100시간에 실제로 드는 비용

단일 채널 인터뷰 100시간을 처리하는 가상의 월간 작업을 생각해 봅시다. 첫 결과물은 텍스트이고 요약은 나중에 만듭니다. 표시 요율에서 추가 비용 전 Groq Turbo는 $4, Voxtral은 $18, GPT-Transcribe는 $27입니다. 사용량 계산이지 관찰한 청구액이 아닙니다.

검토자의 시간을 시간당 $20로 가정해 봅시다. Groq보다 높은 Voxtral의 $14 비용은 한 달 전체의 검토 시간 42분에 해당합니다. 실제 작업에서 그보다 많은 시간을 절약한다면 높은 API 가격을 상쇄합니다. 이 절감은 측정하지 않았으며 42분은 시험할 손익분기점입니다.

세 가지 과금 세부 사항이 비교를 바꿀 수 있습니다.

  • 짧은 요청: Groq의 10초 최소 과금은 잘게 나눈 오디오의 비용을 높입니다.
  • 필수 기능: ElevenLabs는 주요 용어 프롬프팅을 시간당 $0.05 추가로 표시합니다. 100시간이면 다른 비용 전 $5가 더해집니다.
  • 채널: Deepgram은 처리한 채널마다 과금합니다. 10분짜리 2채널 녹음은 20분 처리로 계산될 수 있습니다.

관련 출처는 Groq 파일 제한, ElevenLabs API 요율, Deepgram 과금 설명입니다. 실제로 보낼 구성을 사용하세요.

실시간 음성 인식은 별도로 비교해야 합니다. 예를 들어 AssemblyAI 스트리밍 과금은 업로드한 오디오만이 아니라 연결 시간을 셉니다. 기존 파일을 빠르게 처리하는 능력으로 실시간 청취자가 첫 단어나 마지막 단어를 얼마나 빨리 보는지는 알 수 없습니다.

요약과 번역 비용 추가하기

음성 인식 API는 원본 텍스트를 만듭니다. LLM으로 회의록을 만들거나 번역하거나 행동 항목을 추출하면 별도의 비용입니다. 요약 모델 비교는 축약된 메모가 결정과 조건을 보존하는지 확인하는 방법을 설명합니다.

이 텍스트 처리 단계에는 **AILesson의 LLM 가격 계산기**를 사용하세요. 월간 전사문과 프롬프트가 입력 토큰 150만 개, 요약이 출력 토큰 15만 개라고 가정합니다. 각각 1.50.15를 입력해 모델 비용을 비교하세요. 이는 가상의 토큰 합계이며 오디오 100시간에서 고정적으로 환산한 값이 아닙니다.

계산기는 입력·출력 토큰 비용을 추정하며 오디오 분 단위 음성 인식 계산기가 아닙니다. 전사 사용료, 필수 기능, 저장 공간, 재시도, 검토 시간에 텍스트 처리 추정액을 더하세요. 긴 전사문을 나눠 요약한 뒤 최종 요약 단계를 거친다면 반복 입력도 포함합니다.

후보 두 개를 골라 어려운 부분 확인하기

기본 전사문은 Groq Turbo와 더 정확한 대안 하나부터 시작하세요. 회의는 Voxtral과 Scribe를 비교하고, 프리뷰를 받아들일 수 있는 실험에서만 MAI를 추가합니다. 중국어 또는 여러 언어가 섞인 음성에는 영어 순서가 그대로 적용된다고 가정하지 말고 관련 Qwen 서비스를 포함하세요.

처리 권한이 있는 녹음 중 깨끗한 표본, 소음이 있거나 말이 겹치는 대화, 이름·금액·전문 용어가 있는 표본을 준비합니다. 각 모델에 같은 오디오와 동등한 지침을 제공하세요. 전사문이 잘 읽히는지만 보지 말고 빠진 말, 중요한 단어, 화자 변경, 타임스탬프, 수정 시간을 확인합니다.

비공개 녹음을 보내기 전에 공급자의 보관, 학습 이용, 지역 처리 조건을 확인하세요. 그런 다음 실제 요구 사항을 통과하는 가장 저렴한 선택지를 고릅니다. 고치는 데 몇 시간이 드는 $4 전사문은 저비용 승자가 아닙니다.

참고 자료