모든 게시글로 돌아가기
게시글

2026년 최고의 저비용 LLM: API 가격과 성공한 과제당 비용

작성자:

세 가지 작업량으로 GLM, Qwen, GPT, DeepSeek, Gemini API 비용을 비교합니다. 할인, 재시도, 검토 비용을 대표 토큰 가격과 구분하세요.

동전 투입구가 결합된 작은 받침대에 꽂힌 모델 칩

가격표에서 가장 저렴한 모델은 티켓 분류에는 충분해도 다른 작업에는 비쌀 수 있습니다. 특히 응답 세 개 중 하나를 고쳐야 한다면 그렇습니다. 유용한 저비용 후보 목록은 결과를 확인할 수 있는 일에서 시작해 완료까지 드는 전체 비용을 측정해야 합니다.

저렴한 텍스트 작업에는 GLM-5.3-Flash와 Qwen3.8-Flash를 GPT-5.6 Luna와 비교하겠습니다. DeepSeek V4 Flash도 후보이며, 특히 비혼잡 시간을 활용할 수 있는 작업에 적합합니다. 저렴한 후보들이 요구 사항을 충족하지 못하면 Gemini 3.8 Flash를 더 비싼 비교 대상으로 삼을 수 있습니다. 이는 선별한 호스팅 API 후보 목록이며, 세계에서 가장 저렴한 엔드포인트를 찾았거나 품질 승자를 측정했다는 주장이 아닙니다.

요율은 2026년 9월 5일에 확인했습니다. 작업량 예시는 가정입니다. 소비자 구독, 무제한 무료 사용 주장, 자체 호스팅 하드웨어, 멀티모달 생성은 제외합니다.

할인 가격 옆에 정가 함께 표시하기

아래 요율은 모두 토큰 100만 개당 USD이며, 표준 처리와 비캐시 입력을 기준으로 합니다. 공급자마다 자체 방식으로 토큰 수를 계산하므로 같은 토큰 수는 예산 계산을 위한 장치일 뿐 같은 일을 한다는 증거가 아닙니다.

모델과 엔드포인트입력 / 1M출력 / 1M조건
GLM-5.3-Flash · Z.AI할인 $0.075, 정가 $0.15할인 $0.25, 정가 $0.50현재 50% 할인은 9월 9일 24:00 UTC+8 종료
Qwen3.8-Flash · Alibaba Cloud$0.15$0.47싱가포르, International, 입력 토큰 1M 이하 요청
GPT-5.6 Luna · OpenAI$0.20$1.20짧은 컨텍스트 요율
DeepSeek V4 Flash · DeepSeek피크 $0.44, 비혼잡 $0.22피크 $1.32, 비혼잡 $0.66시간대별 과금
Gemini 3.8 Flash · Gemini API$0.75$3.752026년 12월 31일까지 도입 요율

반복 작업이라면 GLM의 임시 할인과 함께 정가도 사용하세요. 할인은 UTC+8 기준 9월 9일에서 10일로 넘어가는 시점에 끝납니다. 남은 할인 기간 4일을 기준으로 1년 예산을 세우면 안 됩니다.

DeepSeek의 피크 시간은 월요일부터 금요일 01:0004:00 및 06:0010:00 UTC이며 나머지는 비혼잡 시간입니다. Gemini는 2027년 1월 1일부터 입력 $1.50, 출력 $7.50을 표시합니다. Luna는 입력 토큰이 272K를 넘으면 요청 전체에 더 높은 요율이 적용됩니다. Qwen 견적에는 리전을 함께 기록하세요. 다른 배포 리전의 요율은 별도 비교 대상입니다.

어느 행에도 도구 호출, 세금, 실패한 시도, 사람의 검토 비용은 포함되지 않았습니다. 라우터를 통해 제공되는 모델은 요율이나 구성이 다를 수 있으므로 실제 엔드포인트를 기록에 남기세요.

세 가지 작업량에 따라 비용 구조가 달라집니다

관련 길이 제한보다 짧은 요청들로 나뉜 다음 가상의 월간 사용량을 생각해 봅시다.

  • 티켓 분류: 입력 5M, 과금 대상 출력 0.1M 토큰. 대부분의 작업은 읽기이며 답은 짧은 레이블입니다.
  • 보고서 요약: 입력 10M, 과금 대상 출력 0.5M 토큰. 결과는 원문보다 짧지만 중요한 조건을 보존해야 합니다.
  • 초안 생성: 입력 2M, 과금 대상 출력 2M 토큰. 글을 생성하는 부분이 비용에서 더 큰 비중을 차지합니다.

GLM의 정가와 DeepSeek의 피크 가격을 기준선으로 사용하면 다음과 같습니다.

후보티켓 레이블요약초안
GLM-5.3-Flash, 정가$0.80$1.75$1.30
Qwen3.8-Flash, 싱가포르$0.797$1.735$1.24
GPT-5.6 Luna$1.12$2.60$2.80
DeepSeek V4 Flash, 피크$2.332$5.06$3.52
Gemini 3.8 Flash, 도입 요율$4.125$9.375$9

이는 링크된 요율로 계산한 값이지 성능 점수가 아닙니다. 현재 GLM 할인은 해당 행을 절반으로 줄이고, 조건을 충족하는 DeepSeek 비혼잡 시간 사용도 절반으로 줄입니다. Gemini의 공지된 도입 기간이 끝나면 해당 행은 두 배가 됩니다. 일부 작업에서는 가장 저렴한 후보와 그다음 후보의 차이가 작으므로, 수정량이 다른 출력 사이를 아주 작은 가격 차이로 결정하지 마세요.

과금 대상 출력에는 사용자에게 보이는 단어뿐 아니라 적용되는 추론 토큰도 포함됩니다. 한 단어짜리 분류도 화면에 보이는 답보다 비용이 클 수 있으므로 확대 계산하기 전에 사용량을 측정하세요.

저렴한 기본 모델에는 명확한 실패 규칙이 필요합니다

티켓 분류에서는 레이블과 두 레이블이 모두 맞을 때의 처리 방식을 정의하세요. 사람이 확인한 표본과 비교하고 드문 범주는 따로 살펴봅니다. 거의 모든 항목을 “일반”으로 분류하는 모델은 불균형한 일괄 데이터에서 정확해 보이면서도 중요한 사례를 놓칠 수 있습니다.

요약에는 짧은 문장을 선호하기보다 사실 보존 검사를 사용하세요. 레코드에는 추출 검사를 적용합니다. 형식과 값이 정확한지, 누락 정보를 정직하게 처리하는지 확인해야 합니다. 이런 기준은 “답이 약해 보인다”보다 유용한 업그레이드 조건입니다.

긴 실행을 시작하기 전에 두 번째 후보를 정하세요. 기준 모델의 응답이 결정적 검사를 통과하지 못하면 구체적인 피드백으로 재시도하거나 해결되지 않은 레코드를 두 번째 모델에 보냅니다. 정확성을 자동으로 확인할 수 없다면 확신에 찬 표현이 모든 오류를 알려 준다고 가정하지 말고 표본을 검토하세요.

라우팅 시스템 자체에도 비용이 듭니다. 정상 작업을 비싼 모델에 보내거나 잘못된 답을 놓칠 수 있습니다. 이런 사례를 측정하세요. 전체 시스템을 평가하지 않았다면 저비용·고급 모델 조합이 고급 모델의 품질을 보존한다고 주장하면 안 됩니다.

더 비싼 호출이 더 저렴해지는 경우

가상의 모델 A는 한 번의 완전한 시도에 $0.001이 들고 승인율이 50%, 모델 B는 $0.0015와 승인율 90%라고 가정합니다. 이 비율이 안정적이라면 승인된 과제당 예상 생성 비용은 A가 $0.002, B가 약 $0.00167입니다. 위 모델들의 실제 성능을 관찰한 비교가 아닙니다.

일괄 작업을 더 완전하게 측정하는 식은 다음과 같습니다.

승인된 과제당 비용 =
  (재시도를 포함한 API 사용료 + 도구 + 검토 비용)
  / 승인 검사를 통과한 과제 수

중단된 과제의 지출도 분자에 포함하세요. 하나도 통과하지 못했다면 해당 작업 절차는 완료된 과제당 사용 가능한 비용을 입증하지 못한 것입니다. API 응답을 성공한 업무 결과로 세어 실패를 감추면 안 됩니다.

캐시와 일괄 처리는 적합한 청구액을 낮출 수 있지만 공급자의 실제 규칙을 적용해야 합니다. 캐시 읽기 요율은 캐시를 만들거나 유지하는 비용이 아니며, 지연형 일괄 작업은 동기식 응답과 같지 않습니다. 실제 트래픽 패턴을 모를 때는 비캐시 표준 요율부터 시작하세요.

AILesson 가격 계산기에서 공급자와 처리 모드에 맞춰 입력·출력 비율을 비교하세요. 그런 다음 작은 대표 실행의 실제 사용량으로 가상 수치를 바꿉니다. 10개 항목의 시범 운영은 명백한 오류와 예상 밖의 토큰 사용을 드러낼 수 있지만, 정밀한 운영 성공률을 입증할 수는 없습니다. 수천 건의 기본값을 정하기 전에 표본을 늘리세요.

새 작업 절차라면 Qwen3.8-Flash 또는 GLM-5.3-Flash를 Luna와 비교해 시작하세요. 요구 사항을 통과하면서 완료까지의 비용이 가장 작은 모델을 유지합니다. 더 비싼 모델이라는 홍보 문구가 아니라, 해결되지 않은 과제나 검토 시간이 실제로 줄었다는 근거가 있을 때 비용을 더 지불하세요.

참고 자료