Назад ко всем статьям
Статья

Лучшие бюджетные LLM в 2026 году: цены API и стоимость успешной задачи

Автор:

Сравните стоимость API GLM, Qwen, GPT, DeepSeek и Gemini на трёх нагрузках. Отделяйте акции, повторы и проверку от цены токена.

Чип модели в компактном основании со встроенным монетоприёмником

Самой дешёвой модели в таблице может хватить для категорий обращений, но на других задачах она окажется дорогой — особенно если каждый третий ответ приходится исправлять. Полезный бюджетный список начинается с проверяемой работы и измеряет полную стоимость её завершения.

Для недорогих текстовых нагрузок мы бы сравнили GLM-5.3-Flash и Qwen3.8-Flash с GPT-5.6 Luna. DeepSeek V4 Flash — ещё один кандидат, особенно для работы вне пиковых часов. Gemini 3.8 Flash даёт более дорогое сравнение, когда дешёвые варианты не выполняют требования. Это выборочный список облачных API, а не заявление о самом дешёвом эндпоинте в мире или измеренном победителе по качеству.

Тарифы проверены 5 сентября 2026 года. Примеры нагрузок условны. Они не включают потребительские подписки, обещания бесплатного неограниченного использования, оборудование для собственных серверов и мультимодальную генерацию.

Держите обычную цену рядом с акционной

Все ставки ниже указаны в долларах США за миллион токенов для стандартной обработки и входа без кеша. Каждый поставщик считает токены по-своему; равные объёмы помогают составить бюджет, но не доказывают равную работу.

Модель и эндпоинтВход / 1 млнВыход / 1 млнУсловие
GLM-5.3-Flash · Z.AI$0.075 по акции; $0.15 обычно$0.25 по акции; $0.50 обычноСкидка 50% заканчивается 9 сентября в 24:00 UTC+8
Qwen3.8-Flash · Alibaba Cloud$0.15$0.47Singapore, International; запросы до 1 млн входных токенов
GPT-5.6 Luna · OpenAI$0.20$1.20Тариф короткого контекста
DeepSeek V4 Flash · DeepSeek$0.44 в пик; $0.22 вне пика$1.32 в пик; $0.66 вне пикаЦена зависит от времени
Gemini 3.8 Flash · Gemini API$0.75$3.75Вводный тариф до 31 декабря 2026 года

Для регулярной работы учитывайте обычную цену GLM наряду с временным предложением. Акция заканчивается при переходе с 9 на 10 сентября по UTC+8. Не стройте годовой бюджет по четырём оставшимся дням скидки.

Пиковые окна DeepSeek: понедельник–пятница, 01:00–04:00 и 06:00–10:00 UTC; остальные часы считаются внепиковыми. Gemini указывает ставки $1.50 за вход и $7.50 за выход с 1 января 2027 года. Запросы Luna свыше 272K входных токенов стоят дороже целиком. Регион Qwen — часть предложения; тариф другого региона относится к отдельному сравнению.

Ни одна строка не включает инструменты, налоги, неудачные попытки и ручную проверку. Через маршрутизатор модель может иметь другой тариф или конфигурацию, поэтому сохраняйте точный эндпоинт.

Три нагрузки меняют структуру расходов

Рассмотрим вымышленные месячные объёмы, распределённые по запросам в пределах соответствующих ограничений длины:

  • Классификация обращений: 5 млн входных и 0,1 млн оплачиваемых выходных токенов. Основная работа — чтение, ответ — короткая метка.
  • Резюме отчётов: 10 млн входных и 0,5 млн выходных токенов. Результат короче источника, но должен сохранять важные условия.
  • Создание черновиков: 2 млн входных и 2 млн выходных токенов. Генерация текста занимает большую долю счёта.

Для базового расчёта возьмём обычную цену GLM и пиковую цену DeepSeek:

КандидатМетки обращенийРезюмеЧерновики
GLM-5.3-Flash, обычная цена$0.80$1.75$1.30
Qwen3.8-Flash, Сингапур$0.797$1.735$1.24
GPT-5.6 Luna$1.12$2.60$2.80
DeepSeek V4 Flash, пик$2.332$5.06$3.52
Gemini 3.8 Flash, вводная цена$4.125$9.375$9

Это расчёты по ссылочным тарифам, а не оценки качества. Текущая акция GLM уменьшает её строку вдвое; подходящая внепиковая нагрузка DeepSeek — тоже. После объявленного вводного периода строка Gemini удвоится. В некоторых нагрузках самые дешёвые кандидаты близки, поэтому небольшая разница цены не должна решать выбор между результатами с разным объёмом исправлений.

Оплачиваемый выход включает применимые токены рассуждения, а не только видимые пользователю слова. Поэтому классификация одним словом может стоить больше, чем кажется по ответу. Измеряйте расход до экстраполяции.

Дешёвому варианту по умолчанию нужен чёткий критерий отказа

Для классификации обращений определите метки и действие при совпадении двух категорий. Сравните с проверенной человеком выборкой и отдельно изучите редкие классы. Модель, называющая почти всё «общим», может выглядеть точной на несбалансированной партии и проваливать важные случаи.

Для резюме используйте проверки сохранения фактов, а не предпочтение более короткого текста. Для записей применяйте проверки извлечения: правильный формат, верные значения и честная обработка отсутствующих сведений. Это полезнее для решения о переходе, чем ощущение «ответ слабый».

Выберите второго кандидата до длинного запуска. Если базовая модель не проходит детерминированную проверку, повторите с направленной обратной связью или отправьте нерешённую запись второй модели. Когда правильность нельзя проверить автоматически, делайте выборочную ручную оценку, а не считайте уверенный тон признаком всех ошибок.

У системы маршрутизации тоже есть цена. Она может отправлять правильную работу дорогой модели или пропускать неверный ответ. Измеряйте оба случая. Не утверждайте, что связка дешёвой и премиальной модели сохраняет премиальное качество, пока не оценена вся система.

Когда более дорогой вызов обходится дешевле

Допустим, условная модель A стоит $0.001 за полную попытку и принимается в 50% случаев. Модель B стоит $0.0015 и принимается в 90%. При таких условно стабильных показателях ожидаемая стоимость генерации принятой задачи равна $0.002 для A и примерно $0.00167 для B. Это не наблюдаемое сравнение моделей выше.

Более полный показатель партии:

Стоимость принятой задачи =
  (расход API с повторами + инструменты + стоимость проверки)
  / число задач, прошедших проверку

Включайте брошенные задачи в числитель расходов. Если не прошла ни одна, процесс не установил пригодную стоимость завершённой задачи. Не скрывайте неудачу, считая ответы API успешными бизнес-результатами.

Кеширование и пакетная обработка могут снизить подходящие расходы, но применяйте реальные правила поставщика. Цена чтения кеша не включает его создание или хранение, а отложенный пакет не равноценен синхронному ответу. Пока схема производственного трафика неизвестна, начинайте со стандартных тарифов без кеша.

В калькуляторе цен AILesson сравните соотношение входа и выхода, выбрав нужного поставщика и режим. Затем замените условные объёмы небольшим репрезентативным запуском. Пилот из десяти элементов обнаружит очевидные сбои и неожиданный расход токенов, но не установит точную производственную успешность. Расширьте выборку до назначения модели по умолчанию для тысяч задач.

Для нового процесса начните с Qwen3.8-Flash или GLM-5.3-Flash и сравните с Luna. Оставьте вариант, который проходит требования с минимальной полной стоимостью. Платите больше, когда данные показывают меньше нерешённых задач или проверки, а не просто потому, что следующую модель рекламируют как более способную.

Источники

AILesson · Рекомендуемые курсы

ваш следующий шаг: примените ИИ на практике

Перейдите от понимания ИИ к выполнению задач. Практикуйтесь в составлении запросов, проверке и улучшении результатов с помощью интерактивных уроков для работы и повседневной жизни.

Просмотреть все курсы