Бесплатный API для LLM: тестирую 6 сервисов, модели и реальные лимиты

Для каждого сервиса смотрел, что именно дают после регистрации, какие модели действительно отвечают через API, сколько расходуется баланса и какие ограничения по RPM/RPD удаётся подтвердить. Где официальных лимитов нет, проводил собственные короткие нагрузочные тесты.
Что удалось найти
Token Harbor
Сайт: https://tokenharbor.ai/
Документация: https://tokenharbor.ai/docs
API: https://tokenharbor.ai/v1
У Token Harbor есть полноценный бесплатный тариф за $0. Пополнять баланс для бесплатных моделей не нужно — у тестового аккаунта баланс оставался $0.00.
Сейчас бесплатно доступны три модели:
deepseek-v4.1-flash:freedeepseek-v4-flash:freemimo-v2.5:free

API совместим с OpenAI. Бесплатные модели предварительно нужно включить в личном кабинете.
Все три модели проверил через POST /v1/chat/completions при нулевом балансе:
deepseek-v4.1-flash:free — HTTP 200, ~2.1 с
deepseek-v4-flash:free — HTTP 200, ~6.2 с
mimo-v2.5:free — HTTP 200, ~51.3 сДополнительно повторил запросы с отключённым кэшем. Все три снова ответили с HTTP 200.
Лимит запросов
Официальный RPM не указан. В тесте 20 запросов в минуту прошли 20/20 без ошибок.
При 60 запросах в минуту за отведённые 120 секунд успел завершиться 31 запрос из 60. При этом ни одного HTTP 429 не было — вместо жёсткой блокировки запросы начинают заметно дольше ждать обработки.
У бесплатного тарифа квота обновляется каждые 7 суток. Отсчёт начинается с первого запроса к бесплатной модели: в моём тесте заголовок X-Th-Free-Resets показал следующую дату обновления ровно через неделю.
Точный размер бесплатной квоты в токенах или деньгах сервис не указывает. Даже после серии тестов API продолжал показывать X-Th-Free-Used-Pct: 0, поэтому определить её объём короткими запросами не получилось.
Есть ещё один нюанс: при включении бесплатных моделей сервис предупреждает, что запросы и ответы на них могут сохраняться. Для платных моделей действует другая политика хранения данных.
WoAiToken
Сайт: https://new.woaitoken.com/
Документация: https://woaitoken.com/docs-category/newapi-zh/
API: https://new.woaitoken.com/v1
После регистрации WoAiToken начислил $5 стартового баланса. Ещё есть ежедневный вход: в моём случае за первый день добавили $0.0699, поэтому баланс вырос до $5.07.

API совместим с OpenAI. При создании ключа можно выбрать отдельную группу моделей. Есть как платные группы с разными коэффициентами списания, так и отдельная бесплатная группа free с коэффициентом 0x.
У бесплатной группы доступны три маршрута:
free-chat
free-code
free-fastЭто не фиксированные модели, а пулы: реальная модель выбирается автоматически и может меняться от запроса к запросу.
В тестах попадались, например:
free-chat:
Llama 3.3 70B
Nemotron 3 Ultra 550B
Command A
Nex N2.5 Mini
free-code:
Qwen3 Coder 480B
Qwen2.5 Coder 32B
free-fast:
GPT-OSS 20B
Llama 3.1 8B
Command R7B
GLM-4 FlashПроверил по 10 запросов на каждый бесплатный маршрут:
free-chat — 8/10 успешно
free-code — 8/10 успешно
free-fast — 10/10 успешноУ free-chat два запроса завершились с HTTP 402, а у free-code один раз выпала недоступная модель с HTTP 404 и один раз уже снятая с обслуживания модель с HTTP 410. Самым стабильным оказался free-fast — 10 из 10 запросов прошли успешно.
Главное — бесплатные маршруты не расходуют основной баланс.
Помимо бесплатного пула, стартовые $5 можно тратить на обычные модели. В группе gpt мне были доступны:
gpt-5.6
gpt-5.6-luna
gpt-5.6-sol
gpt-5.6-terraВсе четыре модели проверил через API — каждая вернула HTTP 200.
Также работает группа gpt-per-message:
gpt-5.6-luna-pm
gpt-5.6-sol-pm
gpt-5.6-terra-pmВсе три маршрута успешно ответили.
Из Claude на момент теста работали:
claude-opus-5
claude-sonnet-5
claude-haiku-4-5-20251001claude-fable-5 вернул HTTP 503, а группы claude-kiro и claude-per-message на момент проверки отвечали No available accounts, поэтому их в список рабочих не включаю.
После всех платных тестов баланс снизился с $5.07 до $3.20, а в профиле появился общий расход $1.87.
Unikey
Сайт: https://www.getunikey.ai/
Документация: https://docs.getunikey.ai/
API: https://www.getunikey.ai/v1
После регистрации Unikey начислил 5 000 credits. Ключ создаётся сразу в личном кабинете, API совместим с OpenAI.
Через GET /v1/models сервис вернул довольно большой список моделей, среди которых GPT, Claude, Gemini, DeepSeek, Kimi, MiniMax и Qwen.
Из наиболее интересных я проверил следующие:
gpt-6-astra — HTTP 200, ~3.0 с
claude-opus-4-8 — HTTP 200, ~3.3 с
gemini-3.5-flash — HTTP 200, ~1.8 с
deepseek-v4-pro — HTTP 200, ~5.3 с
kimi-k3 — HTTP 200, ~4.5 с
MiniMax-M3 — HTTP 200, ~4.3 с
qwen3.7-max — HTTP 200, ~23.2 сgpt-6-astra с первого раза вернул HTTP 503 из-за ограничения вышестоящего сервиса, но повторный запрос успешно прошёл с HTTP 200.
Часть моделей присутствует в /v1/models, но на момент теста не имела рабочего маршрута:
gpt-5.6-sol — HTTP 503
gpt-5.6-terra — HTTP 503
gpt-5.5 — HTTP 503У gpt-5.6-luna также был HTTP 503, но сообщение указывало на временное ограничение вышестоящего сервиса, поэтому ситуация может меняться.

Из протестированных моделей быстрее всего ответила gemini-3.5-flash — примерно за 1,8 секунды. Самой медленной оказалась qwen3.7-max — около 23 секунд.
Лимиты
RPM: официальный лимит не указан. В тесте сервис выдержал 60 запросов в минуту — 60/60 успешно, без HTTP 429. В отдельном прогоне на 20 RPM два запроса получили HTTP 524, поэтому иногда встречаются ошибки шлюза.
RPD: официальный суточный лимит не указан.
На сколько хватит 5 000 credits
В моём нагрузочном тесте 80 коротких запросов к MiniMax-M3 израсходовали около 116 credits. Если расход останется примерно таким же, стартовых 5 000 credits хватит примерно на 3–3,5 тысячи коротких запросов к этой модели.
На более дорогих моделях и при длинных ответах расход будет выше, поэтому воспринимать 5 000 credits как что-то большое не стоит — для тестирования и периодического использования этого более чем достаточно.
God Router
Сайт: https://godrouter.cyou/
Документация: https://godrouter.cyou/docs
API: https://godrouter.cyou/v1
После регистрации в профиле у меня сразу отображалось $80. API OpenAI-совместимый, поэтому для начала я просто запросил /models.
Каталог оказался небольшим — всего 11 позиций:
auto
claude-4.6-sonnet
glm-4.5-air
glm-5.3-flash
gpt-5.6-sol
Qwen3.6-35B-A3B
Qwen3.6-35B-A3B-FP8
Qwen3-Embedding-8B
spark-x2.5
step-router-v1
z-ai/glm-5.3-freeДальше прогнал их реальными запросами.
Стабильно ответили:
auto
glm-4.5-air
Qwen3.6-35B-A3B
Qwen3.6-35B-A3B-FP8
z-ai/glm-5.3-freeУ auto роутер фактически вернул модель:
agnes-3.0-flashЛимиты
Для z-ai/glm-5.3-free я отдельно проверил RPM.
Запустил 60 запросов примерно по одному в секунду. В итоге:
HTTP 200 — 9
HTTP 429 — 50
HTTP 500 — 1Самое полезное здесь то, что сервер прямо сообщил лимит:
Maximum 8 requests within 1 minutesТо есть для z-ai/glm-5.3-free можно уверенно фиксировать 8 RPM. Причём в сообщении отдельно указано, что неудачные запросы тоже могут учитываться в лимите.
RPD в открытой документации мне найти не удалось, поэтому суточный лимит отдельно не фиксирую.
После всех тестов в профиле отображалось:
Current balance: $80
Total usage: $0.0041
API requests: 22Сам баланс визуально так и остался $80, поскольку расход получился совсем маленьким.
При этом есть странность: для GPT и Claude API всё равно отвечал, что доступно 0.00 credits. Поэтому я бы не воспринимал показанные $80 как универсальный баланс для всех моделей.

ABCRelay
Сайт: https://www.abcrelay.com/
Документация: https://www.abcrelay.com/docs/index
API: https://www.abcrelay.com/v1
После регистрации ABCRelay сразу начислил $2 стартового баланса. Пополнять аккаунт для первого тестирования API не потребовалось.
API совместим с OpenAI. При создании ключа можно выбрать отдельную группу моделей. В моём аккаунте были доступны:
GPT — коэффициент 0.5x
Claude — коэффициент 0.7x
default — коэффициент 1x
Claude/CCMax — коэффициент 2x
GROK — коэффициент 2xЧерез GET /v1/models группа default вернула GPT, Claude и Grok. Отдельная группа GPT содержала актуальную линейку GPT, включая:
gpt-5.5
gpt-5.6-luna
gpt-5.6-sol
gpt-5.6-terra
gpt-6-astraВсе пять текстовых GPT-моделей я проверил реальными запросами через группу GPT 0.5x:
gpt-6-astra — HTTP 200
gpt-5.6-sol — HTTP 200
gpt-5.6-luna — HTTP 200
gpt-5.6-terra — HTTP 200
gpt-5.5 — HTTP 200gpt-6-astra также успешно ответил через обычную группу default.
С Claude ситуация оказалась хуже. Модели присутствовали в /v1/models, но claude-opus-5, claude-sonnet-5 и claude-opus-4-8 на момент теста возвращали ошибку отсутствия рабочего провайдера. Группа Claude/CCMax отдельно сообщила, что предназначена только для клиентов Claude Code.
Grok тоже присутствовал в каталоге default, но тестовые запросы получили HTTP 429 от вышестоящего сервиса. Отдельный ключ группы GROK рабочего маршрута на момент проверки не дал. Поэтому в список подтверждённо работающих моделей я включаю только GPT.
Лимит запросов
Конкретного RPM в документации я не нашёл, поэтому проверил его самостоятельно.
Сначала отправил 20 запросов за минуту к gpt-5.6-sol:
20 запросов
20 × HTTP 200
0 × HTTP 429
среднее время ответа: ~1.71 с
максимальное: ~2.98 сЗатем повторил тест уже на 60 запросах за минуту:
60 запросов
60 × HTTP 200
0 × HTTP 429
0 других ошибокТаким образом, практически подтверждено как минимум 60 RPM. Это не означает, что 60 — максимальный предел: просто выше я уже не стал нагружать сервис.
Отдельный суточный лимит запросов в документации не указан.
После всех проверок счётчик в панели дошёл до 86 успешных API-запросов. Общий расход составил всего $0.0072, а из стартовых $2 на балансе по-прежнему отображалось $1.99.

Z.ai
Сайт: https://z.ai/
Документация: https://docs.z.ai/
API-ключи: https://z.ai/manage-apikey/apikey-list
API: https://api.z.ai/api/paas/v4
Z.ai — официальная международная платформа Zhipu AI. Помимо платных GLM-моделей, у сервиса есть бесплатные Flash-модели, которыми можно пользоваться через обычный API без пополнения баланса.
Из протестированных у меня стабильно заработали:
glm-4.5-flash
glm-4.7-flashОбе вызываются через OpenAI-совместимый endpoint:
POST https://api.z.ai/api/paas/v4/chat/completionsЛюбопытный момент: GET /models бесплатные Flash-модели у меня вообще не показал. В списке были glm-4.5, glm-4.5-air, glm-4.6, glm-4.7, glm-5, glm-5.3-flash и другие модели, однако glm-4.5-flash и glm-4.7-flash успешно работают, если обращаться к ним напрямую по ID.

В первом тесте обе модели вернули HTTP 200. У GLM по умолчанию может включаться рассуждение, поэтому при маленьком max_tokens весь лимит иногда уходит в reasoning_content, а поле с финальным ответом остаётся пустым. После отключения thinking обе модели нормально вернули ответ.
Результат:

Также проверил glm-4.6v-flash. Первый запрос прошёл с HTTP 200, однако последующие попытки возвращали HTTP 429.
Лимиты
Фиксированного официального RPM для бесплатных Flash-моделей мне найти не удалось, поэтому проверил его практически на glm-4.5-flash.
Сначала модель выдержала 20 последовательных запросов без единой ошибки. Затем я запустил 60 запросов примерно за 60 секунд, но увеличивать больше не стал.
RPD в открытой документации не указан, поэтому суточный лимит я не фиксирую.
Итог
Если нужен именно API, которым можно пользоваться без первоначального пополнения, из всего протестированного больше всего мне понравились Z.ai и Token Harbor. У обоих есть реально работающие бесплатные модели, а не только стартовый бонус на несколько запросов.
God Router тоже оказался интересным вариантом. У него есть несколько маршрутов, которые работают без пополнения, в том числе z-ai/glm-5.3-free с явно указанным лимитом 8 RPM.
WoAiToken интересен сочетанием бесплатных маршрутов и стартовых $5, но бесплатные пулы там менее предсказуемы: реальная модель может меняться от запроса к запросу, а иногда встречаются ошибки вышестоящих провайдеров.
Unikey и ABCRelay я бы рассматривал скорее как возможность бесплатно попробовать платные API. Они дают стартовый баланс, которого при небольших запросах хватает надолго, но это всё-таки не постоянный бесплатный доступ.
Если знаете ещё сервисы с бесплатным API, которые стоит прогнать тем же способом, кидайте названия в комментарии.
Если тема бесплатного доступа к AI интересна, у меня есть Telegram-канал AI Ungated — там я публикую временные акции, триалы, бесплатные лимиты и другие находки по нейросервисам: https://t.me/AIUngated
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.