В подборках «бесплатных нейросетей» обычно показывают одно и то же: чат-арену с топовыми
моделями, китайские чаты с большими лимитами, бесплатную озвучку и генерацию видео. Для
первых экспериментов этого хватает. Но как только в запрос попадает договор, выгрузка из
CRM или переписка с клиентом, вопрос «сколько стоит» сменяется вопросом «куда уходят
данные». Разбираем, когда бизнесу достаточно бесплатного облака, когда стоит поставить
свою модель, на какое железо и какие модели на нём реально работают. Цифры и названия
моделей проверены по состоянию на сентябрь 2026 года.
Когда хватит бесплатного облака
Бесплатные сервисы закрывают задачи, где в запросе нет ничего секретного: придумать
заголовки, набросать структуру статьи, переписать публичный текст, разобраться в новой
теме, сравнить, как разные модели отвечают на один вопрос. Типичный набор выглядит так:
- Arena (arena.ai, раньше называлась LMArena). Бесплатный доступ к
сильным моделям в обмен на голосование: две анонимные модели отвечают на ваш запрос, вы
выбираете лучший ответ. Там же публичный рейтинг моделей.
- DeepSeek, Qwen, Kimi. Веб-чаты китайских разработчиков с большими
бесплатными лимитами, удобны для длинного диалога в одном окне.
- Google AI Studio. Бесплатный уровень моделей Gemini, в том числе
генерация речи.
- Сервисы картинок и видео вроде Tencent Hunyuan или TikTok Symphony с бесплатными
квотами.
Для сравнения: подписка ChatGPT Plus или Claude Pro стоит 20 долларов в месяц на
человека, а минута сгенерированного видео в платных сервисах, по подсчётам тех же
подборок, обходится примерно в 2000 рублей.
Подвох первый: ваши данные
«Бесплатно» здесь означает, что вы платите данными. Это прописано в условиях самих
сервисов:
- В FAQ Arena сказано, что переписка может попадать в открытые исследовательские
датасеты и передаваться разработчикам моделей (в обезличенном виде). Сервис сам советует
не вводить чувствительную информацию.
- Политика конфиденциальности DeepSeek: данные пользователей собираются, обрабатываются
и хранятся в КНР и используются в том числе для обучения моделей.
- По условиям Gemini API запросы с бесплатного уровня могут использоваться для
улучшения продуктов Google и просматриваться людьми. Удалить их потом нельзя: они
отвязываются от аккаунта ещё до обработки.
Для компании в России к этому добавляется 152-ФЗ. Вставить в чат-бот ФИО, телефон или
паспортные данные клиента означает обработать и передать персональные данные третьему
лицу, и отвечает за это компания, а не сотрудник, который нажал «отправить». С 1 июля
2025 года запрещено использовать зарубежные базы при первичном сборе персональных данных
граждан РФ, а за передачу данных за границу без уведомления Роскомнадзора тоже
предусмотрена ответственность. Это не юридическая консультация, но клиентские данные
в бесплатное облако лучше не отправлять вообще.
Подвох второй: лимиты и нестабильность
Бесплатные лимиты меняются без предупреждения. На Arena модель в «битве» каждый раз
случайная, а длинная история диалога не сохраняется. Серия картинок или видео из
бесплатного генератора часто выходит разной по стилю. Часть зарубежных сервисов
официально не работает для пользователей из России. Для личных экспериментов это
терпимо, а вот рабочий процесс, от которого зависят клиенты, на таком фундаменте не
построить.
Когда нужна своя модель
Своя (локальная) нейросеть работает на вашем компьютере или сервере: файлы модели скачаны
один раз, запросы никуда не уходят. Это имеет смысл в трёх случаях.
- Приватность. Договоры, сметы, переписка с клиентами, медицинские и
финансовые документы остаются внутри компании. Можно разбирать входящие письма, делать
выжимки из документов, искать по внутренней базе знаний и не думать, чьи серверы это
читают.
- Офлайн. Модель отвечает без интернета и не зависит от блокировок,
смены тарифов и лимитов чужого сервиса.
- Предсказуемая стоимость. Вы платите за железо и электричество, а не
за каждый запрос. Если модель целый день обрабатывает документы, счёт в конце месяца
от этого не растёт.
Ограничения тоже есть. Открытые модели, которые помещаются на обычное железо, пока слабее
лучших закрытых облачных. В сентябрьском бенчмарке DAREBench (12 локальных открытых
моделей против 23 коммерческих через API) локальные модели оказались конкурентны в части
задач, но в целом всё ещё отстают. Сильнее всего разница видна на агентных сценариях, где модель
сама вызывает инструменты: маленькие модели чаще путаются в формате вызова и аргументах.
Поэтому локальная модель хорошо справляется с текстом, выжимками, классификацией и поиском по
документам, а от роли полноценного агента-программиста на ноутбуке лучше не ждать многого.
Часто лучший вариант гибридный. Всё, что содержит персональные и коммерческие данные,
обрабатывает локальная модель. Сложные задачи без чувствительных данных уходят в платную
облачную модель на бизнес-тарифе, где условия обработки данных прописаны в договоре.
Какое железо под какой бюджет
Главное число здесь объём памяти, в который помещается модель. Модели для локального
запуска обычно сжимают (квантуют) до 4 бит на параметр, в таком виде нужно около 0,6 ГБ
памяти на миллиард параметров плюс 1-3 ГБ на контекст разговора. Примерно так:
- модель на 8-9 млрд параметров: 5-7 ГБ;
- на 12-14 млрд: 8-10 ГБ;
- на 27-32 млрд: 17-22 ГБ;
- на 70 млрд: около 42 ГБ.
Длинные документы в запросе съедают дополнительную память, поэтому брать железо
«впритык» под размер файла модели не стоит.
Mac на Apple Silicon
У Mac с чипами M-серии общая память для процессора и видеоядра, поэтому модель
помещается в «оперативку», а не только в память видеокарты. По умолчанию macOS отдаёт
видеоядру около 75% памяти. На практике это значит:
- 16 ГБ: модели до 9 млрд параметров, для чата и черновиков;
- 32 ГБ: модели на 27-35 млрд, качество ответов здесь заметно выше;
- 64 ГБ и больше: модели класса 70 млрд, а на 128 ГБ помещается gpt-oss-120b
(65 ГБ).
Весной 2026 года в Ollama для Mac появился движок на MLX, фреймворке Apple для
машинного обучения, летом его ускорили ещё до 20%. Главное ограничение касается
MacBook Air без вентилятора. В замерах на M5 Air под непрерывной нагрузкой скорость
за пару минут падает до 70-75% от первоначальной и дальше держится на этом уровне.
Короткий диалог этого почти не замечает, а пакетная обработка сотни документов
заметит. MacBook Pro, Mac mini и Mac Studio с активным охлаждением держат скорость
дольше.
ПК с видеокартой NVIDIA
Здесь решает объём видеопамяти (VRAM). Модель должна целиком поместиться в видеокарту,
иначе часть слоёв уходит на процессор и скорость падает в разы.
- 8 ГБ: модели на 7-9 млрд параметров с коротким контекстом;
- 12 ГБ: те же модели с запасом или 14 млрд впритык;
- 16 ГБ: 14 млрд комфортно, gpt-oss-20b (14 ГБ) на пределе;
- 24 ГБ (RTX 3090, RTX 4090): модели на 27-32 млрд;
- модели на 70 млрд без сильного сжатия требуют около 48 ГБ, то есть двух карт.
Видеокарта с 24 ГБ стоит сотни тысяч рублей, так что начинать разумно с задачи и
модели, а потом уже подбирать под них карту.
Сервер без видеокарты
Модель запустится и на обычном процессоре, но медленно. Скорость упирается в пропускную
способность памяти. Модель на 8 млрд параметров выдаёт около 3-4 токенов в секунду на
четырёх ядрах недорогого VPS, 6-10 на настольном Ryzen 7 и до 20-28 на двухпроцессорном
сервере AMD EPYC. Для сравнения, видеокарта уровня RTX 3060 даёт на той же модели
около 57 токенов в секунду. Сервер без GPU подходит для фоновых задач, которым не нужен
мгновенный ответ: ночью разобрать обращения, сделать выжимки, разметить документы. Для
живого чата на несколько сотрудников сразу или для агентов он не годится.
Аренда GPU
Если покупать железо рано, видеокарту можно арендовать. У российских облаков летом 2026
года RTX 4090 стоила порядка 75-90 рублей в час (Selectel, immers.cloud), выделенный
сервер с такой картой можно найти от 26 тысяч рублей в месяц. Почасовая аренда удобна,
чтобы проверить модель на своих задачах перед покупкой. Круглосуточная работа по
почасовому тарифу выходит примерно в 55-65 тысяч рублей в месяц, и тогда сравнивать
имеет смысл уже с покупкой. Если через арендованный сервер пойдут персональные данные,
проверьте, в какой стране стоит дата-центр и что написано в договоре.
Открытые модели, которые реально ставят локально
Все модели ниже доступны в библиотеке Ollama и распространяются под лицензией
Apache 2.0, то есть их можно использовать в коммерческих задачах. Размеры указаны для
стандартной 4-битной версии.
- Qwen3.5 (Alibaba). Линейка от 0,8 до 122 млрд параметров, понимает
картинки. Версия на 9 млрд весит 6,6 ГБ и подходит машинам с 8-16 ГБ памяти.
- Qwen3.6. Версии на 27 млрд (18 ГБ) и 35 млрд (23 ГБ), сильнее в
агентных задачах и программировании. Рассчитаны на машины с 32 ГБ.
- Qwen3.8 27B. Самая свежая модель Qwen этого размера (18 ГБ), под
те же 32 ГБ.
- Gemma 4 (Google). Версия 12B (7,6 ГБ) для обычного ноутбука,
26B и 31B (19-20 ГБ) для машин с 32 ГБ. Тоже работает с изображениями.
- gpt-oss-20b (OpenAI). 14 ГБ, только текст, рассчитана на рассуждения
и работу с инструментами. Старшая gpt-oss-120b занимает 65 ГБ.
DeepSeek V4, GLM-5.3 и Kimi K3 тоже выложены с открытыми весами, и в рейтингах это
самые сильные открытые модели. Но это сотни миллиардов и триллионы параметров, даже
облегчённым версиям нужно от сотни гигабайт памяти. На офисный компьютер их не поставить,
только на сервер с несколькими GPU.
Запускают всё это обычно через Ollama (Mac, Windows, Linux, модель
ставится одной командой), LM Studio (то же с графическим интерфейсом)
или llama.cpp, на котором основана большая часть подобных программ.
Пример для Ollama:
ollama run qwen3.5:9b
Чек-лист: облако или своя модель
- Есть ли в запросах персональные данные, коммерческая тайна или документы клиентов?
Если да, бесплатное облако отпадает, остаются своя модель или платный бизнес-тариф с
договором.
- Нужна ли работа без интернета или независимость от зарубежных сервисов? Если да,
нужна своя модель.
- Какие задачи? Тексты, выжимки, классификация и поиск по документам хорошо идут на
локальной модели. Сложные рассуждения и агентное программирование пока лучше делает
облако.
- Сколько людей будет пользоваться одновременно? Один сотрудник справится с Mac или ПК,
команде нужен сервер с видеокартой.
- Какое железо уже есть? Посмотрите объём памяти (на Mac) или видеопамяти (на ПК) и
сверьтесь с цифрами выше.
- Сколько вы тратите на подписки и API сейчас? Сравните с ценой железа или аренды на
год вперёд.
- Прежде чем покупать железо, проверьте модель на своих реальных документах, например
на арендованной видеокарте.
Установим локальную нейросеть под ваши задачи
Если хочется свою модель, но разбираться с установкой некогда, мы подберём модель под
ваше железо и задачи, поставим и настроим её на Mac, ПК или сервер и честно покажем,
где у неё предел. Напишите боту в Telegram, какие задачи хотите закрыть и какой у вас
компьютер. Бот задаст пару уточняющих вопросов и передаст заявку.
Написать боту в Telegram
Если хотите развернуть ИИ-помощников самостоятельно, посмотрите курс
«Разверни своих AI-сотрудников сам». Про формат, в котором
модели обычно отвечают, есть статья про Markdown.