Разговор про своё железо почти всегда начинается с одной суммы: «карта стоит двести тысяч». Дальше выясняется, что карта это меньше половины расходов, а решает вообще не она.
Разложу три варианта по деньгам, посчитаю электричество на калькуляторе и покажу формулу, по которой видно, при каком потоке запросов своё железо начинает выигрывать у облачного API. Числа ниже это ориентиры рынка на лето 2026 года, тарифы проверяйте перед покупкой: они двигаются быстро.
Вариант первый: арендовать GPU
Самый быстрый способ проверить гипотезу, не влезая в закупку.
Ориентиры рынка по России: помесячная аренда сервера с картой уровня RTX 3090 или 4090 идёт в коридоре 25-60 тысяч рублей, почасовая на той же карте 50-130 рублей в час. Серверные ускорители с 40-80 гигабайтами памяти начинаются от 120 тысяч в месяц и малому бизнесу не нужны почти никогда.
Почасовая схема выгодна там, где нагрузка неровная. Ночная пакетная обработка документов, разовая переиндексация базы, эксперимент с новой моделью на выходных: включили, отработали, выключили. Два часа в сутки по 90 рублей это 5,4 тысячи в месяц, что дешевле любой покупки.
Помесячная имеет смысл, когда сервис должен отвечать круглосуточно и мгновенно. Держать модель загруженной в память постоянно на почасовом тарифе выйдет дороже аренды на месяц.
Минус у аренды один, зато существенный: ваши данные лежат на чужой машине. Для требований безопасности, ради которых обычно и затевается локальный запуск, это может оказаться неприемлемым. Границу «что можно отдавать наружу» разбирал отдельно.
Вариант второй: купить свою машину
Смета собирается из двух частей, и вторая обычно недооценена.
| Компонент | Ориентир рынка |
|---|---|
| RTX 3060 12 ГБ | 30-40 тыс. ₽ |
| RTX 4060 Ti 16 ГБ | 50-65 тыс. ₽ |
| RTX 3090 24 ГБ, б/у | 70-100 тыс. ₽ |
| RTX 4090 24 ГБ | 200-260 тыс. ₽ |
| Платформа: процессор, плата, 64 ГБ ОЗУ, NVMe 2 ТБ, БП 850 Вт, корпус | 80-130 тыс. ₽ |
Три сборки, которые встречаются на практике. Бюджетная под классификацию и извлечение полей на модели в 8 миллиардов параметров: 120-170 тысяч. Средняя под 14B и базу знаний: 180-230 тысяч. Сильная с 24 гигабайтами видеопамяти под модели на 32 миллиарда: 300-380 тысяч рублей.
Про диск скажу отдельно, потому что на нём спотыкаются регулярно. Веса весят от 2 до 40 гигабайт, на пробу скачивается три-четыре штуки, удалять их забывают. У нас забитый диск дважды ронял выкладку невнятной ошибкой: час на диагностику, две минуты на лечение. Два терабайта NVMe и чистка старых весов по расписанию закрывают вопрос.
Электричество: считаем, а не пугаем
Видеокарта под полной нагрузкой ест 350-450 ватт, вся машина около 550. В простое с загруженной в память моделью около 100-120 ватт.
Реальный профиль малого бизнеса это не круглосуточный расчёт, а два-три часа фактической генерации в сутки и всё остальное время простой.
- нагрузка: 0,55 кВт × 2 ч × 30 дней = 33 кВт·ч
- простой: 0,11 кВт × 22 ч × 30 дней = 72,6 кВт·ч
- итого около 106 кВт·ч в месяц, по тарифу 6 рублей это 640 рублей
Даже при круглосуточной полной загрузке выходит 396 кВт·ч и около 2,4 тысячи рублей. Электричество не главная строка, хотя пугают им чаще всего. Главные строки другие.
Строки, которые забывают
Администрирование. Драйверы, обновления, мониторинг температуры, перезапуск упавшего сервиса, чистка диска. На устоявшейся системе это 3-6 часов в месяц. По консервативной ставке 900 рублей за час полной стоимости сотрудника выходит 2,7-5,4 тысячи рублей ежемесячно.
Простой. Карта сгорела, и вы неделю без сервиса, потому что запасной нет. У облака эта проблема закрыта чужими руками.
Место и шум. Машина с 4090 под нагрузкой греется и гудит. В переговорной её не поставить, нужна хотя бы кладовка с вентиляцией.
Срок жизни. Амортизацию на 5 лет считать оптимистично: за три года выходят новые карты и модели, которым нужно больше памяти. Мы считаем на 36 месяцев.
Вариант третий: без видеокарты вообще
Недооценённый путь. Обычный сервер с 16-20 ядрами и 32 гигабайтами памяти стоит в аренде 4-9 тысяч рублей в месяц, а купить такую машину можно за 60-90 тысяч.
Наш замер на своём внутреннем сервере: 20 ядер, 31 гигабайт памяти, GPU нет. Модель Qwen3-4B в четырёхбитном квантовании отвечает на рабочий вопрос за 11 секунд, короткий вопрос закрывает за секунду. Девятимиллиардная GLM на том же железе даёт 17 секунд и заметно более точные формулировки по отраслевой терминологии.
Я перед запуском прогнозировал 30-90 секунд и ошибся втрое в худшую сторону. Урок простой: не отговаривать по прикидкам, а мерить на живом железе.
Для внутреннего ассистента, ночной обработки почты, классификации заявок и разбора документов такой скорости достаточно. Для чата с клиентом на сайте нет. Какие модели влезают в какое железо, разобрано в статье про выбор модели под задачу.
Формула окупаемости
Считаем две величины в месяц и сравниваем.
Своё железо = цена сборки / 36 месяцев + электричество + часы админа × ставка
Облако = обращений в месяц × токенов на обращение / 1 000 000 × цена за миллион
Подставим среднюю сборку за 220 тысяч рублей:
- амортизация: 220 000 / 36 = 6 100 ₽
- электричество: 640 ₽
- админ, 4 часа по 900: 3 600 ₽
- итого около 10 300 ₽ в месяц
Теперь облако. Одно обращение к базе знаний вместе с подложенными фрагментами съедает 5-15 тысяч токенов, возьмём 10 тысяч. У экономичных моделей вроде DeepSeek стоимость миллиона токенов держится в районе сотни рублей с учётом входа и выхода.
10 300 рублей делим на 100 рублей за миллион, получаем 103 миллиона токенов в месяц. Делим на 10 тысяч токенов на обращение: порядка 10 тысяч обращений в месяц, то есть около 340 в день. Ниже этого потока своё железо проигрывает по деньгам, выше начинает выигрывать.
С топовой зарубежной моделью, где миллион токенов стоит в десять-тридцать раз дороже, порог падает до 400-1000 обращений в месяц.
Здесь и прячется подвох, из-за которого расчёт часто врёт. Локальная модель на 8-14 миллиардов параметров не равна топовой облачной по качеству, и сравнивать их ценники некорректно. Честная арифметика получается только против сопоставимой по классу облачной модели, и тогда порог держится в районе нескольких сотен обращений в день. В статье про локальную LLM я писал про сотни тысяч запросов в месяц: это порог против дешёвой облачной модели, и он никуда не делся.
Три варианта в одной таблице
| Вариант | Разово | В месяц | Кому подходит |
|---|---|---|---|
| Аренда GPU почасово | 0 | 3-10 тыс. ₽ при 2 ч в сутки | пилот, ночная пакетная обработка, эксперименты |
| Аренда GPU помесячно | 0 | 25-60 тыс. ₽ | круглосуточный сервис без своей серверной |
| Своя машина с картой | 120-380 тыс. ₽ | 8-15 тыс. ₽ с админом | постоянный поток и требования по данным |
| Сервер без GPU | 60-90 тыс. ₽ или аренда | 4-9 тыс. ₽ | внутренние задачи, где 10-20 секунд ожидания норма |
Отдельное сравнение аренды и покупки. Сборка за 220 тысяч отбивает помесячную аренду за 35 тысяч примерно за полгода круглосуточной работы. При использовании два часа в сутки почасовая аренда обойдётся в 5,4 тысячи в месяц против 10,3 тысячи у своей машины, и покупка не окупится никогда.
Когда своё железо не нужно
Поток меньше сотни обращений в день. Токены на таком объёме стоят единицы тысяч рублей в месяц. Покупка карты здесь это покупка спокойствия, а не экономия, и называть вещи стоит своими именами.
Пилот ещё не собран. Пока нет замеров качества на своих данных, непонятно, какого размера модель вам нужна, а значит непонятно, какую карту брать. Мы видели компании, которые купили железо и полгода искали ему задачу.
Некому обслуживать. Нет системного администратора с временем на это, нет и локального контура. Через два месяца он превратится в выключенную машину под столом.
Задачи требуют качества топовой модели. Юридический разбор, длинная многошаговая логика, сложные инструкции. Тут своё железо не экономия, а понижение качества за свои же деньги.
Нагрузка сезонная. Раз в квартал разобрать архив документов проще на почасовой аренде, чем держать простаивающую карту.
Требование звучит как «данные должны остаться в России». Это закрывается российским облаком, а не своей стойкой. Локальный контур нужен, когда формулировка другая: данные не должны покидать наш контур.
Короткие ответы на частые вопросы
Подойдёт ли игровой ноутбук вместо сервера? Для проверки гипотезы да, для эксплуатации нет. Ноутбучные карты режут частоты под нагрузкой, память обычно 8 гигабайт, а круглосуточная работа убивает охлаждение за несколько месяцев.
Есть ли смысл брать 3090 с рук? Часто да: 24 гигабайта видеопамяти за 70-100 тысяч это лучшее соотношение цены и памяти на рынке. Риск в состоянии карты после майнинга, поэтому берите с проверкой под нагрузкой и закладывайте, что гарантии нет.
Сколько проживёт карта под ИИ-нагрузкой? При нормальном охлаждении три-четыре года без драмы. Убивает не нагрузка, а перегрев в тесном корпусе и пыль. Термопрокладки и чистка раз в год стоят копейки и продлевают жизнь заметно.
Считать ли зарплату админа, если он и так в штате? Считать. Часы, которые он тратит на модель, он не тратит на другое. Иначе экономия в расчёте появляется из воздуха, а потом внезапно кончается вместе с админом.
Можно ли начать с аренды и переехать на своё? Да, и это разумный порядок. Слой модели в приложении меняется тремя переменными окружения: адрес, ключ, название модели. Переезд занимает дни, а не переписывание системы.
Что посчитать до покупки
Три цифры закрывают вопрос. Сколько обращений в месяц реально придёт. Сколько токенов съедает одно обращение (замеряется за час на пилоте). Какой класс модели вам нужен по качеству.
Дальше подставьте их в формулу выше и сравните с ценой сборки, поделённой на 36. Если разница меньше двух раз, берите аренду: гибкость дороже экономии в десять процентов.
Приходите на AI-аудит с этими тремя цифрами: посчитаем вместе и скажем прямо, если в вашем случае видеокарта не нужна. Из чего складывается весь бюджет внедрения, кроме железа, разобрано в статье сколько стоит внедрить ИИ, а что мы собираем на этой инфраструктуре, показано на странице разработка ИИ-агентов.