Какую модель поставить на свой сервер: разбор по задачам

Как выбрать локальную LLM под задачу и железо: сколько VRAM нужно моделям на 7, 14 и 32 миллиарда, что отнимает квантизация Q4 и где хватает маленькой модели.

Типовая история: компания купила карту на 24 гигабайта, поставила на неё самую большую модель, которая влезла, и подключила к внутреннему чату. Через две недели чатом перестали пользоваться. Ответ приходил через сорок секунд, а сотруднику быстрее было спросить коллегу.

Модель выбирают не по рейтингу на сайте с бенчмарками. Выбирают по трём числам: сколько у вас видеопамяти, какого качества требует задача и сколько секунд человек готов ждать. Разберу каждое, с замерами на нашем железе.

Сколько памяти реально съедает модель

Считать надо не «размер модели в миллиардах», а вес файла плюс место под контекст. Порядки такие: в восьмибитном виде модель занимает примерно один байт на параметр, в четырёхбитном Q4_K_M около 0,6 байта. Восьмимиллиардная модель это 8 гигабайт в Q8 и 4,7 гигабайта в Q4.

Дальше сверху ложится KV-кэш, то есть память под сам диалог и подложенные документы. Считайте, что контекст добавит от 15 до 30 процентов, а на длинных запросах в 32 тысячи токенов и больше он способен съесть несколько гигабайт.

РазмерФайл в Q4_K_MНужно VRAM (контекст 8k)Типичная карта
3-4B2-2,5 ГБ4-5 ГБлюбая игровая от 6 ГБ
7-8B4,5-5 ГБ7-8 ГБRTX 3060 12 ГБ
12-14B8-9 ГБ11-13 ГБRTX 4070 Ti / 4060 Ti 16 ГБ
27-32B18-20 ГБ22-24 ГБRTX 3090 или 4090 24 ГБ
70B40-42 ГБ46-50 ГБдве карты по 24 ГБ или серверный ускоритель

Практический вывод из таблицы неприятный для владельцев карт на 8 гигабайт. В такую карту нормально влезает восьмимиллиардная модель с коротким контекстом, и всё. Хотите работать с документами на десяток страниц, планируйте 16 гигабайт. Базовые требования к контуру я разбирал в статье про локальную LLM на своём сервере, здесь речь именно про выбор весов.

Что отнимает квантизация

Квантизация это сжатие весов: числа хранятся грубее, файл становится меньше, память экономится в разы. Платите вы точностью, и платите неравномерно.

Q8 от исходной модели на глаз почти неотличим. Q4_K_M теряет заметно, но терпимо: страдают длинные цепочки рассуждений, устойчивость строгого формата вроде JSON по схеме из пятнадцати полей и редкая терминология. Q3 и ниже я в работу не беру, там модель начинает путать смысл, а не только формулировки.

Главное правило звучит контринтуитивно. При одинаковом объёме памяти берите модель побольше в Q4, а не поменьше в Q8. Четырнадцать миллиардов в четырёх битах на тех же 12 гигабайтах обыгрывают восемь миллиардов в восьми битах почти на любой содержательной задаче. Исключение одно: сценарии, где важен строгий машинный формат ответа, там мельче квантование бьёт по дисциплине вывода сильнее, чем помогает лишний размер.

Русский язык: чем модели отличаются

Разница между моделями на русском больше, чем разница на английском, и в бенчмарках она почти не видна.

Qwen последних версий сейчас рабочая база для малых размеров: 4B и 8B пишут по-русски связно, падежи держат. Llama и Mistral на английском сильны, на русском отвечают с акцентом: канцелярит, кривое согласование, иногда сваливаются в английский посреди абзаца. Gemma посередине. Отдельно стоят русские дообучения открытых моделей, вроде линейки T-lite и T-pro от Т-Банка или проекта Vikhr, они собраны поверх Qwen и Mistral и на деловой переписке ведут себя аккуратнее базовых версий.

Про GigaChat и YandexGPT надо сказать прямо, потому что их регулярно предлагают «поставить на сервер». Это API в облаке провайдера, весов вы не получаете. Требование «данные не покидают Россию» они закрывают, требование «данные не покидают наш контур» нет. Разница принципиальная, и её стоит проговорить с безопасностью до закупки железа. Что имеет смысл держать у себя, а что спокойно уходит наружу, разобрано здесь.

Замер на процессоре, без видеокарты

На своём внутреннем сервере (20 ядер, 31 гигабайт памяти, GPU нет и не предвидится) мы запускали две модели через llama.cpp. Вопрос задавали рабочий, про приёмку монолитных работ, длиной около 150 токенов.

МодельВес Q4_K_MСкоростьВремя ответа
Qwen3-4B2,4 ГБ13,2 ток/с11 секунд
GLM-4-9B5,8 ГБ5,9 ток/с17 секунд

Я обещал владельцу «от тридцати до девяноста секунд» и ошибся втрое. Двадцать ядер тянут четырёхмиллиардную модель нормально: короткий вопрос закрывается за секунду.

Качество развело модели сильнее, чем скорость. GLM выдал строительную конкретику: геодезический контроль, марка бетона по прочности, шаг арматуры и сварные швы. Qwen отвечал обобщённо и разок промахнулся мимо темы. Мы оставили обе кнопки в интерфейсе: быстрая на каждый день, медленная когда надо подумать.

Экстраполяция по тем же ядрам: 14B выдаст около 4 токенов в секунду, 32B около 1,7. Тридцать вторую на процессоре ставить бессмысленно, ответ будет собираться минуту с лишним.

Где хватает маленькой модели

Список задач, которые 4-8B закрывают уверенно и без видеокарты за сотни тысяч:

  • разбор обращения по 5-10 категориям и маршрутизация в нужный отдел;
  • извлечение полей: телефон, ИНН, сумма, срок поставки, номер договора;
  • проставление тегов и рубрик, нормализация названий;
  • короткий пересказ письма или расшифровки звонка;
  • черновик типового ответа, который человек правит перед отправкой.

Отдельная мысль, которая экономит больше всего денег: под узкую задачу специализированная модель почти всегда обгоняет универсальную. На разборе нашего фотоархива замена языковой модели зрения на CLIP ускорила обработку кадра с 85 секунд до 57 миллисекунд без потери качества поиска. Выигрыш дала не покупка железа, а суженная постановка задачи.

Где нужна большая, и где локальная проигрывает всегда

Начинают сыпаться модели поменьше на предсказуемых вещах: инструкция с десятком условий и исключений, сведение противоречий из трёх документов, работа с текстом на 50 страниц целиком, устойчивый JSON строго по схеме, отраслевые термины, которых мало в обучающих данных.

И честное, ради чего стоит читать этот раздел. Локальная модель на 8-14 миллиардов не догоняет топовую облачную на сложных рассуждениях. Разрыв не в проценты, он в другом классе задач. Юридический анализ договора, разбор нестандартной претензии, длинная многошаговая логика: тридцатидвухмиллиардная модель подойдёт близко, восьмимиллиардная не подойдёт никогда. Если пилот собирался на облаке и всех устроил, перенос на локальную восьмёрку почти наверняка разочарует.

Таблица: задача, размер, железо, цена вопроса

ЗадачаРазмер моделиЖелезоЧем платите
Классификация, теги, маршрутизация3-8B Q48 ГБ VRAM или 16-20 ядер CPUпрактически ничем
Извлечение полей из документов7-14B Q412-16 ГБ VRAMбрак 3-7%, нужен валидатор схемы
Ответы по базе знаний с поиском8-14B Q412-16 ГБ VRAMформулировки суше облачных
Тексты и письма на русском14-32B Q424 ГБ VRAMскоростью, 15-25 токенов в секунду
Разбор договоров, длинная логика32B+ либо облако24-48 ГБ VRAMздесь локальная проигрывает облаку
Фото, сканы, распознаваниеспециализированные модели8-12 ГБ VRAMрукопись не читается вообще

Как выбрать за один вечер

Возьмите 20 своих реальных примеров: обращения клиентов, куски документов, письма. Не придуманные, а такие, какие приходят на самом деле.

Прогоните три кандидата разного размера через Ollama, хоть на рабочем ноутбуке с игровой картой. Ответы сложите в таблицу без подписей, кто где, и дайте оценить сотруднику, который эту работу делает руками. Слепая оценка нужна не для строгости, а потому что название модели влияет на мнение сильнее, чем её ответ.

Рядом запишите время ответа. Модель, которая думает 40 секунд, проиграет более глупой и быстрой на любой живой задаче с человеком на другом конце.

Час работы, зато решение будет принято по своим текстам, а не по чужому рейтингу.

Где это не работает

Нет эталона, нет выбора. Пока никто не сказал, какой ответ считается правильным, сравнение моделей превращается в спор о вкусах, а победит та, чей стиль понравился начальнику.

Одновременность ломает расчёт. Модель, которая отвечает за 5 секунд одному человеку, при пяти запросах в одну секунду выстроит очередь. Лечится это vLLM с пакетной обработкой или второй картой, но не выбором другой модели.

Обновление версии не бесплатно. Свежая модель отвечает лучше на бенчмарках и иногда хуже на ваших задачах, а промпты под неё придётся переписывать. Прогоняйте тот же набор из 20 примеров перед каждой сменой весов.

Дообучение под себя это не «поставить модель». Fine-tune требует размеченных данных, отдельного железа и человека, который умеет. В девяти случаях из десяти нормальный поиск по документам и внятный промпт дают больше при несопоставимо меньших затратах.

Короткие ответы на частые вопросы

Стоит ли брать 70B, если бюджет позволяет? Только если задача действительно про рассуждения и вы уже упёрлись в потолок тридцатидвухмиллиардной. Две карты по 24 гигабайта плюс сборка это разовые сотни тысяч рублей, а прирост качества на классификации и извлечении полей вы не заметите.

Какая модель лучше для русского прямо сейчас? Универсального ответа нет, и любой конкретный обесценится за пару месяцев. Рабочая процедура: берите свежий Qwen нужного размера как базу, добавьте одно русское дообучение поверх той же архитектуры и сравните на своих 20 примерах.

Можно ли держать несколько моделей одновременно? Да, если суммарно влезают в память. У нас на одном сервере живут четырёхмиллиардная и девятимиллиардная, вместе занимают 15 гигабайт из 31, переключение идёт кнопкой в интерфейсе. Схема удобная: быстрая для потока, тяжёлая для сложных вопросов.

Сколько места на диске закладывать? Считайте от 100 гигабайт с запасом. Веса весят от 2 до 40 гигабайт, а на пробу вы скачаете три-четыре штуки и забудете удалить. Мы так один раз уронили деплой на забитом диске, диагностика заняла час, лечение две минуты.

Модель поменьше плюс база знаний обгонит модель побольше? На фактических вопросах по вашим документам почти всегда да. Основную работу делает поиск, модель только формулирует найденное. На вопросах, требующих рассуждения, размер снова решает.

Что сделать дальше

Определитесь с задачей до похода в магазин за картой. Классификация и извлечение полей закрываются восьмимиллиардной моделью на 12 гигабайтах, а иногда и процессором. Всё, что похоже на «пусть подумает», требует либо 24 гигабайт, либо облака.

Если хотите пройти этот выбор не вслепую, приходите на AI-аудит: посмотрим на ваши тексты и поток запросов и скажем, какого размера модели вам хватит. Как считается общий бюджет внедрения, разобрано в статье сколько стоит внедрить ИИ, а что мы собираем на локальных моделях, показано на странице разработка ИИ-агентов.

Хотите такой же процесс у себя?

Начните с AI-аудита: разберём процессы, покажем, где автоматизация окупится первой, и предложим сценарий внедрения.

Запросить AI-аудит Написать в Telegram