Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
Выбор редакции:
😼
Выбор
редакции
74 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

Локальные модели на одной видеокарте: что реально помещается в 12 ГБ летом 2026

Год назад вопрос звучал как «можно ли вообще запустить языковую модель дома». Сейчас он другой: из полусотни открытых моделей выбрать ту, которая влезет в вашу карту и не будет тормозить. Я собрал ориентиры, по которым выбираю сам, — с цифрами по видеопамяти и без «нейросети меняют…
Мнение автора может не совпадать с мнением редакции

Год назад вопрос звучал как «можно ли вообще запустить языковую модель дома». Сейчас он другой: из полусотни открытых моделей выбрать ту, которая влезет в вашу карту и не будет тормозить. Я собрал ориентиры, по которым выбираю сам, — с цифрами по видеопамяти и без «нейросети меняют мир».

Видеопамять — жёсткий потолок, остальное вторично

Первое, что определяет выбор, — не бенчмарки, а объём VRAM. Модель, которая не помещается в память карты, либо не запустится вовсе, либо уедет в оперативную память и станет мучительно медленной: разница в скорости там не проценты, а разы.

Практические ориентиры в четырёхбитном квантовании (о нём ниже):

  • 7–8 миллиардов параметров — примерно 5–6 ГБ
  • 13–14 миллиардов — около 9–10 ГБ
  • 32 миллиарда — 20–24 ГБ
  • 70 миллиардов — 40–48 ГБ, то есть две карты или профессиональная

Отсюда следствие, которое экономит недели экспериментов: массовый потолок для одной игровой видеокарты — это 32B, а 70B начинается там, где собирают отдельную машину. Для распространённых 12 ГБ рабочий диапазон — модели на 7–14 миллиардов параметров, и уже с оглядкой на длину контекста.

Квантование: почему все начинают с Q4

Квантование — сжатие весов ради экономии памяти. Практический оптимум сегодня — Q4_K_M: занимает примерно вдвое меньше, чем исходный fp16, а качество проседает незначительно. Спускаться ниже четырёх бит имеет смысл только тогда, когда модель иначе не влезает совсем — там потери уже заметны на глаз, особенно в длинных рассуждениях и в коде.

Обратная сторона, про которую забывают: память съедает не только сама модель. Контекст — то, что модель держит «в голове» за один заход, — требует дополнительной памяти под KV-кэш, и чем длиннее диалог или файл, тем больше. Две одинаковые по железу сборки ведут себя по-разному ровно из-за этого: у одного настроен короткий контекст и всё летает, у другого длинный — и упирается в память на середине документа.

Практический вывод: если планируете скармливать модели длинные тексты или большие файлы кода, берите модель на ступень меньше, чем позволяет карта, и оставьте запас под контекст.

Плотные модели против MoE

Классическая «плотная» модель задействует все параметры на каждый токен — предсказуемо, но тяжело. Модели со смесью экспертов (MoE) держат много специализированных блоков, а включают только нужные: gpt-oss на 120 миллиардов параметров активирует лишь малую часть весов и на подходящем железе идёт быстрее плотной модели сопоставимого качества.

Ловушка в том, что MoE всё равно занимает память под все веса целиком, даже если считает не всеми. Для одной видеокарты это означает простую вещь: плотная модель на 14–32 миллиарда практичнее крупной MoE, которая в память просто не помещается. MoE становится выгодной там, где памяти много, а скорость критична.

Что выбирать под задачу

Универсальной модели «на всё» в 2026 году по-прежнему нет — специалист под задачу почти всегда обходит универсала того же размера.

  • Универсальный чат и мультиязычность: Qwen3, размеры от 0.6 до 32 миллиардов, лицензия Apache-2.0
  • Рассуждение, логика, математика: дистилляты DeepSeek-R1, от 1.5 до 70 миллиардов, лицензия MIT
  • Код и локальная замена облачного ассистента: Qwen Coder, до 32 миллиардов
  • Эффективность и мультимодальность на одной карте: Gemma 3 в вариантах 4, 12 и 27 миллиардов
  • Рассуждение на слабом железе: Phi-4 на 14 миллиардов под MIT, около 10 ГБ в Q4
  • Баланс качества и скорости: Mistral Small на 24 миллиарда, примерно 15 ГБ
  • Речь в текст: Whisper, от tiny до large-v3, от 1 до 10 ГБ

Лицензия — не формальность, если модель пойдёт в рабочий проект: часть линеек полностью свободна (Apache-2.0, MIT), часть идёт с оговорками сообщества, и это выясняется до внедрения, а не после.

Чем запускать

Веса — это просто файл; чтобы с моделью говорить, нужен раннер. К середине 2026 года массовых варианта два. Ollama живёт в командной строке, удобна для автоматизации и серверных сценариев: одна команда скачивает и поднимает модель. LM Studio — графическое приложение с чатом и каталогом моделей из коробки, вариант для тех, кто не хочет возиться с терминалом.

На выбор модели раннер не влияет: одни и те же веса в формате GGUF работают в обоих, разница только в удобстве и интеграциях. Оба по умолчанию тянут квантованные версии, поэтому специально разбираться в квантовании на старте не обязательно — достаточно помнить, что Q4 разумный дефолт.

Про скорость: какие цифры считать нормальными

На потребительской видеокарте модель на 7 миллиардов в Q4 выдаёт примерно 40–80 токенов в секунду — это заметно быстрее чтения, работать комфортно. На процессоре без видеокарты те же модели идут в разы медленнее, и дело не в терпении: при интерактивной работе задержка ломает сам сценарий, проще открыть облако.

Отдельно стоит смотреть на скорость обработки промпта — она определяет, сколько вы ждёте перед первым словом ответа при длинном контексте. Для работы с кодом именно эта величина, а не скорость генерации, чаще оказывается бутылочным горлышком: модель может печатать быстро, но полминуты «читать» ваш файл.

Частые ошибки

Первая — гнаться за числом параметров. Модель на 32 миллиарда, которая свопится в оперативную память, проигрывает четырнадцати миллиардам, полностью уместившимся в видеопамять, по всем практическим метрикам сразу.

Вторая — забыть про контекст при расчёте памяти и обнаружить нехватку на реальном документе, а не на тестовом «привет».

Третья — мерить качество одним вопросом. Разница между линейками проявляется на длинных задачах: следование формату, удержание условий из начала диалога, аккуратность в коде. Один удачный ответ ничего не говорит о модели.

Четвёртая — игнорировать лицензию до момента, когда проект уже написан вокруг конкретных весов.

Что в итоге

Порядок выбора, который экономит время: сначала задача, потом объём видеопамяти, потом лицензия — и только после этого имя модели. Для одной карты с 12 ГБ разумный старт — плотная модель на 12–14 миллиардов в Q4 с умеренным контекстом; для 24 ГБ открывается диапазон 32B, где локальный запуск уже сопоставим с облачными сервисами среднего уровня на многих повседневных задачах.

Линейки обновляются быстро — за последний год почти каждая из перечисленных семей успела сменить поколение. Поэтому запоминать стоит не имена, а принцип: память ограничивает размер, квантование даёт запас, контекст съедает остаток, а специализированная модель обходит универсальную того же класса.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем
Комментарии
Выбрать файл
Блог проекта
Расскажите историю о создании или развитии проекта, поиске команды, проблемах и решениях
Написать
Личный блог
Продвигайте свои услуги или личный бренд через интересные кейсы и статьи
Написать

Spark использует cookie-файлы. С их помощью мы улучшаем работу нашего сайта и ваше взаимодействие с ним.