Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
45 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

Открытые LLM в августе 2026: сравнение DeepSeek V4, GLM-5.2, Kimi K3, Qwen и Llama 4

Разбираю, что сейчас есть в открытых весах: параметры, контекст, лицензии и баллы SWE-bench. Отдельно про русский язык — почему текст обходится на треть дороже, чем следует из прайса, чем мерить качество на русском и какие два отказа не видны ни в одном бенчмарке.
Мнение автора может не совпадать с мнением редакции

Каждую неделю выходит очередная модель, и каждую неделю кто-то в чате скидывает скриншот таблички с бенчмарками. Толку от этих табличек мало. Цифра на SWE-bench не говорит, сколько у вас будет стоить обработать русский документ и не уедет ли модель на английский к третьему абзацу.

Попробую разложить, что сейчас есть в открытых весах и на что я смотрю кроме баллов.

Расклад на август

DeepSeek V4 идёт в двух версиях. Flash это 284B всего при 13B активных, Pro — 1.6T при 49B. Контекст миллион, лицензия MIT. По вендорским замерам Pro даёт 80,6% на SWE-bench Verified, Flash 79,0%. Flash при этом стоит примерно десятую часть от фронтира, отставая на общих задачах где-то на десяток пунктов. Для большинства продуктовых задач это отличная сделка.

GLM-5.2 от Z.ai — около 744B, из них активных примерно 40B (в разных источниках цифры немного расходятся, я видел и 753B). Контекст миллион, MIT. Держит первую строчку среди открытых в Artificial Analysis. Затачивали под агентное кодирование и длинные рассуждения, и это заметно.

Kimi K3 — 2.8T на 104B активных, миллион контекста, зрение из коробки. По замерам Vals AI 93,4% SWE-bench Verified, первое место во фронтенде. Две проблемы. Лицензия собственная, читать надо целиком. И полтора терабайта весов, так что «поднимем у себя» превращается в отдельный квартальный проект.

Qwen интереснее всех размерами. Qwen3-Coder-Next выдаёт 70,6% Verified и запускается на 46 гигабайтах унифицированной памяти, а Flash на 30B влезает в 18. Это ровно тот случай, когда модель живёт на ноутбуке разработчика и не звонит никуда наружу. Открытые версии под Apache 2.0, у Max-версий лицензия другая.

Llama 4 — Scout на 109B (17B активных, контекст до 10M) и Maverick на 400B. Экосистема лучшая на рынке, инструменты под неё есть под всё. Но лицензия community с ограничениями по юрисдикциям, и читать её надо до, а не после.

MiniMax M3 даёт около 80,5% и хороша в агентных сценариях, лицензия тоже community.

Оговорюсь сразу: половина цифр выше — вендорские. Я их привожу как указатель, что тестировать первым, а не как результат.

Про лицензии скучно, но это дороже пары пунктов

MIT у DeepSeek и GLM означает, что можно всё: коммерция, дообучение, что угодно. Дальше начинаются нюансы. Custom-лицензии Kimi и MiniMax, community у Llama — там встречаются ограничения по юрисдикции, по размеру бизнеса, по возможности обучать на выводах модели другие модели.

Проверять это надо до того, как команда полгода строила продукт вокруг конкретной модели. Замена модели в проде это не строчка в конфиге. Это переписанные промпты и заново собранная оценка качества, а если у вас были файнтюны — то и они.

Кириллица дороже, чем написано в прайсе

Вот тут прайс за миллион токенов начинает врать.

Токенизаторы почти всех моделей учили на корпусах, где английский доминирует. Русский текст режется мельче, и один и тот же смысл стоит больше токенов. Цифры конкретные: у Qwen3 на русской Википедии выходит 3,63 токена на слово. У T-pro 2.0, где 34 тысячи низкочастотных токенов заменили кириллическими, — 2,71. Доля слов, влезающих в два токена, поднялась с 38 до 60 процентов.

Разница между 3,63 и 2,71 — это примерно треть счёта. Когда вы сравниваете две модели по прайсу, этот множитель не виден вообще, а в конце месяца виден прекрасно.

С контекстом та же история. Заявленный миллион на русских документах — это ощутимо меньше документа, чем на английских. Если строите RAG под фиксированное окно, меряйте на своём корпусе в символах, а не верьте карточке модели.

И скорость. Больше токенов на тот же смысл это буквально больше шагов декодирования. В работе по адаптации LLaMa под русский расширение словаря дало до 60% ускорения генерации на длинных ответах и файнтюн на 35% быстрее. Качество там тоже подросло, Russian SuperGLUE с 0,445 до 0,509 в zero-shot, но меня в той статье больше зацепила именно скорость.

Чем мерить русский

Английские бенчмарки про русский не говорят ничего. Из профильного есть MERA (примерно роль MMLU для русского), ruMMLU-Pro и MaMuRAMu на знания и логику, Arena Hard Ru и WildChat Hard Ru на диалоги, ruMATH-500, ruAIME, ruGPQA и T-Math на рассуждение.

Точка отсчёта, которая мне нравится: T-pro 2.0 от T-Tech. Собрана на Qwen3-32B, кириллица-плотный токенизатор, спекулятивное декодирование EAGLE с ускорением 1,85x. MERA 0,66, ruMMLU-Pro 0,697, Arena Hard Ru 91,1. То есть тридцатидвушка, адаптированная под язык, на русских задачах спокойно конкурирует с моделями сильно крупнее. Это довольно сильный аргумент против «берём самую большую».

Ещё два отказа, которых нет ни в одном бенчмарке, но которые ломают продукт. Первый — срыв языка: модель отвечает по-английски на русский вопрос или сползает на английский в длинном ответе. Ловится детектором языка по абзацам за полчаса работы, но только если вообще проверять. Второй — падежи в структурированном выводе. Просишь JSON с русскими значениями, получаешь поля в именительном там, где нужен родительный, или вообще транслит. Для продукта это больнее, чем два пункта на общем бенчмарке.

Что под что брать

Массовая разметка, извлечение полей, классификация тикетов — мелкие модели. Qwen3 Flash на 30B закрывает такое и крутится локально. Платить фронтир-цену за разметку тикетов незачем.

Кодовый агент с длинной цепочкой инструментов — GLM-5.2 или DeepSeek V4 Pro. Тут важен не столько балл, сколько стабильность tool calling. Модель с шикарным SWE-bench, которая через раз отдаёт сломанный JSON в аргументах функции, в агентном цикле бесполезна, и в таблицах этого не увидишь.

Фронтенд и картинки — Kimi K3, если готовы разбираться с лицензией.

Русский как основной язык продукта — смотрите на адаптированные модели и на список бенчмарков выше.

Длинный контекст — Llama 4 Scout формально даёт 10M, но качество на всей длине окна проседает у всех задолго до заявленного максимума. Проверяйте на своей длине, не на маркетинговой.

Вечер работы

Публичные бенчмарки отвечают на вопрос, что тестировать первым. Решение принимается по своим замерам, и минимальный набор занимает вечер.

Возьмите двадцать реальных запросов из продукта, прогоните через трёх кандидатов, сравните вслепую руками. Померьте фактический расход токенов на своём корпусе через usage в ответе, а не по прайсу. Проверьте срыв языка и валидность структурированного вывода, если он вам нужен. Ну и TTFT с полным временем ответа на своей нагрузке, а не в тепличных условиях.

Это часа три, и они дают больше, чем неделя чтения сравнительных табличек.

Мы в Yenisei держим каталог открытых моделей, поэтому часть наблюдений выше не из чужих статей. Если у вас выбор модели решался как-то иначе, напишите в комментариях — контрпримеры интереснее подтверждений.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем
Комментарии
Выбрать файл
Блог проекта
Расскажите историю о создании или развитии проекта, поиске команды, проблемах и решениях
Написать
Личный блог
Продвигайте свои услуги или личный бренд через интересные кейсы и статьи
Написать

Spark использует cookie-файлы. С их помощью мы улучшаем работу нашего сайта и ваше взаимодействие с ним.