Мы перевели API LLMCOD на модель Qwen 3.8 (27B, квантование Q6_K_M) с MTP-спекулятивным декодингом. За счёт квантования KV-кэша в q8_0 удалось уместить два параллельных слота по 32K контекста в 26 ГБ VRAM на Tesla V100 — с запасом 6 ГБ.
Мы полгода смотрели, как бот уверенно называет неправильные цены и выдумывает условия доставки. Потом добавили RAG. Рассказываю что это такое и почему без него любой ИИ-виджет — это лотерея.
Есть проблема, которую никто не оценивает в денежном эквиваленте, хотя она стоит очень дорого.Клиент заходит на сайт в 22:00. Пишет вопрос в чат. Ждет. Никто не отвечает. Уходит. Утром менеджер видит сообщение и перезванивает, но клиент уже купил товар у конкурента.
Подключение без VPN, оплата картами РФ через ЮKassa, низкая цена от 99 ₽ за 1 млн токенов. Подходит для чат-ботов, суммаризации, классификации и простых AI-функций.
Внимание
Spark использует cookie-файлы. С их помощью мы улучшаем работу нашего сайта и ваше взаимодействие с ним.