DeepSeek снова вышла в центр глобальной AI-гонки — но на этот раз не с новой «супермоделью», а с инфраструктурой, которая может сделать большие языковые модели заметно быстрее. Компания вместе с исследователями из Пекинского университета представила DSpark — фреймворк для ускорения вывода LLM, то есть этапа, когда модель уже отвечает пользователю. В техническом описании разработчики формулируют идею так: «Спекулятивное декодирование ускоряет вывод LLM» — спекулятивное декодирование ускоряет генерацию, разделяя черновое предсказание и проверку целевой моделью. Почему это важно именно сейчас? Большие языковые модели обычно генерируют текст последовательно: один токен за другим. Поэтому длинный ответ чат-бота похож на сборку моста по одному камню: система не может сразу выдать всю фразу, ей приходится шаг за шагом рассчитывать продолжение. На миллионах запросов такая задержка превращается в огромные расходы на GPU, облака и энергию.
DSpark пытается обойти этот узкий участок. Вместо того чтобы заставлять основную модель каждый раз делать полный шаг, легкий «черновой» модуль заранее предлагает несколько следующих токенов. Затем большая модель проверяет их блоком. Если прогноз совпал, пользователь получает ответ быстрее; если нет — система корректирует результат. Важный момент: по заявлению авторов, такой подход ускоряет генерацию без изменения весов основной модели и без ухудшения качества, потому что финальную проверку все равно выполняет целевая LLM.
Читайте также
Биткоин перегружают микротранзакции: почему растёт активность BTC
Главная цифра выглядит громко: в системе производства DeepSeek-V4 DSpark, по данным разработчиков, ускоряет генерацию для пользователя на 60–85% для V4-Flash и на 57–78% для V4-Pro по сравнению с прежней базовой схемой MTP-1. На офлайн-бенчмарках фреймворк также улучшил среднюю длину принятых токенов относительно Eagle3 и DFlash — конкурирующих методов спекулятивного расшифровывания. Но здесь есть важная оговорка: это пока данные самой DeepSeek, а не независимые массовые тесты рынка.
Не менее важна открытость проекта. DeepSeek выложила DeepSpec — полноценную кодовую базу для обучения и оценки draft-моделей: подготовка данных, тренировка, оценка-скриптов и готовые контрольные пункты. Репозиторий распространяется под лицензией MIT, то есть его можно использовать и адаптировать в коммерческих проектах. Для стартапов, исследователей NLP и компаний, которые разворачивают open-source LLM самостоятельно, это может быть не менее ценно, чем очередной рост в бенчмарках. При этом внедрение не будет совсем «в один клик». В README DeepSpec указано, что стандартные конфигурации рассчитаны на один узел с 8 GPU, а подготовка target cache для Qwen/Qwen3-4B может потребовать около 38 ТБ хранилища. Значит, для малого бизнеса DSpark скорее станет ориентиром и инструментом для провайдеров инфраструктуры, чем мгновенной кнопкой ускорения на обычном сервере.
DSpark хорошо вписывается в новую фазу AI-рынка. Если раньше гонка шла вокруг вопроса «чья модель умнее», то теперь все чаще решает другой вопрос: кто сможет обслуживать мощные модели дешевле и быстрее. Это особенно важно для сервиса AI-агентов, поисковых ассистентов, корпоративных чат-ботов и edge-приложений, где задержка ответа напрямую влияет на пользовательский опыт.
Есть и геополитический вопрос. На фоне американских ограничений и контроля над передовыми AI-моделями и чипами Китай делает ставку на эффективность и открытые инструменты. DSpark показывает, что конкуренция в ИИ может идти не только через самые дорогие GPU, но и через инженерную оптимизацию. Если независимые тесты подтвердят заявленные показатели, DeepSeek получит сильный аргумент: открытый AI способен быть не просто дешевле, а быстрее и практичнее для массового внедрения.





