DeepSeek и Пекинский университет выложили в открытый доступ DSpark — модуль, который ускоряет генерацию ответов без изменения самой модели. На превью‑серверах DeepSeek прирост скорости для пользователя достигал 85%, а качество текста сохранялось.
DeepSeek совместно с Пекинским университетом открыла исходный код DSpark — модуля, который ускоряет генерацию текста у больших языковых моделей, не меняя сами веса модели. На рабочих серверах превью‑версий DeepSeek‑V4‑Flash и DeepSeek‑V4‑Pro команда заявляет ускорение выдачи для каждого пользователя до +85%.
Что именно выпустили
DSpark — это не «новая нейросеть» и не очередная версия модели. По смыслу это надстройка над существующей генерацией, которая помогает быстрее получать тот же результат. Разработчики относят подход к классу спекулятивного декодирования: ускорение достигается за счёт того, что часть работы выполняется более лёгким компонентом, а «основная» модель тратит вычисления рациональнее.
Вместе с DSpark DeepSeek также открыла DeepSpec — набор инструментов для обучения таких «черновиковых» моделей и работы с несколькими алгоритмами ускорения (включая DSpark). Важно, что заявлена поддержка не только собственных моделей DeepSeek, но и сторонних — например, Qwen3 от Alibaba и Gemma от Google.
Как можно ускорить ответы, не трогая саму модель
Обычно генерация текста идёт пошагово: модель «придумывает» следующий токен (кусочек слова/слово), затем следующий — и так далее. Это надёжно, но относительно медленно: на каждый шаг нужен отдельный проход.
Спекулятивное декодирование меняет порядок действий:
- лёгкая модель‑черновик быстро предлагает сразу несколько токенов вперёд (как бы набрасывает черновик фразы);
- большая модель проверяет предложенный блок «оптом» — одним проходом.
Если первые токены в блоке совпали с тем, что «одобрила» большая модель, пользователь получает сразу несколько слов за время одного шага. Звучит просто, но у схемы есть слабое место: черновик может наделать нестыковок, и тогда проверка отвергает большую часть блока — ускорение испаряется.
Две идеи DSpark: меньше брака и меньше лишней проверки
Разработчики описывают DSpark как комбинацию двух практичных улучшений.
1) Черновик, который не разваливает фразы
Если черновик «строчит» токены параллельно и независимо, в конце блока растёт вероятность, что слова перестанут нормально сцепляться: начало одной мысли может «прилипнуть» к хвосту другой. DSpark сохраняет быстрый параллельный черновик, но добавляет к нему маленький последовательный модуль, который перед каждым следующим токеном учитывает уже выбранные. За счёт этого черновик реже выдаёт «ломаные» продолжения — больше токенов проходит проверку, и блоки чаще принимаются целиком.
2) Проверять ровно столько, сколько выгодно прямо сейчас
Проверка блоков тоже стоит денег: под нагрузкой каждый лишний токен — это место в очереди на GPU, которое могло бы достаться другому запросу. При этом токены ближе к концу блока чаще отбрасываются, то есть проверка может оказаться напрасной.
DSpark использует оценку вероятности прохождения проверки для отдельных токенов и добавляет планировщик, который адаптирует размер проверяемого блока под текущую загрузку видеокарт. Когда ресурсов достаточно, проверка может расширяться (например, с двух токенов до пяти–шести), а в пиковые моменты блок «сжимается» до наиболее надёжных вариантов. Идея в том, чтобы ускорение не превращалось в перегрузку в час пик.
Почему новость важна не только инженерам
История про «ускорение генерации» быстро упирается в бытовые вещи: сколько вы ждёте ответа и насколько стабильно сервис переживает наплыв пользователей.
- Меньше ожидания. Чат‑бот поддержки, помощник в IDE или корпоративный ассистент сэкономит секунды на каждом ответе — в сумме это ощущается как более «живой» диалог.
- Больше пользователей на тех же серверах. Ускорение на уровне выдачи означает, что инфраструктура может обработать больше запросов без пропорционального роста затрат.
- Проще внедрять. Поскольку DSpark заявлен как модуль ускорения «без изменения модели», компаниям потенциально проще экспериментировать: не нужно заново обучать или заменять модель, достаточно перестроить этап генерации.
Где это может пригодиться на практике
DSpark больше всего интересен там, где есть два условия: много одновременных запросов и чувствительность к задержкам.
- Службы поддержки: в рабочие часы нагрузка скачет, и адаптивное управление «объёмом проверки» помогает не «уронить» скорость в пике.
- Внутренние корпоративные помощники: пользователю важен темп диалога, а ИТ‑отделу — предсказуемые расходы на инфраструктуру.
- Генерация текста в продуктах (описания, резюме звонков, черновики писем): даже небольшое ускорение на запрос превращается в заметную экономию при больших объёмах.
Открытая публикация кода и инструментария для обучения «черновиковых» компонентов делает DSpark не просто исследовательской демонстрацией, а заготовкой для дальнейших интеграций и проверок в реальных системах — в том числе поверх сторонних моделей, поддержку которых DeepSeek отдельно подчёркивает.
