DeepSeek-V4.1-Flash: 552 млрд параметров и контекст на 1 млн токенов открывают новые горизонты

DeepSeek уменьшила потребление памяти для миллионного контекста новой модели в 4 раза и в 8 раз снизила объем постоянного хранилища

10 сентября 2026, 11:07Искусственный интеллектDarth Sahara3

DeepSeek представила архитектуру DeepSeek-V4.1-Flash, разработанную для работы с очень длинными контекстами и ИИ-агентами, которые постоянно обрабатывают большие объемы входных данных во время выполнения сложных задач. Модель содержит 552 миллиарда параметров, поддерживает текстовые и визуальные данные и способна обрабатывать контекст до 1 миллиона токенов. При этом ее кэш занимает около 890 байт на токен — в 4 раза меньше, чем у DeepSeek-V4-Flash, а объем постоянного кэша удалось уменьшить в 8 раз.

Проблема, которую решает DeepSeek, связана с особенностями работы моделей с длинным контекстом. KV-кэш хранит промежуточные данные уже обработанных токенов, чтобы системе не нужно было их пересчитывать, но с большим объемом контекста он начинает занимать значительную часть быстродействующей памяти HBM, а сохранение кэша для повторного использования требует SSD или оперативной памяти и высокой пропускной способности при передаче данных. В результате даже уменьшение вычислительной нагрузки не всегда позволяет пропорционально снизить стоимость работы агентов с длинным контекстом.

Источник: DeepSeek

В DeepSeek-V4.1-Flash переработали несколько уровней системы. Архитектура Causal Encoder-Decoder позволяет при начальной обработке запроса активировать приблизительно 8 миллиардов параметров на токен вместо 16 миллиардов во время последующей генерации. Механизм Compressed Sparse Attention 2 повторно использует часть KV-кэша между слоями модели, а его данные дополнительно хранятся в формате FP4. Для постоянного кэша применяется механизм SWA Bounded Replay: вместо сохранения всех необходимых промежуточных состояний система восстанавливает их по мере необходимости, повторно вычисляя небольшую часть контекста.

Источник: DeepSeek

Модель была предварительно обучена на мультимодальном массиве объемом 45 триллионов токенов, после чего прошла дообучение для задач рассуждения, программирования и функционирования в качестве агента. По утверждению DeepSeek, базовая версия V4.1-Flash при 1/3 общего числа параметров и 1/4 активируемых параметров демонстрирует результаты на уровне DeepSeek-V4-Pro-Base и превосходит ее на 5–10% в части отложенных тестов. В агентских тестах модель сопоставима с рядом закрытых передовых решений, хотя авторы признают существующий разрыв в научных задачах, требующих экспертных знаний.

Основное достижение DeepSeek-V4.1-Flash заключается в том, что увеличение длины контекста перестает значительно увеличивать стоимость его поддержки. По расчетам авторов, увеличение контекста в 256 раз — с 4 тысяч до 1 миллиона токенов — приводит к увеличению вычислений на один генерируемый токен лишь на четверть. В сочетании с сокращенным KV-кэшем это должно существенно снизить стоимость развертывания длительных агентских сценариев и позволить использовать их в более широком спектре практических задач.

Источники:DeepSeekИскусственный интеллект3DeepSeekИскусственный интеллектИИ-агенты10 сен 11:07

Источник
Оцените статью
Dfiles.ru