DeepSeek уменьшила потребление памяти для миллионного контекста новой модели в 4 раза и в 8 раз снизила объем постоянного хранилища
10 сентября 2026, 11:07Искусственный интеллектDarth Sahara3
DeepSeek представила архитектуру DeepSeek-V4.1-Flash, разработанную для работы с очень длинными контекстами и ИИ-агентами, которые постоянно обрабатывают большие объемы входных данных во время выполнения сложных задач. Модель содержит 552 миллиарда параметров, поддерживает текстовые и визуальные данные и способна обрабатывать контекст до 1 миллиона токенов. При этом ее кэш занимает около 890 байт на токен — в 4 раза меньше, чем у DeepSeek-V4-Flash, а объем постоянного кэша удалось уменьшить в 8 раз.
Проблема, которую решает DeepSeek, связана с особенностями работы моделей с длинным контекстом. KV-кэш хранит промежуточные данные уже обработанных токенов, чтобы системе не нужно было их пересчитывать, но с большим объемом контекста он начинает занимать значительную часть быстродействующей памяти HBM, а сохранение кэша для повторного использования требует SSD или оперативной памяти и высокой пропускной способности при передаче данных. В результате даже уменьшение вычислительной нагрузки не всегда позволяет пропорционально снизить стоимость работы агентов с длинным контекстом.
В DeepSeek-V4.1-Flash переработали несколько уровней системы. Архитектура Causal Encoder-Decoder позволяет при начальной обработке запроса активировать приблизительно 8 миллиардов параметров на токен вместо 16 миллиардов во время последующей генерации. Механизм Compressed Sparse Attention 2 повторно использует часть KV-кэша между слоями модели, а его данные дополнительно хранятся в формате FP4. Для постоянного кэша применяется механизм SWA Bounded Replay: вместо сохранения всех необходимых промежуточных состояний система восстанавливает их по мере необходимости, повторно вычисляя небольшую часть контекста.
Модель была предварительно обучена на мультимодальном массиве объемом 45 триллионов токенов, после чего прошла дообучение для задач рассуждения, программирования и функционирования в качестве агента. По утверждению DeepSeek, базовая версия V4.1-Flash при 1/3 общего числа параметров и 1/4 активируемых параметров демонстрирует результаты на уровне DeepSeek-V4-Pro-Base и превосходит ее на 5–10% в части отложенных тестов. В агентских тестах модель сопоставима с рядом закрытых передовых решений, хотя авторы признают существующий разрыв в научных задачах, требующих экспертных знаний.
Основное достижение DeepSeek-V4.1-Flash заключается в том, что увеличение длины контекста перестает значительно увеличивать стоимость его поддержки. По расчетам авторов, увеличение контекста в 256 раз — с 4 тысяч до 1 миллиона токенов — приводит к увеличению вычислений на один генерируемый токен лишь на четверть. В сочетании с сокращенным KV-кэшем это должно существенно снизить стоимость развертывания длительных агентских сценариев и позволить использовать их в более широком спектре практических задач.
Источники:DeepSeekИскусственный интеллект3DeepSeekИскусственный интеллектИИ-агенты10 сен 11:07
Источник

