Google анонсировала инновационную технологию TurboQuant, предназначенную для оптимизации моделей

Исследователи компании Google разработали метод, позволяющий хранить данные в языковой модели в шесть раз более компактно.TurboQuantTurboQuantИсточник: Google

В каждой языковой модели имеется нечто вроде блокнота для заметок, называемого KV-кэшем. В него записываются промежуточные результаты вычислений, чтобы избежать повторного пересчета одних и тех же данных. Чем больше контекст разговора, тем больше объем этого блокнота, что увеличивает затраты на память на серверах. Здесь и кроется узкое место, замедляющее и удорожающее работу ИИ в промышленных условиях.

Google Research предложила три взаимосвязанных алгоритма, которые решают эту проблему с различных сторон. Основным из них является TurboQuant, который будет презентован на конференции ICLR 2026.

TurboQuantTurboQuant демонстрирует высокую эффективность сжатия KV-кэша в бенчмарке LongBench при использовании различных методов сжатия на модели Llama-3.1-8B-InstructИсточник: Google

Суть подхода заключается в том, что данные в кэше представлены в виде числовых векторов, представляющих собой длинные списки чисел с дробной точностью. Обычные методы квантования заменяют точные значения грубыми приближениями, что приводит к потере точности. Кроме того, большинство существующих решений вынуждены сохранять дополнительные «поправочные коэффициенты», что поглощает лишний бит-полтора на каждое число и частично нивелирует выигрыш от сжатия.

TurboQuant избегает этой проблемы благодаря двум шагам. Сначала он случайным образом «поворачивает» вектор в математическом пространстве, что делает распределение чисел более равномерным и предсказуемым. Затем применяется алгоритм PolarQuant: вместо привычных декартовых координат он преобразует каждую пару чисел в полярные — радиус и угол. Например, если бы люди вместо «три шага на восток и четыре на север» говорили «пять шагов под углом 37 градусов». Угловая сетка фиксирована, границы известны заранее, и никакой дополнительной нормировки не требуется. Накладные расходы на хранение метаданных исчезают.

Далее подключается алгоритм QJL. Он берет небольшую остаточную ошибку после первого шага и «сжимает» ее до одного знакового бита: плюс или минус. Математически это достигается с помощью преобразования Джонсона-Линденштрауса — метода, который сохраняет расстояния между точками даже при значительном уменьшении размерности. Один бит на коррекцию, и систематическое смещение в вычислениях устраняется без лишних затрат памяти.

TurboQuantTurboQuant демонстрирует значительное улучшение производительности при расчете логитов внимания в кэше типа «ключ-значение» на различных уровнях разрядности, что было измерено относительно высокооптимизированного базового алгоритма JAX.Источник: Google

В результате TurboQuant сжимает KV-кэш до 3 бит на число по сравнению со стандартными 16-32 битами. Память, необходимая для кэша, сокращается минимум в 6 раз. На GPU-ускорителях H100 скорость вычисления весовых коэффициентов внимания возросла до 8 раз по сравнению с базовой 32-битной точностью. При этом алгоритм не требует дообучения модели и может быть применен к уже существующей нейросети.

Тесты на открытых моделях Gemma и Mistral подтвердили, что на бенчмарках LongBench, Needle In A Haystack и ZeroSCROLLS результаты остаются на уровне несжатых моделей. Задача «найти иголку в стоге сена», когда модели требуется найти единственный факт в огромном тексте, решается без потерь.

Кроме языковых моделей, технология оказывает прямое влияние на векторный поиск — основополагающий элемент современных поисковых систем и рекомендательных алгоритмов. На наборе данных GloVe TurboQuant показал лучшие результаты по точности поиска по сравнению с методами PQ и RaBitQ при меньшем объеме индекса.

Также недавно стало известно, что стартап Luma представил умный генератор изображений Uni-1. Подробности в статье.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru