Аналитический центр red_mad_robot освещает и комментирует ключевые события в индустрии за период с 23 по 29 марта.
Автономное самообучение AI-систем

Забрать с диска: ver. 1
Meta* (запрещена в РФ) и ученые из нескольких институтов представили HyperAgents: идеи, в которой ИИ-агенты решают задачи и одновременно улучшают свои механизмы обучения. Ранее такие механизмы разрабатывались людьми вручную и оставались неизменными, HyperAgents объединяют в одной изменяемой системе два элемента:
- агента-исполнителя, который выполняет задачу;
- мета-агента, который анализирует промежуточные результаты и корректирует стратегию.
Исследователи применили этот метод к концепции Darwin Gödel Machine (DGM) и создали ее модификацию — DGM-Hyperagents (DGM-H). Поскольку мета-агент также подвержен изменениям, алгоритм улучшает навыки решения задач и процесс поиска оптимизаций. В результате система может развиваться автономно без ограничений, установленных человеком.
Эксперименты продемонстрировали увеличение эффективности в программировании, рецензировании статей, робототехнике и проверке олимпиадных работ по математике. При этом система создавала собственные механизмы оптимизации — вела журналы производительности или формировала сложные правила для принятия решений. Эти улучшения сохраняются: мета-уровневые изменения переносятся между областями и накапливаются с каждой итерацией.
Почему это важно: соблюдая строгие меры безопасности, например, запуск кода в изолированных окружениях, такие системы открывают реальный путь к ИИ, способному самостоятельно ускорять свой прогресс.
Снижение требований к оборудованию

Google Research разработала TurboQuant: алгоритм сжатия KV-кэша, который сочетает сразу два существующих подхода.
- PolarQuant преобразует векторы в полярное представление, описывая данные через силу и направление сигнала.
- QJL затем исправляет оставшиеся ошибки с помощью одного бита, создавая компактное представление.
В результате объем памяти, необходимый для работы LLM, сокращается в шесть раз без потери точности. На видеокартах Nvidia H100 TurboQuant ускоряет вычисления до восьми раз по сравнению со традиционными методами. При этом дообучение модели не требуется. Алгоритм также превосходит конкурентов в задачах векторного поиска — технологии, лежащей в основе быстрого подбора релевантных результатов в поисковых системах.
Почему это важно: методы вроде TurboQuant значительно снижают требования к оборудованию. Модели можно сжимать без потери качества, что означает, что для их работы требуется меньше памяти и вычислительной мощности. Такой подход уменьшает спрос на дорогое специализированное оборудование, на котором зарабатывают компании из сегмента ИИ-памяти. Это и стало причиной падения их акций на 3−5%.
Также на неделе:
- Alibaba представила подход, в котором агент и механизм извлечения опыта обучаются совместно, что позволяет более эффективно использовать накопленные данные.
- Ян Лекун и ученые из нескольких университетов разработали модель, обучающуюся на сырых пикселях без промежуточных этапов обработки.
- Исследователи UNC-Chapel Hill, Carnegie Mellon University, UC Santa Cruz и UC Berkeley создали фреймворк непрерывного мета-обучения, который объединяет быструю адаптацию без градиентов и плановую оптимизацию.
- Microsoft Research представила фреймворк, позволяющий моделям совершенствоваться через реальные текстовые взаимодействия без явных наград и разметки человеком.
- Google DeepMind рассказала об алгоритме обучения с исследованием, который значительно повышает эффективность использования данных при выравнивании LLM через RL на основе человеческой обратной связи.
- ARC Prize выпустила бенчмарк для оценки способностей к рассуждению.
- Anthropic добавила в Claude Cowork и Claude Code возможность управления компьютером.
Новости представлены аналитическим центром red_mad_robot
Фото: hi-tech.mail.ru
