Меньше ресурсов, больше независимости ИИ. Нейронные новости недели

Аналитический центр red_mad_robot освещает и комментирует ключевые события в индустрии за период с 23 по 29 марта.

Автономное самообучение AI-систем

HyperAgents HyperAgents Источник: arxiv

Забрать с диска: ver. 1

Meta* (запрещена в РФ) и ученые из нескольких институтов представили HyperAgents: идеи, в которой ИИ-агенты решают задачи и одновременно улучшают свои механизмы обучения. Ранее такие механизмы разрабатывались людьми вручную и оставались неизменными, HyperAgents объединяют в одной изменяемой системе два элемента:

  • агента-исполнителя, который выполняет задачу;
  • мета-агента, который анализирует промежуточные результаты и корректирует стратегию.

Исследователи применили этот метод к концепции Darwin Gödel Machine (DGM) и создали ее модификацию — DGM-Hyperagents (DGM-H). Поскольку мета-агент также подвержен изменениям, алгоритм улучшает навыки решения задач и процесс поиска оптимизаций. В результате система может развиваться автономно без ограничений, установленных человеком.

Эксперименты продемонстрировали увеличение эффективности в программировании, рецензировании статей, робототехнике и проверке олимпиадных работ по математике. При этом система создавала собственные механизмы оптимизации — вела журналы производительности или формировала сложные правила для принятия решений. Эти улучшения сохраняются: мета-уровневые изменения переносятся между областями и накапливаются с каждой итерацией.

Почему это важно: соблюдая строгие меры безопасности, например, запуск кода в изолированных окружениях, такие системы открывают реальный путь к ИИ, способному самостоятельно ускорять свой прогресс.

Снижение требований к оборудованию

GoogleGoogleИсточник: Unsplash

Google Research разработала TurboQuant: алгоритм сжатия KV-кэша, который сочетает сразу два существующих подхода.

  1. PolarQuant преобразует векторы в полярное представление, описывая данные через силу и направление сигнала.
  2. QJL затем исправляет оставшиеся ошибки с помощью одного бита, создавая компактное представление.

В результате объем памяти, необходимый для работы LLM, сокращается в шесть раз без потери точности. На видеокартах Nvidia H100 TurboQuant ускоряет вычисления до восьми раз по сравнению со традиционными методами. При этом дообучение модели не требуется. Алгоритм также превосходит конкурентов в задачах векторного поиска — технологии, лежащей в основе быстрого подбора релевантных результатов в поисковых системах.

Почему это важно: методы вроде TurboQuant значительно снижают требования к оборудованию. Модели можно сжимать без потери качества, что означает, что для их работы требуется меньше памяти и вычислительной мощности. Такой подход уменьшает спрос на дорогое специализированное оборудование, на котором зарабатывают компании из сегмента ИИ-памяти. Это и стало причиной падения их акций на 3−5%.

Также на неделе:

  • Alibaba представила подход, в котором агент и механизм извлечения опыта обучаются совместно, что позволяет более эффективно использовать накопленные данные.
  • Ян Лекун и ученые из нескольких университетов разработали модель, обучающуюся на сырых пикселях без промежуточных этапов обработки.
  • Исследователи UNC-Chapel Hill, Carnegie Mellon University, UC Santa Cruz и UC Berkeley создали фреймворк непрерывного мета-обучения, который объединяет быструю адаптацию без градиентов и плановую оптимизацию.
  • Microsoft Research представила фреймворк, позволяющий моделям совершенствоваться через реальные текстовые взаимодействия без явных наград и разметки человеком.
  • Google DeepMind рассказала об алгоритме обучения с исследованием, который значительно повышает эффективность использования данных при выравнивании LLM через RL на основе человеческой обратной связи.
  • ARC Prize выпустила бенчмарк для оценки способностей к рассуждению.
  • Anthropic добавила в Claude Cowork и Claude Code возможность управления компьютером.

Новости представлены аналитическим центром red_mad_robot

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru