Актуальная информация о состоянии экономики систем искусственного интеллекта. Обзор нейронных новостей за неделю

Аналитический центр red_mad_robot освещает и анализирует ключевые события в индустрии за период с 27 апреля по 3 мая.
Как AI-агенты расходуютSakana AI управляетТакже на неделеКак AI-агенты расходуютSakana AI управляетТакже на неделеЕще

Как AI-агенты расходуют средства?

Как AI-агенты тратят деньги?Источник: arxiv

Microsoft, Google DeepMind, MIT и другие компании провели исследование о том, как AI-агенты расходуют токены при выполнении задач по программированию. Были проанализированы восемь моделей на бенчмарке SWE-bench Verified. Результаты показали ряд закономерностей:

  • Задачи по программированию требуют в тысячу раз больше токенов, чем обычный чат — основная часть затрат относится к входным токенам, а не к генерации ответов.
  • Потребление токенов чрезвычайно неустойчиво: даже при одинаковых задачах различные запуски могут отличаться по расходу в 30 раз.
  • Большее количество токенов — не всегда лучше: точность достигает плато при средних расходах и может даже снижаться при дальнейшем увеличении затрат.

Среди моделей наблюдается значительная разница. Kimi-K2 и Claude-Sonnet-4.5 в среднем расходуют более 1,5 млн токенов больше, чем GPT-5 на тех же задачах, и это даже в простых сценариях. Отдельной проблемой является то, что модели плохо предсказывают собственное потребление токенов до выполнения задачи — их оценки слабо коррелируют с реальностью и часто занижают расход входных токенов.

Почему это важно: компании могут не знать окончательную стоимость задачи заранее и платить даже за неудачные запуски. Понимание того, как расходуются токены, помогает выбирать более эффективные модели, оценивать затраты заранее и устанавливать бюджетные ограничения.

Sakana AI управляет агентами

Sakana FuguИсточник: sakana.ai

Sakana AI представила Fugu: коммерческую платформу для управления AI-агентами. Модель fugu-ultra демонстрирует 54,2% на SWE-Pro, 95,1% на GPQA Diamond и 93,2% на LiveCodeBench v6. Основу составляют две разработки: TRINITIY и Conductor.

TRINITY описывает координацию нескольких специализированных LLM, которые совместно решают одну задачу. Запрос проходит через несколько этапов, и на каждом координатор назначает одной из моделей роль:

  • Thinker отвечает за стратегию и общий анализ
  • Worker выполняет конкретные шаги решения
  • Verifier проверяет правильность и полноту результата.

Conductor — модель на 7 млрд параметров, обученная с использованием метода обучения с подкреплением для управления пулом крупных LLM. Она выбирает модель для конкретной задачи, а также разрабатывает схемы взаимодействия, разбивает задачи на подзадачи и формирует запросы для каждого этапа. Дополнительно реализован механизм рекурсивного самовызова: модель может использовать саму себя в качестве одного из рабочих агентов и итеративно улучшать стратегию координации в процессе решения.

Почему это важно: системы, которые управляют другими языковыми моделями и самостоятельно распределяют роли и подзадачи, перестают быть теоретической концепцией. Это открывает возможность для более эффективного выполнения сложных процессов и снижения их стоимости.

Также на неделе:

  • Sakana AI представила технику String Seed of Thought — она помогает LLM точнее следовать вероятностным инструкциям
  • Alibaba выпустила фреймворк, позволяющий модели улучшать ответы во время инференса на неразмеченных данных
  • Cohere и Poolside показали, что AI-агенты часто находят важную информацию в контексте, но не всегда умеют правильно учитывать ее при рассуждении и принятии решений
  • OpenAI опубликовала в открытый доступ набор тестов для мониторинга и оценки цепочек рассуждений
  • University of Maryland, MBZUAI и другие институты представили фреймворк для задач с длинным горизонтом планирования — агенты постоянно улучшают свою эффективность
  • Xiaomi выпустила семейство открытых моделей MiMo-V2.5
  • Mistral представила модель Medium 3.5 и AI-агентов Remote Agents.

Новости представлены аналитическим центром red_mad_robot.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru