Аналитический центр red_mad_robot освещает и анализирует ключевые события в индустрии за период с 27 апреля по 3 мая.
Как AI-агенты расходуютSakana AI управляетТакже на неделеКак AI-агенты расходуютSakana AI управляетТакже на неделеЕще
Как AI-агенты расходуют средства?

Microsoft, Google DeepMind, MIT и другие компании провели исследование о том, как AI-агенты расходуют токены при выполнении задач по программированию. Были проанализированы восемь моделей на бенчмарке SWE-bench Verified. Результаты показали ряд закономерностей:
- Задачи по программированию требуют в тысячу раз больше токенов, чем обычный чат — основная часть затрат относится к входным токенам, а не к генерации ответов.
- Потребление токенов чрезвычайно неустойчиво: даже при одинаковых задачах различные запуски могут отличаться по расходу в 30 раз.
- Большее количество токенов — не всегда лучше: точность достигает плато при средних расходах и может даже снижаться при дальнейшем увеличении затрат.
Среди моделей наблюдается значительная разница. Kimi-K2 и Claude-Sonnet-4.5 в среднем расходуют более 1,5 млн токенов больше, чем GPT-5 на тех же задачах, и это даже в простых сценариях. Отдельной проблемой является то, что модели плохо предсказывают собственное потребление токенов до выполнения задачи — их оценки слабо коррелируют с реальностью и часто занижают расход входных токенов.
Почему это важно: компании могут не знать окончательную стоимость задачи заранее и платить даже за неудачные запуски. Понимание того, как расходуются токены, помогает выбирать более эффективные модели, оценивать затраты заранее и устанавливать бюджетные ограничения.
Sakana AI управляет агентами

Sakana AI представила Fugu: коммерческую платформу для управления AI-агентами. Модель fugu-ultra демонстрирует 54,2% на SWE-Pro, 95,1% на GPQA Diamond и 93,2% на LiveCodeBench v6. Основу составляют две разработки: TRINITIY и Conductor.
TRINITY описывает координацию нескольких специализированных LLM, которые совместно решают одну задачу. Запрос проходит через несколько этапов, и на каждом координатор назначает одной из моделей роль:
- Thinker отвечает за стратегию и общий анализ
- Worker выполняет конкретные шаги решения
- Verifier проверяет правильность и полноту результата.
Conductor — модель на 7 млрд параметров, обученная с использованием метода обучения с подкреплением для управления пулом крупных LLM. Она выбирает модель для конкретной задачи, а также разрабатывает схемы взаимодействия, разбивает задачи на подзадачи и формирует запросы для каждого этапа. Дополнительно реализован механизм рекурсивного самовызова: модель может использовать саму себя в качестве одного из рабочих агентов и итеративно улучшать стратегию координации в процессе решения.
Почему это важно: системы, которые управляют другими языковыми моделями и самостоятельно распределяют роли и подзадачи, перестают быть теоретической концепцией. Это открывает возможность для более эффективного выполнения сложных процессов и снижения их стоимости.
Также на неделе:
- Sakana AI представила технику String Seed of Thought — она помогает LLM точнее следовать вероятностным инструкциям
- Alibaba выпустила фреймворк, позволяющий модели улучшать ответы во время инференса на неразмеченных данных
- Cohere и Poolside показали, что AI-агенты часто находят важную информацию в контексте, но не всегда умеют правильно учитывать ее при рассуждении и принятии решений
- OpenAI опубликовала в открытый доступ набор тестов для мониторинга и оценки цепочек рассуждений
- University of Maryland, MBZUAI и другие институты представили фреймворк для задач с длинным горизонтом планирования — агенты постоянно улучшают свою эффективность
- Xiaomi выпустила семейство открытых моделей MiMo-V2.5
- Mistral представила модель Medium 3.5 и AI-агентов Remote Agents.
Новости представлены аналитическим центром red_mad_robot.
Фото: hi-tech.mail.ru
