Компания стремилась обосновать увольнения с точки зрения ИИ, но в результате собрала наиболее веские аргументы против этого.
Microsoft начала крупный эксперимент с четкой целью: продемонстрировать, что языковые модели уже успешно справляются с офисными задачами, и, следовательно, сокращение штата в пользу ИИ выглядит оправданным решением. Три исследователя компании разработали специальный инструмент DELEGATE-25 и протестировали 19 моделей, включая GPT, Claude и Gemini. Задачи были выбраны из реальной практики 52 профессий — юристов, финансистов, разработчиков и аналитиков. Каждая модель работала с документами в режиме длительного цикла: от пяти до десяти сложных правок подряд.
Результаты оказались полностью противоположными ожидаемым. Лучшие модели в среднем уничтожали 25% информации в документах. Среди всех протестированных систем уровень потерь достигал 50%. Это означает, что каждая вторая буква в документе могла просто исчезнуть или заменяться на несуществующую.
Порог «готовности» исследователи установили на уровне 98% точности после 20 итераций — это минимальный уровень, при котором технологии могут быть доверены для самостоятельной работы. Этот порог преодолела всего одна область из 52: программирование на Python. Лучший результат среди всех систем показал Gemini — он достиг планки в 11 доменах из 52. Остальные модели провалились в подавляющем большинстве сценариев.

Кроме того, команда протестировала ИИ-агентов — автономные системы, которые сейчас активно продвигаются как «новый уровень» автоматизации. Агенты не улучшили общую картину, и ожидания от них не оправдались.
Наиболее неприятная деталь — характер ошибок. Модели не деградируют постепенно и предсказуемо. Они могут работать стабильно на протяжении длительного времени, а затем в один момент уничтожить значительный фрагмент данных без каких-либо предупреждений. Исследователи назвали это «катастрофическими сбоями»: чем дольше сессия и чем объемнее документ, тем выше риск внезапного ухудшения качества. Причем более мощные модели не избегают таких сбоев, а просто откладывают их на более поздние итерации.
Стоит обратить внимание на контекст публикации. Результаты исследования стали доступны в открытом доступе в виде препринта на arXiv — без официального анонса от Microsoft. При этом собственный продукт компании Copilot в тест не был включен.
Если вы поручаете модели длительную задачу с документами — контролируйте каждый шаг. Доверять ИИ финальный результат без проверки сейчас аналогично тому, чтобы отправить стажера без опыта разбирать архив налоговой отчетности и не следить за его действиями.
Фото: hi-tech.mail.ru

