Наиболее востребованный искусственный интеллект для написания программ приводит к быстрому износу SSD на компьютерах

За три недели обычной эксплуатации ноутбук записал на диск почти 40 терабайт информации, и все это служебные файлы одной известной программы.Codex Разработчики выяснили, что Codex записывает на диск сотни терабайт ненужной информации ежегодноИсточник: OpenAI

Один из инженеров заметил аномальную нагрузку на своем ноутбуке: SSD быстро терял ресурс, хотя устройство использовалось для стандартных задач разработки. После проверки выяснилось, что основным источником записи стали ИИ-ассистент для кода Codex от OpenAI — точнее, его внутренний механизм логирования.

Программа постоянно сохраняет служебные данные в локальную базу SQLite на диске пользователя. Это кажется безобидным, но на практике превращается в настоящий поток записи. За 21 день непрерывной работы накопитель накопил около 37 терабайт данных только от этого процесса. Если взять годовую нагрузку, получается примерно 640 терабайт, а у многих бытовых SSD заявленный ресурс составляет около 600 ТБ суммарной записи за весь срок службы. Таким образом, инструмент мог «съесть» гарантийный лимит накопителя менее чем за год.

Интересным в этой ситуации является разрыв между тем, что реально хранится в базе, и тем, сколько туда было записано. На момент проверки файл базы занимал чуть больше гигабайта и содержал около 500 тысяч строк. При этом внутренний счетчик идентификаторов уже превышал 5,5 миллиарда. Разница почти в десять тысяч раз, и программа без остановки создавала новые записи, а затем тут же их удаляла, освобождая место для следующих. Диск физически фиксировал каждую такую операцию, и именно в этом постоянном цикле «записал-стер» скрывался основной износ.

Codex в мобильном приложении ChatGPTCodex в мобильном приложении ChatGPTИсточник: OpenAI

Причина заключалась в настройках логирования. Разработчики по умолчанию установили максимально подробный уровень детализации для всех событий программы, включая внутренние библиотеки и технические подсистемы. Основная часть объема занимали не полезные данные, а сырые копии сетевого трафика — содержимое веб-сокетов и потоковых соединений, через которые Codex взаимодействует с серверами. Отдельный вклад в нагрузку вносило дублирование одних и тех же событий сразу в несколько журналов телеметрии.

После выявления проблемы команда OpenAI быстро отреагировала. Уже через несколько дней вышли два обновления: одно устраняло избыточную фиксацию каждого события сетевого соединения, а другое отфильтровывало шумные технические источники, не несущие практической пользы для отладки. По оценке автора находки, эти изменения уменьшили объем лишних записей примерно на 85%.

Эта ситуация стала показательной для всей индустрии ИИ-инструментов: чем активнее программа собирает данные для своей диагностики, тем выше риск, что эта функция начнет работать против пользователя — в буквальном смысле сокращая срок службы его оборудования.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru