Китайская технологическая компания обновила свой генератор изображений, и теперь он способен функционировать как профессиональный дизайнер. Новая версия получила ряд значительных улучшений, которые выводят её за пределы обычных ИИ-инструментов для рисования.
Основное новшество — модель способна обрабатывать промпты длиной до тысячи токенов. Это позволяет подробно описывать сложные композиции: расположение элементов, цветовую палитру, типографику и даже содержание текстовых блоков. Ранее приходилось разбивать задачу на несколько запросов или заниматься редактированием результата. Теперь ИИ создает готовые презентации, инфографику или комиксы за один подход.

Типографика стала более профессиональной, и если предыдущие версии часто искажали текст, делая его трудночитаемым или неправильно отображая иероглифы, то обновленная система точно воспроизводит надписи — от заголовков до мелкого шрифта в таблицах. Модель корректно работает с китайскими, английскими и другими языками, соблюдает выравнивание и даже имитирует различные каллиграфические стили. В примерах от разработчиков ИИ создал классическое китайское стихотворение в стиле императорской каллиграфии и составил календарь с точной раскладкой дат.
Разрешение возросло до 2K (2048×2048 пикселей) без потери детализации. Ранее для получения четкого изображения приходилось прибегать к использованию апскейлеров. Теперь нейросеть сразу выдает изображения с детально проработанными текстурами: видны поры кожи, переплетение нитей ткани, рельеф архитектурных элементов. Это особенно заметно в фотореалистичных сценах — портретах, пейзажах, предметной съемке.

Пока западные платформы, такие как Midjourney, требуют подписку, Qwen-Image-2.0 доступна без ограничений на официальном сайте. Разработчики объединили два направления развития в одну модель. Ранее Alibaba развивала отдельно генератор (для создания изображений с нуля) и редактор (для изменения уже готовых картинок). Теперь обе функции функционируют в едином интерфейсе. Можно загрузить фотографию и попросить ИИ добавить в неё текст, вставить объекты или изменить композицию — система сохранит стилистическое единство. Несмотря на расширенные возможности, модель стала более компактной и весит всего 7 миллиардов параметров против десятков миллиардов у конкурентов. Это ускорило обработку запросов и снизило требования к аппаратному обеспечению. Пользователи отмечают, что генерация занимает считанные секунды, даже при сложных промптах.
Фото: hi-tech.mail.ru

