НейрОбзор: OpenAI показала ChatGPT Images 2.0: генерация картинок становится на порядок умнее.







Приветствую вас, нейро-исследователи! Похоже, генерация изображений выходит из этапа «смотрите, как нейросеть умеет рисовать» и входит в стадию «наконец-то это можно нормально использовать в реальной работе».
Буквально на днях OpenAI представила ChatGPT Images 2.0 – новую модель генерации изображений, которую компания описывает как модель с улучшенным рендерингом текста, поддержкой многих языков и более развитым визуальным мышлением.
Если перевести с языка релизов на человеческий, смысл примерно такой: модель должна лучше понимать, что именно вы хотите получить, точнее следовать инструкциям и увереннее собирать сложные сцены, где важны детали, композиция и текст внутри изображения.
Это серьёзная попытка сделать инструмент, который полезен дизайнеру, автору, маркетологу, преподавателю и вообще любому человеку, которому нужны не просто красивые картинки ради красивых картинок, а внятный визуальный результат, направленный на решение конкретной рабочей или творческой задачи.
Главный апгрейд – работа с текстом внутри изображения. Это одна из самых больных тем для нейросетей: буквы (как латиница, так и кириллица, а про иероглифы я вообще молчу) раньше часто превращались в заклинания на мёртвом языке типографики. В ChatGPT Images 2.0 OpenAI отдельно подчёркивает улучшенный text rendering, а в примерах показывает постеры, инфографику, журнальные развороты, брендинговые макеты, печатные материалы и даже комиксы с читаемыми надписями.
Второй важный сдвиг – многоязычность. OpenAI прямо говорит об улучшениях для разных языков и систем письма, а среди примеров показывает работы с японским, арабским, корейским, китайским и другими письменностями. Для русскоязычной аудитории это особенно интересно: нейросетевые картинки часто выглядели уверенно, пока дело не доходило до вставки осмысленного текста. Теперь есть явный сигнал, что модель движется в сторону нормальной глобальной типографики, а не только англоязычного мира.
Третий момент – визуальное мышление. В официальных материалах OpenAI говорит не только о красоте, но и о более сильном следовании инструкциям, лучшем знании мира и способности создавать более сложные, насыщенные деталями изображения, включая плотный текст и структурированные визуалы. Это видно по примерам: от обучающих инфографик и комиксов до последовательных сцен, персонажных листов и рекламных макетов. Иными словами, модель пытается быть не просто кистью, а чем-то вроде визуального соавтора. Немного дерзко, но направление именно такое.
Практически это означает вот что: с помощью нейросети становится проще делать разнообразный прикладной визуальный контент. Посты для соцсетей, обложки, инфографику, учебные схемы, визуалы для презентаций, стилизованные страницы комиксов, рекламные материалы, карточки товаров, редакционные развороты – всё это OpenAI прямо демонстрирует в примерах. Причём отдельно подчёркивается возможность работать в разных форматах изображения, от мобильных пропорций до широких баннеров.
Ещё один важный плюс: это не только генерация с нуля, но и редактирование. В ChatGPT теперь можно не просто попросить создать картинку, но и загрузить своё изображение, а затем изменить его целиком или частично. Есть выделение нужной области, можно добавлять и удалять элементы, менять детали сцены, а также задавать прозрачный фон и нужное соотношение сторон. То есть сценарий «создал – поправил – дожал до результата» становится гораздо более естественным и предсказуемым. Для повседневной работы это часто важнее, чем ещё плюс 7% к художественной выразительности.
По доступности новость тоже приятная: ChatGPT Images 2.0 уже заявлена для всех тарифов ChatGPT, а работать с изображениями можно на вебе, iOS и Android. При этом OpenAI отдельно запускает режим images with thinking: если дать модели больше времени на размышление, она может лучше спланировать и уточнить будущий результат перед генерацией. Этот режим доступен на платных планах – Plus, Pro и Business.
Важно и то, что OpenAI не делает вид, будто вместе с красотой исчезают риски. Компания прямо пишет, что рост реализма повышает опасность более убедительных дипфейков и другой чувствительной подделки реальности, поэтому для модели добавлены многоуровневые проверки: фильтрация на уровне запроса, контроль входных изображений при редактировании и проверка уже готового результата перед показом пользователю. Кроме того, OpenAI заявляет использование C2PA-метаданных и иных способов определения происхождения изображений.
Для нейроэнтузиастов вывод простой: следующий этап конкуренции в AI-картинках – это уже не только эстетика, а управляемость, точность и применимость. Побеждать будет не та модель, что рисует эффектнее (сейчас многие крупные игроки в сфере достигли сравнимого по качеству уровня генерации), а та, что по запросу соберёт обложку, инфографику, комикс, рекламный макет или учебную схему – и сделает это без пяти кругов промптового ада! ChatGPT Images 2.0 явно метит именно туда.
Наконец, отложил дела, протестировал новую модель лично, и... Был очень приятно удивлён её возможностями! Я серьёзно. Решил принципиально не возиться, а сделать иллюстрации к данной статье, так сказать, «на скорую руку». Результат вы можете увидеть лично в «карусели» выше.
Более того: ВСЕ изображения были сделаны моделью ОДНОВРЕМЕННО. Сразу. По одному большому промпту!
Так что в сухом остатке? ChatGPT Images 2.0 выглядит как шаг от «генератора картинок с вау-эффектом» к более взрослому инструменту визуального производства. Не магия, не кнопка «сделай шедевр», не «удаляем Photoshop и CorelDRAW с ноутбука», и не цифровой Микеланджело на минималках. Но это уже заметно более практичная система, которая лучше понимает задачу, увереннее работает с текстом, поддерживает разные языки, умеет редактировать изображения и в целом ближе к реальным рабочим сценариям, чем многие прошлые релизы в этой области.
– С уважением, Ваш нейро-эксперт
Алексей Закомолдин.
