DALL·E: как text-to-image из демо превратился в рабочий инструмент
OpenAI показала DALL·E в январе 2021 года как исследовательскую демку. За четыре года text-to-image стал массовым продуктом с ценой за картинку и лицензионными спорами.
В январе 2021 года OpenAI опубликовала первую версию DALL·E — модель, которая рисовала картинку по текстовому описанию. Тогда это была закрытая демонстрация с курируемыми примерами вроде «кресла в форме авокадо». К 2023 году DALL·E 3 уже встроен в ChatGPT и Bing, а рядом выросли Midjourney, Stable Diffusion, Google Imagen и FLUX. Text-to-image перестал быть исследовательским трюком и превратился в рынок, где спорят о ценах, лицензиях и авторских правах на обучающие данные.
Что такое DALL·E и как он устроен
DALL·E — семейство генеративных моделей OpenAI, которые превращают текстовый запрос (промпт) в растровое изображение. Первая версия, представленная в январе 2021 года, использовала архитектуру на базе GPT-3 и дискретный VAE1: текст и картинка кодировались в общий поток токенов, модель предсказывала визуальные токены по текстовым.
DALL·E 2 (апрель 2022) сменил подход на диффузионный: модель CLIP переводила текст в эмбеддинг, а диффузионный декодер превращал этот эмбеддинг в картинку, постепенно очищая её из шума. DALL·E 3 (октябрь 2023) добавил переписывание промпта языковой моделью: ChatGPT сам расширяет короткий запрос в детальное описание, поэтому короткое «кот в шляпе» на выходе даёт согласованную по деталям сцену.
Почему диффузия победила
Автогрессивная генерация пикселей по токенам, как в первой DALL·E, работала медленно и плохо держала мелкие детали. Диффузионные модели учатся обратному процессу: из белого шума шаг за шагом «проявляют» картинку, ориентируясь на текстовое условие. Такой подход дал резкий скачок в качестве и стал стандартом для Midjourney, Stable Diffusion, Imagen и FLUX.
Сравнение поколений и конкурентов
Точные метрики моделей закрыты, но по публичным описаниям и доступу можно сравнить, что реально получил пользователь.
| Модель | Год | Как попробовать | Особенность |
|---|---|---|---|
| DALL·E 1 | 2021 | Только исследовательская демо | Токены картинки как продолжение текста |
| DALL·E 2 | 2022 | Веб-интерфейс OpenAI, API | Диффузия + CLIP, inpainting |
| DALL·E 3 | 2023 | ChatGPT, Bing Image Creator, API | Переписывание промпта LLM |
| Midjourney v6 | 2023 | Discord, веб | Стилистика «по умолчанию красиво» |
| Stable Diffusion | 2022+ | Локально, облака | Открытые веса, тонкая настройка |
Сколько это стоит
OpenAI менял цены и модели несколько раз, поэтому актуальные тарифы стоит сверять на openai.com/api/pricing. Общая логика такая: цена привязана к разрешению и качеству, картинка стоит центы, а не доли цента, как токены текста. Для сравнения порядка:
- DALL·E через API — тарификация за изображение, отдельно для стандартного и HD качества.
- ChatGPT Plus и выше включают генерацию картинок в подписку без поштучной оплаты, но с лимитом запросов.
- Midjourney продаётся только подпиской, от базового плана до Pro с приватной генерацией.
- Stable Diffusion и FLUX можно гонять локально на своей видеокарте — тогда «цена» это электричество и амортизация железа.
Что это меняет для практики
Если нужен один-два баннера в неделю, дешевле сидеть в ChatGPT или Bing. Если генерация встроена в продукт и картинки считаются тысячами, имеет смысл смотреть API или self-hosted Stable Diffusion. Midjourney остаётся выбором тех, кому важна визуальная стилистика «из коробки», а не программный доступ.
Text-to-image перестал быть про «вау, оно нарисовало». Он стал про то, укладывается ли картинка в бюджет, дедлайн и юридические риски проекта.
Юридические риски и права
Главный спор вокруг DALL·E и его конкурентов — обучающие данные. Модели тренировали на огромных наборах изображений из интернета, и часть авторов считает это нарушением авторских прав. К Stability AI и Midjourney поданы иски художников в США, к OpenAI и Microsoft — иски от Getty Images и ряда медиа. Разбирательства идут, окончательной практики пока нет.
Для пользователя это значит следующее:
- Права на сгенерированную картинку у разных сервисов оформлены по-разному — читайте Terms of Use конкретной модели, а не общие обзоры.
- В США Copyright Office в 2023 году отказал в регистрации авторских прав на изображения, целиком созданные ИИ без человеческого творческого вклада. В России и ЕС ситуация обсуждается, устойчивой практики нет.
- Использовать сгенерированные лица реальных людей, логотипы брендов и стили ныне живущих художников в коммерции — это отдельный риск, даже если модель технически позволяет их нарисовать.
Что дальше
OpenAI после DALL·E 3 сместила фокус на мультимодальные модели: GPT-4o умеет и понимать, и генерировать изображения в рамках одного диалога, а в 2024 году компания показала видеомодель Sora. Отдельная линейка «DALL·E N» может и не выйти — генерация картинок становится функцией универсальных моделей, а не отдельным продуктом. Для рынка это означает, что выбор пойдёт не между «какой text-to-image лучше», а между экосистемами: OpenAI, Google, Midjourney и открытым стеком вокруг Stable Diffusion и FLUX.
1 Дискретный VAE (dVAE) — вариационный автоэнкодер, который кодирует изображение не в непрерывный вектор, а в набор дискретных токенов из фиксированного словаря. Это позволяет обращаться с картинкой так же, как с текстом — последовательностью «слов».
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI: DALL·E — Creating images from text, OpenAI API Pricing
Частые вопросы
Можно ли использовать картинки из DALL·E в коммерции
Чем DALL·E 3 отличается от Midjourney на практике
Почему модель отказывается рисовать то, что я прошу
Можно ли запустить что-то похожее локально
Кому принадлежат авторские права на изображение из DALL·E
Как писать промпт, чтобы получить нужный результат
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.