Для работы проектов iXBT.com нужны файлы cookie и сервисы аналитики. Продолжая посещать сайты проектов вы соглашаетесь с нашей Политикой в отношении файлов cookie

Deepfloyd IF: новая нейросеть, которая умеет генерировать картинки с текстом. И при этом совсем бесплатно

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com

30 апреля 2023, 20:53 | Обзор | ИИ, сервисы и приложения

Deepfloyd — новая нейросеть от StabilityAI с открытым исходным кодом, которая умеет генерировать картинки с текстом внутри. И это бесплатно: просто вставляете запрос с текстовым описанием будущей работы и получаете 4 варианта картинок через несколько секунд. Но есть ограничение: она умеет писать только на английском.

Промпт: a photo of a violet baseball cap with yellow text: "deep floyd". 50mm lens, photo realism, cine lens. violet baseball cap says "deep floyd". reflections, render. yellow stitch text "deep floyd"

Как пользоваться

В самом интерфейсе нейросети есть два поля: для промпта и для негативного промпта.

В поле с обычным промптом нужно вписать тот запрос, который вы хотите нарисовать. А в негативный — те вещи, объекты и т.д., которые вы не хотите видеть после генерации.

Для примера попросим нейросеть нарисовать футболку с надписью IXBT. Но зададим ограничение — красные и белые футболки.

Сами футболки видны плохо. Но понятно одно: белых и красных нет.

Второй шаг после того, как вы получили картинки — кликнуть на понравившуюся и нажать Upscale.

После этого нейросеть увеличит ваше фото до размера 1024 х 1024. Например, вот, что она сделала из второго варианта.

Футболка получилась довольно качественной и реалистичной.

У нейросети есть и другие, дополнительные функции.

Эти параметры отвечают за качество и детализацию картинки.

Seed показывает, чем нейросеть будет руководствоваться при генерации картинок. Разные значения — разные стартовые точки для генерации каждой из картинок. Если вы не хотите генерировать похожие картинки, ставьте значение минус 1. Так каждая картинка будет уникальной. А если вам нужно улучшить свой текстовый запрос, то зафиксируйте какое-то конкретное стартовое число и не меняйте его.

Guidance Scale показывает, насколько нейросеть будет придерживаться вашему запросу. Здесь есть своя градация:

2–6 — нейронка рисует, что хочет;
7–11 — нейронка обрабатывает только половину запроса, а вторую половину додумает;
12–15 — постарается учесть почти весь запрос;
16+ — будет следовать только запросу.

В Stable diffusion по умолчанию рекомендуют использовать значение 8. А если вы точно уверены в том, что получите, ставьте 12. Здесь можно придерживаться таких же значений.

Важно! Рекомендую брать в кавычки тот текст, который вы хотите нарисовать. Например, не IXBT, а «IXBT». Так нейронка сгенерирует буквы лучше.

Вариант генерации с текстом в кавычках: только одна картинка не в тему

Вариант генерации с текстом без кавычек: две картинки с неправильным текстом

Что умеет нейросеть

А теперь настало время примеров, которые я смог создать совместно с нейросетью.

Вы посмотрите на эту кепку: буквы такие, будто бы их действительно вышили.Идем дальше.

Промпт: a subway train's digital sign saying "open source", vsco preset, 35mm photo, film grain, in a dim subway station

Здесь слились буквы «u» и «r» но картинка все равно выглядит реалистично.

Теперь пройдемся по еде.

Промпт: word «diet» from vegetables on a plate

Не знаю, что это за овощи, но выглядит даже аппетитно.

Попробуем сгенерировать какое-нибудь животное.

Промпт: a wide angle photo of a very happy dog in a hat giving a thumb up to the camera while holding a coffee cup and wearing a shirt reading "This is fine" in front of burning servers, servers in flames in the background, sharp focus, intricate details, ultra detailed, 8k

Здесь, конечно, нейросеть отразила не все, что я хотел: нет стаканчика кофе, неправильно написано выражение и у собаки нет рубашки. Но выглядит это все равно круто.

А это — второй вариант собаки с тем же промптом. Здесь все намного круче и эпичнее, только выражение снова написано с ошибкой.

Где попробовать

Модель представлена в виде открытого исходного кода, который лежит на GitHub.

Но саму нейросеть можно попробовать на сайте Hugging Face.

2 комментария

Интересно, как русским удалось обучить модель без поддержки русского языка...
Our research band: Mikhail Konstantinov,Alex Shonenkov,Daria Bakshandaeva,Ksenia Ivanova.
https://github.com/deep-floyd/IF

Ответить

Да, самому интересно стало))
Ну, скорее всего, базу иностранную просто использовали (SD ведь на ней и обучена)

Ответить

Добавить комментарий

Сейчас на главной

Новости

Астрофизики официально признали неполноту современных знаний об устройстве Вселенной

Наука и космос
24 минуты назад
0

Ученые обсуждают находку загадочной монеты, которая может указывать на ранние связи викингов с христианством

Наука и космос
25 минут назад
0

Гигантский интерактивный кот появился в аэропорту Гонконга

Путешествия и туризм
38 минут назад
0

Ученые призывают запретить варить омаров заживо: новое исследование подтверждает, что они чувствуют боль

Наука и космос
59 минут назад
0

В Китае ввели в эксплуатацию самый длинный в мире наружный эскалаторный комплекс протяженностью 905 метров

Оффтопик
1 час назад
0

Публикации

Обзор бесщеточной аккумуляторной пилы ProCraft PKA45 (PKA46): 2 аккумулятора, 2 шины и 2 цепи

Обзор
2 часа назад
Инструменты и запчасти

Во время работы в саду или на приусадебном участке приходится срезать деревья и кустарники. Порой они достаточно толстые, чтобы справиться с ними вручную, и приходится доставать электрические или...

6 причин почему кофе из кофемашины дома получается хуже, чем в кофейне — и как это исправить

Тематическая подборка
2 часа назад
Оффтопик

Вы потратили приличную сумму на современную кофемашину, выбираете дорогое зерно, но утренний эспрессо всё равно получается плоским, горчит или подозрительно напоминает напиток из вокзального...

Паводок и половодье: основные различия и причины возникновения

Мнение
2 часа назад
Оффтопик

Весна время большой воды. Понятия «паводок» и «половодье» часто путают, хотя это разные гидрологические явления. Разберём их суть, отличия и особенности ниже. Автор: Heavylift Источник:...

Обзор блока питания PCCooler YS1200 – что происходит с напряжением и пульсациями

Обзор
3 часа назад
Платформа ПК

PCCooler YS1200 — блок питания на 1200 Вт под мощные сборки. Есть поддержка ATX 3.1 и отдельный кабель 12V-2x6 для видеокарт. По характеристикам все выглядит как нужно, но такие вещи...

Кто такие битуронги и почему эти зверьки пахнут попкорном

Мнение
4 часа назад
Флора и фауна

В мире существует множество удивительных созданий, но один милый зверёк, обитающий в густых кронах тропических лесов Юго-Восточной Азии, занимает в нём особое место...

Как Huawei показала, что может быть альтернативой Samsung и Apple: смартфону Huawei P9 — десять лет

Мнение
4 часа назад
Смартфоны и телефоны

В наши дни между крупными китайскими компаниями и «выжившими» A-брендами (Apple и Samsung) уже давно нет чёткой грани, однако десять лет назад ситуация воспринималась по-другому. Рынок делился на...