Что такое нейросеть Кандинский 2.0 и её место в экосистеме Сбера
Нейросеть Кандинский — это отечественная разработка компании Сбер для генерации изображений, анимации и видео по текстовым запросам. Первая версия появилась в ноябре 2021 года под названием ruDALL-E XL. В ходе обновлений модель эволюционировала, и в апреле 2023 года вышла версия Kandinsky 2.1, которая получила широкую популярность. Версия 2.2, выпущенная в июле 2023 года, добавила фотореалистичные изображения и возможность создавать короткие 4-секундные видеоролики. В ноябре 2023 года была представлена Kandinsky 3.0, а по состоянию на май 2024 года актуальной является версия 3.1. Кандинский 2.0 занимает особое место как переходная версия, заложившая основы для последующих улучшений. Сегодня нейросеть доступна через сайт Fusion Brain, чат-боты в Telegram и ВКонтакте, а также через мобильное приложение «Салют».
Основные возможности и форматы генерации
Кандинский 2.0 и последующие версии поддерживают несколько форматов работы:
- Генерация по текстовому запросу — создание изображения на основе описания.
- Генерация на основе загруженного изображения — изменение исходной картинки с сохранением стиля и деталей.
- Дорисовка деталей — расширение или дополнение готового изображения с помощью инструмента «ластик» и нового запроса.
- Создание анимации — генерация анимационных роликов длительностью до 4 секунд на сцену, с возможностью добавления нескольких сцен.
- Генерация коротких видео — создание видеороликов по текстовому запросу (доступно после одобрения заявки).
Все эти функции доступны бесплатно, без ограничений по количеству генераций. Изображения можно скачивать на компьютер, а также использовать в некоммерческих целях согласно пользовательскому соглашению.
Как пользоваться Кандинским через Fusion Brain
Fusion Brain — это официальный портал, где размещена самая свежая версия нейросети. Интерфейс полностью русскоязычный и интуитивно понятный. Для начала работы:
- Выберите качество и ориентацию изображения (1:1, 3:2, 2:3). По умолчанию квадратная картинка имеет разрешение 1024×1024 пикселя.
- Введите текстовый запрос (промт) в поле под областью генерации.
- Нажмите кнопку «Создать» и оцените результат.
- При необходимости укажите негативный промт — то, чего на изображении быть не должно. Это помогает убрать лишние детали.
- Повторяйте корректировку промта и негативного промта до получения желаемого результата.
Также доступны горячие клавиши для быстрого редактирования. Инструмент «ластик» позволяет стереть часть изображения и дорисовать новую область, описав её в запросе. Важно, чтобы новая область генерации пересекалась с исходным рисунком — это обеспечивает плавное продолжение.
Работа через чат-боты и приложения
Кандинский доступен в нескольких каналах:
- Чат-бот ВКонтакте — позволяет генерировать изображения по запросу с выбором ориентации. Подходит для быстрой визуализации идей, но не поддерживает расширенные настройки и загрузку изображений.
- Telegram-бот Kandinsky by Sber AI — поддерживает версии 3.1, 2.2 и 2.1. Умеет генерировать изображения, смешивать их, переносить стиль, создавать вариации и стикеры.
- Telegram-бот Kandinsky Video by Sber AI — для генерации видео. Требуется предварительная заявка на доступ.
- Мобильное приложение «Салют» — виртуальный ассистент, который может генерировать изображения по команде «Включи художника».
- Умные устройства под управлением Салют ТВ — аналогичная функция.
В чат-ботах версия нейросети может быть не самой актуальной, поэтому качество изображений может уступать генерациям на Fusion Brain.
Как правильно составлять промты для Кандинского
Качество результата напрямую зависит от того, как сформулирован запрос. Вот несколько рекомендаций:
- Будьте конкретны. Вместо «кот» напишите «пушистый рыжий кот сидит на подоконнике, солнечный свет, реалистичное фото».
- Используйте стили. Нейросеть понимает указания на художественные стили: «масло», «акварель», «карандаш», «мультфильм», «3D», «иконопись», «Айвазовский», «Кандинский» и другие.
- Указывайте детали. Цвета, освещение, композиция, настроение — всё это влияет на результат.
- Негативный промт. Если на изображении появляются нежелательные элементы (например, лишние руки или объекты), добавьте их в негативный промт.
- Экспериментируйте. Один и тот же запрос может давать разные результаты при повторной генерации. Используйте кнопку повторной генерации для поиска лучшего варианта.
Пример: запрос «Баба Яга» без дополнительных описаний даёт узнаваемый образ, но добавление деталей (избушка, ступа, тёмный лес) значительно улучшает результат.
Редактирование и дорисовка изображений
Одна из сильных сторон Кандинского — возможность редактировать уже готовые изображения. Процесс включает:
- Дорисовка области. С помощью инструмента «ластик» удалите часть изображения, затем переместите область генерации на это место и введите новый запрос. Чем больше пересечение с исходным рисунком, тем лучше нейросеть продолжит картинку.
- Изменение деталей. Можно точечно менять элементы, не затрагивая остальное. Например, добавить цветы на поляну или изменить цвет объекта.
- Смешивание изображений. Загрузите два изображения и попросите нейросеть объединить их в одно новое.
- Перенос стиля. Загрузите изображение и укажите стиль, который нужно применить (например, «под масло» или «в стиле Ван Гога»).
Этот функционал особенно полезен для дизайнеров, иллюстраторов и всех, кто хочет быстро доработать визуальный контент.
Сравнение версий: от 2.0 до 3.1
Эволюция Кандинского заметна по ключевым улучшениям:
- Kandinsky 2.0 — базовая версия, умела создавать простые изображения по тексту.
- Kandinsky 2.1 (апрель 2023) — значительное улучшение качества, но всё ещё уступала Midjourney и Stable Diffusion.
- Kandinsky 2.2 (июль 2023) — фотореалистичные изображения, высокая детализация, добавлена генерация 4-секундных видео.
- Kandinsky 3.0 (ноябрь 2023) — интеграция с русской культурой и фольклором, поддержка стилей гжели, жостовской росписи и других. Улучшено понимание сложных запросов.
- Kandinsky 3.1 (май 2024) — самая актуальная версия с дополнительными улучшениями качества и скорости.
Каждая новая версия добавляла функции, но базовые принципы работы оставались неизменными. Пользователи могут выбирать версию на сайте ruDALL-E или в чат-ботах.
Ограничения и лицензирование
При использовании Кандинского важно учитывать несколько моментов:
- Лицензия. Изображения можно использовать только в некоммерческих целях в соответствии с пользовательским соглашением. Для коммерческого использования требуется отдельное разрешение.
- Качество видео. Генерация видео пока находится на ранней стадии — качество и соответствие запросу часто низкое, время генерации около 4 минут.
- Доступность. Некоторые функции (например, генерация видео) требуют подачи заявки и одобрения.
- Ограничения чат-ботов. В чат-ботах версия нейросети может быть устаревшей, а функционал — урезанным.
- Технические сбои. Сайт ruDALL-E иногда работает некорректно, формы могут не отправляться.
Несмотря на эти ограничения, Кандинский остаётся одним из лучших бесплатных инструментов для генерации изображений на русском языке.
Интеграция через API и продвинутые возможности
Для разработчиков и владельцев сайтов предусмотрена интеграция Кандинского через API. Это позволяет:
- Добавить генерацию изображений в собственное приложение или сервис.
- Настроить автоматическую генерацию контента для блогов, соцсетей или рекламы.
- Использовать все функции нейросети программно.
Для подключения необходимо зарегистрироваться на Fusion Brain и получить API-ключ. Документация и примеры кода доступны на портале. Это открывает возможности для создания уникальных продуктов на базе ИИ.
Вопросы и ответы
Как начать пользоваться нейросетью Кандинский 2.0?
Для начала работы перейдите на сайт Fusion Brain, выберите версию Kandinsky 2.0 или более новую, введите текстовый запрос на русском языке и нажмите «Создать». Также можно использовать чат-боты в Telegram или ВКонтакте.
Какие форматы изображений поддерживает Кандинский?
Нейросеть поддерживает квадратные изображения (1:1) с разрешением 1024×1024 пикселя, а также альбомную (3:2) и портретную (2:3) ориентации. Можно генерировать как реалистичные фото, так и изображения в различных художественных стилях.
Можно ли редактировать уже готовое изображение в Кандинском?
Да, с помощью инструмента «ластик» можно удалить часть изображения и дорисовать новую область, описав её в запросе. Также доступна функция дорисовки на основе загруженного изображения.
Есть ли ограничения по количеству генераций?
Нет, нейросеть Кандинский полностью бесплатна и не имеет ограничений на количество генераций. Вы можете создавать сколько угодно изображений, анимаций и видео.
Как улучшить качество сгенерированного изображения?
Используйте более подробные промты, указывайте стиль, освещение и детали. Добавляйте негативный промт для удаления нежелательных элементов. Экспериментируйте с разными версиями нейросети — более новые версии (3.0, 3.1) дают лучшее качество.
Можно ли использовать изображения Кандинского в коммерческих целях?
Согласно пользовательскому соглашению, изображения можно использовать только в некоммерческих целях. Для коммерческого использования необходимо получить отдельное разрешение от Сбера.
Какие стили доступны в нейросети Кандинский?
Доступны стили: мультфильм, 3D, масло, карандаш, мозаика, иконопись, а также стили известных художников (Айвазовский, Кандинский). В версии 3.0 добавлены элементы русских народных промыслов: гжель, жостовская роспись и другие.