Что такое нейросеть Кандинский и её версии
Нейросеть Kandinsky — это генеративная модель от Сбера, предназначенная для создания изображений, анимации и видео по текстовым запросам. Первая версия появилась в ноябре 2021 года под названием ruDALL-E XL. После нескольких обновлений модель получила имя Kandinsky. В апреле 2023 года вышла версия 2.1, которая привлекла внимание пользователей, но уступала зарубежным аналогам по реалистичности. В июле 2023 года версия 2.2 значительно улучшила качество фотореалистичных изображений, а позже добавила возможность генерации коротких 4-секундных видеороликов.
В ноябре 2023 года на конференции AI Journey была представлена версия Kandinsky 3.0 и Kandinsky Video. Главной особенностью стало знакомство нейросети с русской культурой и фольклором: модель научилась работать с образами отечественных актёров, персонажами сказок, элементами российской архитектуры и мотивами народных промыслов (гжель, жостовская роспись). По состоянию на середину 2024 года актуальной является версия 3.1, которая продолжает развиваться и улучшать качество генераций.
Где можно использовать нейросеть Кандинский
Kandinsky доступен на нескольких платформах, что делает его удобным для разных сценариев использования.
Основные способы доступа:
- Сайт Fusion Brain — официальный портал института AIRI, где представлена самая свежая версия нейросети с полным функционалом. Здесь доступны генерация изображений, анимации и видео, а также расширенные настройки: выбор стиля, соотношения сторон, использование негативных промптов и инструмента «ластик» для удаления объектов.
- Сайт ruDALL-E — упрощённая версия с урезанным функционалом, где можно выбрать разные версии модели (3.1, 2.2, 2.1 и архивные). Сайт иногда работает нестабильно.
- Чат-бот в Telegram — бот @Kandinsky_by_Sber_AI поддерживает версии 3.1, 2.2 и 2.1. Позволяет генерировать изображения по описанию, смешивать изображения, переносить стиль, создавать вариации и стикеры.
- Чат-бот во ВКонтакте — бот для быстрой генерации изображений в трёх соотношениях сторон (1:1, 3:2, 2:3). Подходит для визуализации идей и создания анонсов, но не поддерживает расширенные настройки.
- Приложение «Салют» и устройства с Салют ТВ — виртуальный ассистент, который запускается по команде «Включи художника».
- Приложение «СберБанк Онлайн» — встроенный инструмент для генерации изображений.
Для генерации видео существует отдельный чат-бот в Telegram — Kandinsky Video by Sber AI. Доступ к нему предоставляется после подачи заявки.
Как генерировать изображения: пошаговая инструкция
Процесс создания изображения в Kandinsky зависит от выбранной платформы, но основные шаги схожи.
На сайте Fusion Brain:
- Перейдите на сайт Fusion Brain и выберите раздел «Картинки».
- Укажите соотношение сторон: 1:1 (квадрат, 1024×1024 px), 16:9 (горизонтальное), 9:16 (вертикальное), 3:2 или 2:3.
- Составьте промпт (текстовый запрос). Чем подробнее описание, тем точнее результат. Например: «Реалистичное фото, молодая девушка с длинными розовыми волосами улыбается, пирсинг в носу, белая футболка, крупные серьги, фон размыт, портрет».
- При необходимости укажите негативный промпт — то, чего на изображении быть не должно. Например, «ночь», «размытость».
- Выберите стиль из 17 доступных вариантов: «Детальное фото», «Цифровая живопись», «3D рендер», «Аниме», «Киберпанк», «Рисунок карандашом» и другие.
- Нажмите кнопку генерации и дождитесь результата (в среднем около 2 минут).
- Оцените результат. Если нужно, отредактируйте промпт или используйте ластик для удаления объектов, затем дорисуйте область с новым запросом.
В чат-ботах Telegram и VK:
- Отправьте боту текстовый запрос. Например: «Кот спит на диване, реализм, максимум деталей».
- В Telegram можно дополнительно выбрать версию модели и соотношение сторон.
- Результат придёт в виде изображения. При необходимости повторите запрос с уточнениями.
Как создавать анимацию и видео
Kandinsky поддерживает два формата движущегося контента: анимацию и видео.
Анимация:
- Доступна на сайте Fusion Brain во вкладке «Видео» при выборе модели «Анимация».
- Состоит из нескольких сцен (до 4), каждая длительностью 4 секунды.
- Для каждой сцены нужно написать отдельный промпт. Например: «Пустыня, 4k» для первой сцены и «Солнце, 4k» для второй.
- Можно выбрать направление камеры: зум, отдаление, панорама слева направо или снизу вверх.
- Соотношение сторон: 1:1, 9:16, 16:9. Максимальное качество при 1:1 — 640×640 px.
- Время генерации зависит от количества сцен: для четырёх сцен — около 10 минут.
- Негативные промпты для анимации не поддерживаются.
- Результат скачивается в формате MP4.
Видео:
- Генерируется через модель Kandinsky Video на сайте Fusion Brain или через отдельного чат-бота в Telegram (после одобрения заявки).
- Максимальная длительность — 5 секунд.
- Соотношение сторон: 1:1, 9:16, 16:9.
- Время генерации — около 4 минут.
- Качество видео пока уступает изображениям и анимации, а соответствие запросу может быть низким.
- Негативные промпты не поддерживаются, отредактировать уже сгенерированное видео нельзя.
Как правильно составлять промпты для лучших результатов
Качество результата напрямую зависит от того, насколько точно и подробно составлен запрос. Вот несколько практических рекомендаций:
- Начинайте с главного. Первым укажите основной объект или персонажа, затем действие, потом детали. Например: «Супермен и Бэтмен сидят на скамейке и едят пиццу, на фоне небоскрёбы, общий план, яркие цвета».
- Добавляйте контекст. Укажите фон, время дня, погоду, настроение, крупность плана, технические характеристики (например, «снято на плёнку 35 мм»).
- Используйте простые конструкции. Избегайте сложных предложений с деепричастными оборотами — чем проще формулировка, тем выше вероятность правильного считывания.
- Применяйте прямые отсылки. Вместо метафор лучше указать конкретного художника, стиль или фильм. Например: «Закат в стиле Малевича» или «Кот и собака в стиле „Криминального чтива“».
- Не забывайте про негативные промпты. Если на сгенерированном изображении появились лишние детали, пропишите их в негативном промпте. Например, если нейросеть добавила ночь, укажите «ночь» в негативном запросе.
- Экспериментируйте с длиной. Даже короткие запросы из одного слова («Лошадь») могут дать интересный результат, но для точности лучше добавлять детали.
Если результат не устраивает, последовательно корректируйте промпт и негативный промпт, пока изображение не приблизится к задуманному.
Расширенные возможности: работа с изображениями и ластик
Помимо генерации с нуля, Kandinsky предлагает несколько продвинутых функций для редактирования.
Генерация на основе загруженного изображения:
- Можно загрузить своё фото или картинку и получить его новую версию по текстовому запросу. Например, загрузить портрет и попросить нейросеть изменить причёску или фон.
- Также доступно смешивание двух изображений в одно новое.
Дорисовка деталей:
- Если сгенерированное изображение имеет слишком крупный план или объект обрезан, можно дорисовать недостающие части.
- Используйте инструмент «ластик» на сайте Fusion Brain, чтобы удалить ненужные объекты, а затем введите запрос для заполнения пустой области.
- Важно: новая область генерации должна пересекаться с исходным изображением — чем больше пересечение, тем выше вероятность, что вторая картинка станет логичным продолжением.
Стилизация:
- Перед генерацией можно выбрать один из 17 стилей, которые сильно влияют на внешний вид результата. Например, стиль «Пикассо» создаст абстрактную картину, а «Детальное фото» — максимально реалистичное изображение.
- Вероятность, что нейросеть точно воспроизведёт выбранный стиль, очень высокая, но иногда случаются «галлюцинации» — в этом случае стоит повторить генерацию.
Ограничения и особенности работы нейросети
Несмотря на широкие возможности, Kandinsky имеет ряд ограничений, которые важно учитывать.
- Лицензия на использование. Согласно пользовательскому соглашению, изображения можно использовать только для некоммерческих целей. Для коммерческого использования требуется отдельное разрешение.
- Качество видео. Генерация видео пока находится на ранней стадии: качество ниже, чем у изображений, а соответствие запросу часто оставляет желать лучшего.
- Стабильность работы. На сайте Fusion Brain иногда возникают сбои: нейросеть может дублировать предыдущие генерации. В таких случаях помогает перезагрузка страницы или повторный вход в кабинет.
- Генерация двух и более персонажей. Нейросеть не всегда корректно обрабатывает запросы с несколькими героями — может дублировать одного персонажа или создавать лишних. Рекомендуется максимально детализировать промпт и использовать негативные промпты.
- Отсутствие истории генераций. На сайте Fusion Brain нет возможности просмотреть ранее созданные изображения, поэтому результаты нужно сохранять сразу.
- Форматы файлов. Стандартный формат для скачивания — JPEG. Исключение — изображения в стиле «3D рендер», которые сохраняются в PNG. Анимация и видео скачиваются в MP4.
Сравнение с другими нейросетями и практические советы
Kandinsky часто сравнивают с Midjourney и Stable Diffusion — ведущими зарубежными генеративными моделями. По степени реалистичности и детализации Kandinsky находится примерно на одном уровне с ними, но имеет несколько ключевых отличий.
- Бесплатность. В отличие от Midjourney, у Kandinsky нет платных тарифов — можно генерировать неограниченное количество изображений и анимаций.
- Русскоязычная поддержка. Нейросеть отлично понимает запросы на русском языке, а также более чем на 100 других языках.
- Интеграция с экосистемой Сбера. Доступ через приложения «Салют» и «СберБанк Онлайн» делает его удобным для пользователей банковских сервисов.
- Понимание контекста. Kandinsky реже «галлюцинирует» на простых запросах: например, по запросу «чёрный кот в парике» он, скорее всего, создаст именно кота, а не другой объект.
Практические советы:
- Для быстрой визуализации идей используйте чат-боты в Telegram или VK — они не требуют регистрации и работают прямо в мессенджере.
- Для сложных проектов с точными требованиями лучше использовать сайт Fusion Brain с полным набором настроек.
- Если нужно получить изображение в определённом стиле, обязательно выбирайте соответствующий стиль перед генерацией — это экономит время на доработку.
- Подсматривайте чужие промпты в тематических сообществах — это помогает лучше понять логику нейросети и сократить время на эксперименты.
Вопросы и ответы
Как пользоваться нейросетью Кандинский бесплатно?
Kandinsky полностью бесплатен. Вы можете генерировать изображения, анимацию и видео без ограничений через сайт Fusion Brain, чат-ботов в Telegram и VK, а также через приложения «Салют» и «СберБанк Онлайн». Платных тарифов нет.
Какие форматы изображений поддерживает Kandinsky?
Стандартный формат для скачивания — JPEG. Исключение составляют изображения, созданные в стиле «3D рендер» — они сохраняются в PNG. Анимация и видео скачиваются в формате MP4.
Можно ли использовать сгенерированные изображения в коммерческих целях?
Согласно пользовательскому соглашению, изображения, созданные с помощью Kandinsky, можно использовать только для некоммерческих целей. Для коммерческого использования необходимо получить отдельное разрешение от правообладателя.
Почему нейросеть иногда выдаёт не тот результат, который я запрашивал?
Это связано с «галлюцинациями» ИИ — ошибками в интерпретации запроса. Чтобы повысить точность, старайтесь составлять максимально детализированные промпты, используйте негативные промпты для исключения нежелательных деталей и выбирайте подходящий стиль. Если результат не устраивает, повторите генерацию с уточнённым запросом.
Как удалить лишние объекты с уже сгенерированного изображения?
На сайте Fusion Brain используйте инструмент «ластик». Выделите область с лишним объектом, удалите его, а затем введите текстовый запрос для заполнения пустого места. Важно, чтобы новая область пересекалась с исходным изображением для лучшего результата.
В чём разница между анимацией и видео в Kandinsky?
Анимация состоит из нескольких сцен (до 4), каждая длительностью 4 секунды, с возможностью выбора направления камеры. Видео — это единый ролик длительностью до 5 секунд, без разделения на сцены. Качество видео пока ниже, чем у анимации, а время генерации — около 4 минут.