Что такое Kandinsky и как он работает
Kandinsky — это российская нейросеть для генерации изображений и видео, разработанная командой SberAI. Модель относится к классу text-to-image и основана на архитектуре диффузионных моделей. Проще говоря, нейросеть обучена на миллионах пар «текст + картинка» и умеет восстанавливать изображение из случайного шума, ориентируясь на текстовое описание.
Название выбрано неслучайно: оно отсылает к художнику Василию Кандинскому, пионеру абстрактного искусства. Первая версия модели, ruDALL-E, вышла в ноябре 2021 года, а затем эволюционировала в линейку Kandinsky. На момент написания статьи актуальной является версия Kandinsky 3.1, которая значительно превзошла предшественников по детализации и точности следования запросу.
Главное преимущество Kandinsky перед зарубежными аналогами — полная бесплатность для личного использования и отсутствие необходимости в VPN. Модель понимает запросы более чем на 100 языках, но лучше всего — на русском. Это значит, что вам не нужно переводить промпты или подбирать сложные англоязычные конструкции.
Где можно пользоваться Kandinsky: все платформы и способы доступа
Одно из ключевых отличий Kandinsky от многих конкурентов — мультиплатформенность. Нейросеть доступна через несколько каналов, и вы можете выбрать наиболее удобный:
- Сайт Fusion Brain (fusionbrain.ai) — основная веб-платформа с полным функционалом. Требуется регистрация через Сбер ID или GosKey.
- Telegram-бот (@kandinsky21_bot) — самый быстрый способ. Не требует регистрации, достаточно отправить текстовый запрос и получить изображение.
- Чат-бот ВКонтакте — аналогично Telegram, работает без создания аккаунта.
- Приложение «СберБанк Онлайн» — генерация доступна прямо в мобильном банке.
- Виртуальный ассистент «Салют» — Kandinsky встроен как навык голосового помощника.
- «Салют ТВ» — по команде «Включи художника» можно генерировать изображения на экране телевизора.
- GigaChat — интеграция с текстовой нейросетью Сбера: вы можете попросить GigaChat написать пост и сразу сгенерировать к нему иллюстрацию.
Для первого знакомства лучше всего подойдёт Telegram-бот: не нужно ничего скачивать и настраивать. Если же вам нужны расширенные функции (редактирование, генерация видео, сохранение истории), стоит зарегистрироваться на Fusion Brain.
Как генерировать изображения: пошаговая инструкция
Процесс создания картинки в Kandinsky интуитивно понятен и занимает от 10 до 30 секунд. Рассмотрим его на примере веб-интерфейса Fusion Brain:
- Авторизуйтесь на сайте fusionbrain.ai через Сбер ID или email.
- Выберите режим «Текст в изображение» (Text to Image).
- Составьте промпт — текстовое описание того, что вы хотите увидеть. Например: «Уютная кофейня в осеннем парке, мягкий свет, акварельный стиль».
- Настройте параметры:
- Соотношение сторон: 1:1 (квадрат), 16:9 (горизонталь), 9:16 (вертикаль), 3:2, 2:3.
- Стиль изображения: доступно 17 вариантов, включая фотореализм, цифровую живопись, акварель, аниме, 3D-рендер, киберпанк и другие.
- Негативный промпт (опционально): укажите, чего не должно быть на картинке, например «без текста, без размытия».
- Нажмите «Сгенерировать» и дождитесь результата.
- Оцените изображение. Если результат не устраивает, скорректируйте запрос и попробуйте снова.
- Скачайте файл в формате JPEG (или PNG для стиля «3D рендер»).
В Telegram-боте процесс ещё проще: отправляете текстовый запрос и получаете изображение прямо в чат. Дополнительные настройки (соотношение сторон, стиль) доступны через команды бота.
Генерация анимации и видео в Kandinsky
Kandinsky умеет создавать не только статичные картинки, но и анимацию, а также короткие видеоролики.
Анимация состоит из нескольких сцен (до четырёх), каждая длительностью 4 секунды. Вы можете задать отдельный промпт для каждой сцены и выбрать направление камеры (зум, панорама, отдаление). Соотношение сторон: 1:1, 9:16, 16:9. Максимальное качество при 1:1 — 640×640 px. Время генерации анимации из четырёх сцен — около 10 минут. Результат сохраняется в формате MP4.
Kandinsky Video — первая в России модель text-to-video, представленная в ноябре 2023 года. Она позволяет создавать видеоролики длительностью до 5 секунд (в версии 5.0 — до 10 секунд) на основе текстового описания или статичного изображения (image-to-video). Разрешение — HD (1280×720) в версии Pro или SD (768×512) в Lite. Частота кадров — 24 fps. Генерация занимает 2–4 минуты.
Важно: качество видео пока уступает качеству изображений, а негативные промпты для видео не поддерживаются. Тем не менее, это отличный инструмент для быстрого создания динамичного контента для соцсетей и презентаций.
Как правильно составлять промпты для Kandinsky
Качество результата примерно на 80% зависит от того, как вы сформулируете запрос. Хорошая новость: Kandinsky понимает обычный русский язык, и вам не нужно использовать сложные англоязычные конструкции. Тем не менее, есть несколько правил, которые помогут получать предсказуемые и красивые изображения.
Формула хорошего промпта: Объект + действие/состояние + окружение + стиль + освещение
Чем конкретнее каждый элемент, тем точнее результат. Сравните:
- Слабый промпт: «Нарисуй дом».
- Сильный промпт: «Двухэтажный деревянный дом с красной крышей в заснеженном лесу, дым из трубы, тёплый свет в окнах, вечерние сумерки, иллюстрация в стиле детской книги».
Полезные рекомендации:
- Выносите самое важное в начало промпта.
- Используйте прямые отсылки к художникам, фильмам или стилям: «Закат в стиле Малевича», «Кот и собака в стиле „Криминального чтива“».
- Избегайте метафор и сложных оборотов — чем проще формулировка, тем выше шанс, что нейросеть поймёт вас верно.
- Применяйте негативные промпты, чтобы убрать нежелательные детали: «без текста, без размытия, без искажений».
- Если результат не устраивает, упрощайте логику запроса или меняйте формулировку.
Ключевые слова, усиливающие промпт:
- Стиль: акварель, масло, цифровая живопись, фотореализм, аниме, комикс, минимализм, киберпанк.
- Освещение: мягкий свет, контровой свет, неоновое свечение, золотой час.
- Камера: макросъёмка, портретный объектив, широкоугольный, вид сверху.
- Атмосфера: уютный, драматичный, мистический, праздничный.
Редактирование изображений и дополнительные функции
Kandinsky предлагает не только генерацию с нуля, но и ряд полезных функций для работы с уже готовыми изображениями.
Генерация на основе изображения (image-to-image). Вы можете загрузить фотографию и попросить нейросеть перерисовать её в заданном стиле или с определёнными изменениями. Например, загрузить портрет и получить его акварельную версию. Результат может быть как очень похожим на исходник, так и лишь отдалённо напоминать его — это зависит от сложности запроса.
Инпейнтинг (замена части изображения). С помощью «ластика» можно удалить ненужный объект, а затем прописать в запросе, что должно быть на его месте. Нейросеть дорисует область с учётом освещения и перспективы. Это удобно, когда нужно убрать случайный элемент или заменить фон.
Смешивание изображений. Загрузите две картинки, и Kandinsky объединит их стили, палитру или композицию. Можно переносить цветовую гамму с одного изображения на другое или создавать коллажи.
Негативные промпты. Работают для изображений, но не поддерживаются для анимации и видео. Позволяют исключить нежелательные детали: «Ночь», «Размытие», «Текст».
Выбор стиля. Перед каждой генерацией можно выбрать один из 17 стилей. Вероятность, что нейросеть точно воспроизведёт выбранный стиль, очень высока, но иногда случаются сбои («галлюцинации» ИИ). В этом случае достаточно повторить генерацию.
Плюсы и минусы Kandinsky: объективная оценка
Как и любой инструмент, Kandinsky имеет сильные и слабые стороны. Рассмотрим их подробно.
Преимущества:
- Полностью бесплатно. Нет скрытых платежей, лимитов на количество генераций для зарегистрированных пользователей. Для работы через Telegram-бота или ВКонтакте регистрация вообще не нужна.
- Русский язык. Модель обучена понимать запросы на русском без перевода, что ускоряет работу и повышает точность.
- Доступность в России. Не требуется VPN, сервера находятся в РФ.
- Мультиплатформенность. Сайт, Telegram, VK, мобильное приложение, GigaChat — выбирайте любой канал.
- Быстрая генерация. Изображение создаётся за 10–30 секунд, видео — за 2–4 минуты.
- Понимание сложных запросов. Kandinsky хорошо справляется с многослойными сценами и атмосферными описаниями.
Недостатки:
- Текст на изображениях. Надписи почти всегда получаются нечитаемыми или содержат ошибки. Для логотипов и баннеров с текстом лучше использовать другие инструменты.
- Детализация рук и пальцев. Классическая проблема многих нейросетей, хотя с каждой версией ситуация улучшается.
- Ограниченные настройки. По сравнению с Midjourney или Stable Diffusion у Kandinsky меньше параметров для тонкой настройки.
- Цензура. Строгие фильтры могут блокировать некоторые запросы, даже безобидные.
- Качество видео. Пока уступает качеству изображений, максимальная длительность — 5–10 секунд.
В целом Kandinsky — отличный выбор для быстрых задач, черновиков и некоммерческих проектов. Для профессионального использования может потребоваться доработка в графическом редакторе.
Сравнение Kandinsky с Midjourney, DALL-E и Stable Diffusion
Чтобы понять, насколько Kandinsky конкурентоспособен, сравним его с основными аналогами по ключевым параметрам.
| Параметр | Kandinsky | Midjourney | DALL-E 3 | Stable Diffusion | |---|---|---|---|---| | Цена | Бесплатно | От $10/мес | В составе ChatGPT Plus ($20/мес) | Бесплатно (локально) | | Русский язык | Отлично | Средне | Хорошо | Зависит от модели | | Доступ из России | Без ограничений | Нужен VPN | Нужен VPN | Без ограничений (локально) | | Качество фотореализма | Хорошее | Отличное | Отличное | Зависит от модели | | Текст на картинках | Слабо | Средне | Хорошо | Слабо | | Простота использования | Очень высокая | Средняя | Высокая | Низкая |
Выводы:
- Midjourney остаётся эталоном художественного качества и фотореализма, но требует подписки и VPN.
- DALL-E 3 лучше всех справляется с генерацией текста на изображениях, но доступен только платно.
- Stable Diffusion даёт максимальную гибкость (можно дообучать модели), но требует технических навыков и мощного оборудования.
- Kandinsky занимает уникальную нишу: это единственный серьёзный генератор, который работает из России без VPN и при этом бесплатен. По качеству стилизованных иллюстраций он приближается к Midjourney, хотя уступает в фотореализме.
Для большинства повседневных задач — обложки для соцсетей, иллюстрации к статьям, концепты интерьеров — возможностей Kandinsky более чем достаточно.
Практические примеры использования Kandinsky для разных задач
Рассмотрим несколько конкретных сценариев, где Kandinsky может быть полезен.
1. Обложка для статьи или поста в соцсетях.
- Выберите горизонтальный формат 16:9.
- Составьте промпт по формуле: объект + настроение + стиль. Пример: «Раскрытая книга с летящими из неё буквами, тёплый свет, иллюстрация, пастельные тона».
- Сгенерируйте 3–5 вариантов и выберите лучший.
- Добавьте текст заголовка поверх изображения в Canva или Figma — Kandinsky не справится с читаемыми надписями.
2. Иллюстрация для презентации.
- Используйте квадратный формат 1:1 — его легче вписать в слайд.
- Добавьте в промпт «белый фон», «минимализм», «изолированный объект».
- Обычно 2–4 генерации достаточно, чтобы получить подходящий вариант.
3. Концепт интерьера или дизайна.
- Опишите помещение: «Скандинавская гостиная с белыми стенами, деревянным полом, серым диваном и зелёными растениями, мягкий дневной свет».
- Выберите стиль «Фотореализм» или «3D рендер».
- Используйте результат как референс для обсуждения с заказчиком или дизайнером.
4. Анимация для соцсетей.
- Создайте анимацию из 2–4 сцен, каждая с отдельным промптом.
- Выберите направление камеры (например, панорама слева направо).
- Пример: сцена 1 — «Пустыня, 4k», сцена 2 — «Солнце, 4k».
- Генерация займёт около 10 минут, результат — MP4-файл.
5. Оживление фотографий (image-to-video).
- Загрузите портрет и выберите режим видео.
- Нейросеть добавит движение глаз, мимику, лёгкое покачивание головы.
- Подходит для создания динамичных аватарок или коротких роликов.
Важно помнить: для коммерческого использования сгенерированных изображений требуется отдельное соглашение с SberAI. Личные и некоммерческие проекты не требуют согласования.
Ограничения и частые ошибки при работе с Kandinsky
Даже при правильном составлении промптов могут возникать неожиданные результаты. Рассмотрим типичные проблемы и способы их решения.
Проблема: нейросеть дублирует предыдущие генерации. Иногда на сайте Fusion Brain модель начинает выдавать одни и те же изображения. Решение: перезагрузите страницу или выйдите из аккаунта и войдите заново.
Проблема: два героя на картинке сливаются в одного. Kandinsky, как и многие нейросети, испытывает трудности с генерацией нескольких персонажей. Чтобы разделить их, используйте максимально конкретные описания: «Супермен в костюме Супермена и Бэтмен в костюме Бэтмена сидят на скамейке». Если это не помогает, попробуйте сгенерировать каждого героя отдельно, а затем объединить результаты через инпейнтинг.
Проблема: нечитаемый текст на изображении. Это ограничение самой архитектуры диффузионных моделей. Если вам нужен текст на картинке, лучше добавить его в графическом редакторе после генерации.
Проблема: цензура блокирует запрос. Kandinsky имеет строгие фильтры, которые могут срабатывать даже на безобидные запросы. Попробуйте переформулировать промпт, убрав потенциально спорные слова.
Проблема: анимация или видео не соответствуют ожиданиям. Для анимации и видео негативные промпты не работают, а качество пока уступает статичным изображениям. Экспериментируйте с формулировками и упрощайте сцены.
Общее правило: если результат не устраивает, не бойтесь экспериментировать. Меняйте порядок слов, добавляйте или убирайте детали, пробуйте разные стили. Kandinsky — это инструмент для творчества, и лучшие результаты приходят с практикой.
Вопросы и ответы
Нужна ли регистрация для использования Kandinsky?
Нет, если вы пользуетесь через Telegram-бота или ВКонтакте. Для доступа к расширенным функциям (редактирование, генерация видео, сохранение истории) потребуется регистрация на сайте Fusion Brain через Сбер ID или GosKey.
Можно ли использовать сгенерированные изображения в коммерческих проектах?
Для коммерческого использования требуется отдельное соглашение с SberAI. Личные и некоммерческие проекты не требуют согласования. Перед коммерческим применением проверяйте актуальную лицензию на сайте Fusion Brain.
В чём отличие Kandinsky от Midjourney и Stable Diffusion?
Kandinsky работает на русском языке, бесплатен, доступен без VPN. Midjourney платный, требует подписку от $10/месяц и понимает только английский. Stable Diffusion бесплатен, но требует технических навыков для локальной установки. По качеству фотореализма Kandinsky уступает Midjourney, но превосходит его в доступности и простоте.
Как получить наилучший результат при генерации изображений?
Подробно описывайте сцену: объект, действие, окружение, стиль, освещение. Используйте негативные промпты, чтобы исключить нежелательные детали. Выбирайте подходящий стиль из списка. Если результат не устроил, меняйте формулировку и пробуйте снова. Экспериментируйте — это ключ к успеху.
Какие форматы и разрешения поддерживает Kandinsky?
Для изображений доступны соотношения сторон: 1:1, 16:9, 9:16, 3:2, 2:3. Максимальное разрешение при 1:1 — 1024×1024 px. Для анимации и видео: 1:1, 9:16, 16:9. Видео может быть до 10 секунд (в версии 5.0) с разрешением HD (1280×720) или SD (768×512).
Почему Kandinsky иногда генерирует странные или нерелевантные изображения?
Это явление называется «галлюцинацией» ИИ. Оно может возникать из-за слишком абстрактных или противоречивых запросов. Решение: упростите промпт, используйте более конкретные описания и негативные промпты. Если проблема повторяется, перезагрузите страницу или попробуйте другой канал доступа.
Как удалить ненужный объект с уже сгенерированного изображения?
Используйте функцию «ластик» на сайте Fusion Brain. Выделите область с ненужным объектом, затем напишите в промпте, что должно быть на его месте. Нейросеть дорисует область с учётом освещения и перспективы.