AIRstudio

D-ID — видео-аватары и озвучка фото

D-ID в России работает через AIR: нейросеть превращает портрет в говорящего человека — без VPN, с оплатой российской картой.

Бесплатный старт · отмена в один клик

Девушка говорит прямо в камеру, естественная мимика и моргание, офис размыт на заднем плане

D-ID16:9

D-ID и более 80 моделей в одном сервисе

Открыть
  • Adobe Firefly
  • Anthropic
  • Bark
  • Bolt
  • ByteDance
  • Civitai
  • Claude
  • Claude Design
  • Cohere
  • Copilot
  • Cursor
  • D-ID
  • DALL·E
  • DeepSeek
  • Doubao
  • Dream Machine
  • ElevenLabs
  • Flux
  • Freepik
  • Gemini
  • Gemma
  • GitHub Copilot
  • GPT
  • GPT Image
  • Grok
  • Groq
  • Hailuo
  • Haiper
  • Hedra
  • Hunyuan
  • Ideogram
  • Imagen
  • Inflection
  • Kimi
  • Kling
  • Krea
  • Liquid AI
  • Llama
  • Lovable
  • Luma
  • Lyria
  • Manus
  • Meshy
  • Midjourney
  • MiniMax
  • Mistral
  • Moonshot
  • Murf
  • MusicGen
  • n8n
  • Nano Banana
  • NotebookLM
  • OpenAI
  • OpenClaw
  • OpenRouter
  • Perplexity
  • Phi
  • Pika
  • PixVerse
  • Play.ht
  • Qwen
  • Recraft
  • Reka
  • Replit
  • Resemble
  • Reve
  • Runway
  • Seedance
  • Seedream
  • Sora
  • Speechify
  • Stable Audio
  • Stable Diffusion
  • Suno
  • Synthesia
  • Together AI
  • Topaz
  • Tripo
  • Udio
  • v0
  • Veo
  • Vidu
  • Wan
  • Windsurf
  • Yi
  • YuE

Коротко о главном

  • Из фото — говорящий человекЗагружаете портрет и текст: модель синхронизирует губы и мимику с речью, съемка не нужна.
  • Голос свой или синтезированныйМодель озвучит текст сама или подстроит мимику под вашу аудиодорожку.
  • Восемьдесят моделей рядомПерсонажа для аватара можно собрать в соседнем генераторе картинок, не выходя из кабинета.

Что такое D-ID

D-ID — нейросеть формата talking head: она анимирует лицо на статичном портрете и синхронизирует губы с речью.

Липсинк по тексту

Пишете реплику — синтез речи и движение губ идут синхронно.

Свой голос

Загружаете аудиодорожку, модель подстраивает мимику под запись.

Любой портрет

Фотография, иллюстрация или сгенерированный персонаж.

Живая мимика

Оживают брови, взгляд и повороты головы, а не только рот.

Один кадр на входе

Модели хватает статичного портрета, съемка не нужна.

Правка стоит дешево

Смена сценария — это перегенерация, а не новая смена.

D-ID в AIR

Напрямую сервис просит зарубежную карту и уводит расчеты в валюту. В AIR модель открывается после обычной регистрации: интерфейс на русском, оплата картами российских банков, а рядом в каталоге — генераторы изображений, где можно собрать персонажа для будущего аватара.

Компания из Тель-Авива начинала с противоположной задачи
Компания из Тель-Авива начинала с противоположной задачи — прятала лица от систем распознавания, а потом развернула ту же технологию: не защищать лицо от камер, а оживлять его в кадре.
Липсинк по тексту. Пишете реплику
Липсинк по тексту. Пишете реплику — синтез речи и движение губ идут синхронно.
Свой голос
Свой голос. Загружаете аудиодорожку, модель подстраивает мимику под запись.
Любой портрет
Любой портрет. Фотография, иллюстрация или сгенерированный персонаж.
Живая мимика
Живая мимика. Оживают брови, взгляд и повороты головы, а не только рот.
Один кадр на входе
Один кадр на входе. Модели хватает статичного портрета, съемка не нужна.
Правка стоит дешево. Смена сценария
Правка стоит дешево. Смена сценария — это перегенерация, а не новая смена.
Широкой публике технология знакома по MyHeritage
Широкой публике технология знакома по MyHeritage: жанр «оживших фото», где архивный портрет моргает и поворачивает голову, начался именно с разработок D-ID. С тех пор модель доросла до полноценной речи — портрет не просто движется, а читает ваш сценарий. Для курсов и соцсетей это разница между спецэффектом и рабочим инструментом.
Технически модель находит на портрете ключевые
Технически модель находит на портрете ключевые точки лица и ведет их по фонемам речи — поэтому ей хватает одного кадра там, где классической анимации нужен отснятый ролик.
Экономика формата держится на одном факте
Экономика формата держится на одном факте: видео с ведущим больше не требует съемки. Ни студии, ни света, ни дублей — спикер «снимается» из одного фото, а правка сценария стоит как перегенерация, а не как новая смена.
Отдельный плюс для конвейера контента
Отдельный плюс для конвейера контента: аватар не привязан к человеку в штате. Ведущий не уволится, не сменит прическу и не потребует переснять неудачный дубль — образ и голос остаются активом проекта.
Порог входа ниже, чем кажется
Порог входа ниже, чем кажется: монтаж и анимация не нужны. Весь процесс — выбрать портрет, вставить текст, нажать кнопку; сложность спрятана внутри модели, а не вынесена в настройки.

Промпт-гайд для говорящего аватара

Промпт аватара состоит из двух частей: кто в кадре и как он держится. Опишите героя, план съемки и фон — и отдельно дайте текст, который он произносит.

01

Диктор в офисе

Промпт

«Девушка говорит прямо в камеру, естественная мимика и моргание, офис размыт на заднем плане».

Ровный фронтальный план и спокойная подача — базовый кадр для рассылок и лендингов.

02

Эксперт в кадре

Промпт

«Мужчина в очках рассказывает в камеру и слегка жестикулирует, за ним размытый стеллаж с книгами».

Плечевой план с местом под жест; такой кадр читается как экспертное видео, а не как говорящая голова.

03

Ожившее фото

Промпт

«Портрет пожилого мужчины в кресле: он медленно поворачивает голову к камере и моргает».

Минимум движения и максимум узнаваемости — жанр, с которого началась известность технологии.

Диктор в офисе. Промпт
Диктор в офисе. Промпт: «Девушка говорит прямо в камеру, естественная мимика и моргание, офис размыт на заднем плане». Что получится: Ровный фронтальный план и спокойная подача — базовый кадр для рассылок и лендингов.
Эксперт в кадре. Промпт
Эксперт в кадре. Промпт: «Мужчина в очках рассказывает в камеру и слегка жестикулирует, за ним размытый стеллаж с книгами». Что получится: Плечевой план с местом под жест; такой кадр читается как экспертное видео, а не как говорящая голова.
Ожившее фото. Промпт
Ожившее фото. Промпт: «Портрет пожилого мужчины в кресле: он медленно поворачивает голову к камере и моргает». Что получится: Минимум движения и максимум узнаваемости — жанр, с которого началась известность технологии.
Текст реплики
Текст реплики — это сценарий устной речи: пишите так, как говорите вслух, короткими фразами. Знаки препинания управляют паузами, а выбранное обращение — на «вы» или на «ты» — сразу задает тон ролика.

Сценарии использования

Говорящий аватар закрывает задачи, где нужен человек в кадре, а съемка не окупается.

ДоПосле

Обучение и онбординг

Преподаватель из одного фото ведет весь курс: уроки озвучиваются текстом, без студии и расписания смен. Онлайн-школы и HR-команды собирают десятки занятий силами одного методиста.

Реклама и продажи

Персонаж представляет продукт на лендинге, в рассылке или в таргете. Несколько версий сценария готовы за вечер — тест креативов перестает упираться в продакшн и бюджет.

Соцсети и шортсы

Стабильный поток говорящих роликов для Reels, Shorts и VK Клипов: один портрет, разные сценарии. Лицо канала всегда в форме и не зависит от чужого отпуска.

Ожившие архивные фото

Семейный портрет произносит поздравление, а музейный проект дает голос историческим снимкам. Механика, с которой началась известность D-ID, до сих пор стабильно собирает охваты.

Поздравления и личные ролики

Портрет коллеги читает тост на юбилей отдела, а нарисованный маскот компании объявляет о релизе. Это самый короткий путь попробовать формат: один портрет и три предложения текста.

Как начать работать с D-ID в России

Путь от фотографии до говорящего ролика — четыре шага, карта на старте не нужна.

  1. 01
    Продолжить

    Зарегистрируйтесь в AIR

    Хватит email или Яндекс ID — без VPN, иностранного номера и зарубежной карты. Регистрация бесплатная.

  2. 02
    D-ID

    Откройте D-ID в каталоге моделей

    Рядом — генераторы картинок: персонажа для аватара можно собрать тут же, не покидая кабинет.

  3. 03

    Загрузите портрет и добавьте речь

    Текст модель озвучит сама, а свою аудиодорожку синхронизирует по губам. Черновик сценария удобно набросать в чат-модели AIR — окно в соседней вкладке каталога.

  4. 04

    Скачайте ролик

    Видео уходит в монтаж, презентацию или сразу в соцсети; неудачный дубль перегенерируется с уточненным текстом.

Языки и голоса

Озвучка — половина результата, и русский здесь — полноценный рабочий язык, а не перевод по остаточному принципу.

Основные языки
  • Русский
  • Английский
  • Испанский
  • Немецкий
Четверкой список не ограничен
Четверкой список не ограничен: синтез речи покрывает десятки языков, полный перечень открывается в интерфейсе при выборе голоса.
Свой голос тоже в деле: запишите дорожку
Свой голос тоже в деле: запишите дорожку — и модель проговорит ее губами аватара. Так работают бренды, где голос спикера — часть айдентики, и блогеры, которым важна собственная подача.
Отсюда прием для локализации
Отсюда прием для локализации: один портрет озвучивается на нескольких языках, и курс или реклама выходят на новый рынок без кастинга дикторов. Достаточно перевести сценарий — лицо и подача остаются прежними.

Факты и параметры модели

Карточка модели: кто делает D-ID и что подать на вход, чтобы получить живой ролик.

Разработчик
D-ID, Тель-Авив; команда работает с технологиями распознавания и анимации лиц с 2017 года
Специализация
Анимация лица и синхронизация губ с речью — формат talking head
Вход
Один портрет: фото, иллюстрация или сгенерированный персонаж
Речь
Синтез голоса по тексту на десятках языков или собственная аудиодорожка
Результат
Видео, где лицо моргает, двигает головой и проговаривает сценарий
Известный кейс
«Ожившие фото» в MyHeritage — вирусная механика на технологии D-ID
Практический вывод из таблицы
Практический вывод из таблицы: качество ролика задает исходник. Фронтальный портрет с ровным светом дает устойчивый липсинк, а блики на очках, перекрытый подбородок и сильный наклон головы — типичные причины артефактов.
Короткие ролики до минуты
Короткие ролики до минуты — рабочая норма формата: досматриваемость выше, генерация быстрее, а длинный сценарий всегда можно разбить на серию. Актуальные лимиты длительности и разрешения показаны в интерфейсе модели перед запуском.
Если подходящего портрета нет
Если подходящего портрета нет — сгенерируйте его: нейросети картинок в AIR отдают фронтальные лица с чистым светом, которые липсинк любит больше всего, и заодно снимают вопрос прав на изображение. Связка «сгенерировал портрет — оживил — озвучил» целиком живет в одном кабинете.

Сравнение с HeyGen и Synthesia

Три сервиса делают говорящие видео, но заходят с разных сторон — выбор зависит от задачи.

D-ID
HeyGen
Synthesia
Подход
Оживляет один портрет
Цифровой двойник по видеосъемке
Библиотека студийных аватаров
Что на входе
Фото плюс текст или аудио
Запись живого человека
Сценарий под готового аватара
Сильная сторона
Скорость: говорит любой портрет
Реалистичный клон конкретного спикера
Корпоративные курсы под ключ
Доступ из России
Через AIR, без VPN и зарубежной карты
Нужна зарубежная карта
Нужна зарубежная карта
Логика выбора простая
Логика выбора простая: если есть бюджет на продакшн и нужен двойник конкретного человека — смотрите на студийные сервисы. Для потоковых задач — курсов, соцсетей, тестов креативов, поздравлений — D-ID практичнее: любой портрет становится диктором за минуты. Считайте по задаче, а не по тарифу: студийный клон выигрывает в реализме, но проигрывает в скорости запуска и цене входа.
В AIR это сравнение легко провести руками
В AIR это сравнение легко провести руками: рядом с D-ID в каталоге живут видео-модели для других задач, и один сценарий прогоняется через несколько нейросетей за пару часов — без второй подписки и второго счета. Такой тест на собственном материале честнее любого обзора: сразу видно, какая модель попадает в вашу подачу.

AIR отдает D-ID через OpenAI-совместимый эндпоинт: меняете baseURL и ключ — существующий код продолжает работать. Оплата — той же российской картой.

Generations API

Запрос к D-ID через OpenAI-совместимый API

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.air.fail/v1",
  apiKey: process.env.AIR_API_KEY,
});

const video = await client.post("/videos/generations", {
  body: {
    model: "d-id",
    prompt: "Продуктовый ролик: флакон духов на подиуме, медленное вращение",
  },
});

Сколько стоит D-ID в AIR

Тарификация привязана к роликам: длиннее видео и выше параметры — дороже генерация.

Free

0₽ в месяц

Что включено

  • Доступ к D-ID с базовым лимитом генераций
  • Свой кадр или фото на входе
  • Карты привязывать не нужно
  • Русский интерфейс, без VPN

Lite

990 ₽в месяц

Все из Free, плюс

  • Расширенный лимит генераций D-ID
  • Базовый каталог моделей AIR (mini-версии GPT, Claude, Gemini)
  • Генератор изображений в базовом качестве
  • Карта Мир и российский эквайринг

Pro

Оптимальный

2 990 ₽в месяц

Все из Lite, плюс

  • Увеличенные квоты на генерацию в D-ID
  • Полный каталог моделей AIR — GPT, Claude, Gemini, DeepSeek
  • Генераторы изображений, видео и музыки
  • Приоритетная очередь и быстрый отклик

Max

9 990 ₽в месяц

Все из Pro, плюс

  • Большие квоты на тяжелые модели — Sora, Veo, Suno
  • Командный аккаунт до 5 пользователей
  • API-доступ к каталогу для интеграций
  • Приоритетный саппорт
Старт бесплатный
Старт бесплатный: регистрация не требует карты, а актуальные условия бесплатного доступа видны в кабинете.
Подписка открывает весь каталог AIR: вместе с D-ID
Подписка открывает весь каталог AIR: вместе с D-ID — видео, картинки и чат-модели. Оплата картами российских банков, включая Мир.

Частые вопросы

D-ID работает в России?

Да, через AIR: регистрация по email или Яндекс ID, генерация прямо в браузере. Зарубежные платформы, обходные схемы и иностранные номера не участвуют — оплата тоже проходит внутри, российскими картами.

Нужен ли VPN?

Нет. AIR открывается из России напрямую — VPN не нужен ни для генерации, ни для оплаты. Единственное, что понадобится, — браузер и портрет.

Можно ли озвучить аватара на русском?

Да, русская озвучка — штатный режим: пишете текст по-русски, модель читает его естественным голосом. Свою аудиодорожку тоже можно загрузить — губы синхронизируются под запись.

Какое фото подойдет?

Портрет анфас с открытым лицом: фронтальный ракурс, ровный свет, без темных очков. Подходят фотографии, иллюстрации и сгенерированные персонажи — последних удобно собирать в соседних моделях каталога AIR. Если сомневаетесь, прогоните два-три варианта портрета и сравните липсинк на одном тексте.

Можно ли использовать голос конкретного человека?

Аватар говорит той дорожкой, которую вы загрузили, — модель отвечает только за губы и мимику. Используйте голоса, на которые есть право: свой, дикторский по договору или синтезированный.

Это законно — оживлять чужие фото?

Работайте с изображениями, правами на которые располагаете: свои снимки, съемка с разрешением модели, сгенерированные персонажи. Ответственность за исходники несет пользователь — это стандарт для всех подобных сервисов. Для коммерческих проектов надежнее всего сгенерированный персонаж: вопрос чужого лица не возникает вовсе.

Годятся ли ролики для рекламы?

Да, говорящие аватары давно живут в таргете, рассылках и на лендингах. Перед запуском проверьте права на портрет и аудио — остальное решает сценарий. Для теста удобно сгенерировать несколько версий ролика и оставить ту, которую кликают.

Сколько стоит D-ID?

Начать можно бесплатно: регистрация в AIR не требует карты. Дальше — подписка или пакеты генераций; актуальный прайс показан в кабинете, цены в рублях.

D-ID на русском. Без VPN

Попробовать
Попробовать бесплатно