Skip to main content

Blog

Руководство по API Omnihuman 1.5: Как Использовать ИИ-модель Человеческого Видео от ByteDance

Руководство по API Omnihuman 1.5: Как Использовать ИИ-модель Человеческого Видео от ByteDance

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API

Что такое Omnihuman 1.5?

Omnihuman 1.5 — это ИИ-модель, разработанная ByteDance, которая фокусируется на генерации реалистичных человеческих видео из входных данных, таких как текст, изображения или аудио.

Модель создана для симуляции естественных выражений лица, движений тела и речи, что делает её подходящей для создания говорящих аватаров, ведущих и видеоконтента, ориентированного на людей. По сравнению с более общими видеомоделями, Omnihuman 1.5 уделяет больше внимания человеческому реализму, особенно точности синхронизации губ и согласованности выражений.

Omnihuman API

Руководство по API Omnihuman 1.5

Omnihuman 1.5 API

Использование API Omnihuman 1.5 следует простому структурированному потоку:

1. Предоставьте референсное изображение для персонажа

2. Загрузите аудиофайл для речи или пения

3. Определите промпт, описывающий сцену и поведение

4. Отправьте запрос в API

5. Получите сгенерированный видеовыход

Поскольку все три входных данных обязательны, качество результата зависит от того, насколько хорошо они согласованы. Чёткий промпт, подходящее аудио и согласованное референсное изображение дадут более реалистичные результаты.

Ключевые функции Omnihuman 1.5

Omnihuman 1.5 фокусируется на реалистичной генерации человеческого видео путём комбинирования входных данных изображения, аудио и промпта. Модель разработана для создания естественно выглядящих движений и согласованного человеческого поведения в сгенерированных видео.

Мультивходная генерация (Изображение + Аудио + Промпт)

Модель требует референсное изображение, аудио и промпт, что позволяет лучше контролировать идентичность персонажа, голос и поведение сцены. Этот структурированный подход улучшает согласованность по сравнению с генерацией только по промпту.

Реалистичные выражения лица

Omnihuman 1.5 генерирует детальные движения лица, которые соответствуют речи и эмоциям, делая результаты более реалистичными.

Точная синхронизация губ

Используя аудио в качестве основного входа, модель способна тесно синхронизировать движения рта с речью или пением.

Естественные движения тела

Модель производит тонкие жесты и движения тела, которые соответствуют тону и темпу аудиовхода.

Согласованная идентичность персонажа

Использование референсного изображения гарантирует, что сгенерированный человек остаётся визуально согласованным на протяжении всего видео.

Цены на Omnihuman 1.5

Omnihuman 1.5 API

$0.13 per second (based on input audio length)

Это означает, что общая стоимость напрямую масштабируется с длиной сгенерированного видео. Например, более длинные речевые или музыкальные входы приведут к более высоким затратам на генерацию, в то время как короткие клипы остаются относительно доступными.

PiAPI Omnihuman API documentation.

Пример 1: Выступление диджея (Музыка + Ритм)

Prompt: A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Input Photo
Input Photo

Evaluation:

Используя трек "Lose My Mind" от Don Toliver, выход показывает сильное соответствие между движением и ритмом, с естественным движением тела, которое хорошо следует за музыкой. Точность синхронизации губ в целом надёжная на уровне около 85%, большинство движений лица убедительно соответствуют аудио. Взаимодействия рук выглядят стабильными и реалистичными на протяжении всего выступления. Могут возникать незначительные визуальные артефакты, например, элементы исходного изображения неправильно появляющиеся в кадре, но в целом результат остаётся чистым и привлекательным для музыкального контента.

Пример 2: Стиль подкаста (Мотивационная речь)

Prompt:

Prompt: A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Image Input
Image Input

Evaluation:

Используя мотивационное аудио в стиле подкаста, выход показывает сильную согласованность персонажа и стабильную лицевую анимацию на протяжении всей последовательности. Тонкие движения челюсти и выражения глаз хорошо соответствуют тону речи, делая подачу естественной и увлекательной. Жесты синхронизированы с аудио и остаются контролируемыми, добавляя общего реализма. Могут возникать незначительные проблемы, такие как лёгкое размытие при движении руки возле объектов, но в целом выход остаётся визуально стабильным и хорошо подходит для разговорного и повествовательного контента.

Заключение

Omnihuman 1.5 демонстрирует сильные возможности в генерации реалистичных ИИ-видео с людьми, особенно благодаря структурированному использованию входных данных изображения, аудио и промпта. Примеры показывают, что модель хорошо работает как в динамичных сценариях, таких как музыкальный контент, так и в более контролируемых случаях использования, таких как разговорные видео или видео в стиле подкаста.

Требование комбинированных входных данных позволяет лучше контролировать согласованность персонажа, синхронизацию речи и общий реализм. Однако качество выхода всё ещё зависит от того, насколько хорошо подготовлены эти входные данные, при этом в более сложных ситуациях могут появляться незначительные артефакты или несогласованности.

В целом, API Omnihuman 1.5 хорошо подходит для масштабируемых рабочих процессов генерации видео, особенно для таких приложений, как создание контента, маркетинг и цифровые медиа. Команды, которые фокусируются на чёткой структуре входных данных и соответствии вариантам использования, смогут достичь более надёжных и готовых к производству результатов.

Omnihuman 1.5 PiAPI today!

Sign up