Skip to main content

Blog

Посібник API Omnihuman 1.5: Як Використовувати AI Модель Людського Відео від ByteDance

Посібник API Omnihuman 1.5: Як Використовувати AI Модель Людського Відео від ByteDance

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API

Що таке Omnihuman 1.5

Omnihuman 1.5 — це AI модель, розроблена ByteDance, яка фокусується на генерації реалістичних людських відео з вхідних даних, таких як текст, зображення або аудіо.

Модель побудована для симуляції природних виразів обличчя, рухів тіла та мовлення, що робить її придатною для створення говорящих аватарів, ведучих та людиноцентричного відеоконтенту. Порівняно з більш загальними відеомоделями, Omnihuman 1.5 приділяє більше уваги людському реалізму, особливо в точності синхронізації губ та послідовності виразів.

Omnihuman API

Посібник API Omnihuman 1.5

Omnihuman 1.5 API

Використання API Omnihuman 1.5 слідує простому структурованому потоку:

1. Надайте референсне зображення для персонажа

2. Завантажте аудіофайл для мовлення або співу

3. Визначте промпт, що описує сцену та поведінку

4. Надішліть запит до API

5. Отримайте згенерований відеовихід

Оскільки всі три вхідні дані є обов'язковими, якість результату залежить від того, наскільки добре вони узгоджені. Чіткий промпт, відповідне аудіо та послідовне референсне зображення створять більш реалістичні результати.

Ключові Функції Omnihuman 1.5

Omnihuman 1.5 фокусується на реалістичній генерації людських відео, комбінуючи вхідні дані зображення, аудіо та промпту. Модель розроблена для створення природно виглядаючого руху та послідовної людської поведінки у згенерованих відео.

Мульти-вхідна Генерація (Зображення + Аудіо + Промпт)

Модель вимагає референсного зображення, аудіо та промпту, що забезпечує кращий контроль над ідентичністю персонажа, голосом та поведінкою сцени. Цей структурований підхід покращує послідовність порівняно з генерацією лише за промптом.

Реалістичні Вирази Обличчя

Omnihuman 1.5 генерує детальні рухи обличчя, що узгоджуються з мовленням та емоціями, роблячи результати більш реалістичними.

Точне Вирівнювання Синхронізації Губ

Використовуючи аудіо як основний вхід, модель здатна тісно синхронізувати рухи рота з мовленням або співом.

Природний Рух Тіла

Модель створює тонкі жести та рухи тіла, що відповідають тону та темпу аудіовходу.

Послідовна Ідентичність Персонажа

Використання референсного зображення забезпечує візуальну послідовність згенерованої людини протягом усього відео.

Ціни Omnihuman 1.5

Omnihuman 1.5 API

$0.13 per second (based on input audio length)

Це означає, що загальна вартість масштабується прямо з довжиною згенерованого відео. Наприклад, довші мовленнєві або музичні входи призведуть до вищих витрат на генерацію, тоді як коротші кліпи залишаються відносно доступними.

PiAPI Omnihuman API documentation.

Приклад 1: Виступ DJ (Музика + Ритм)

A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Input Photo
Input Photo

Evaluation:

Використовуючи трек "Lose My Mind" від Don Toliver, результат показує сильне вирівнювання між рухом та ритмом, з природним рухом тіла, що добре слідує за музикою. Точність синхронізації губ загалом солідна на рівні близько 85%, більшість рухів обличчя переконливо відповідають аудіо. Взаємодія рук виглядає стабільною та реалістичною протягом виступу. Незначні візуальні артефакти все ще можуть виникати, наприклад елементи з вихідного зображення, що неправильно з'являються в кадрі, але загалом результат залишається чистим та привабливим для контенту, орієнтованого на музику.

Приклад 2: Стиль Подкасту (Мотиваційна Промова)

Prompt:

A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Image Input
Image Input

Evaluation:

Використовуючи мотиваційне аудіо у стилі подкасту, результат показує сильну послідовність персонажа та стабільну анімацію обличчя протягом всієї послідовності. Тонкий рух щелепи та вирази очей добре узгоджуються з тоном промови, роблячи подачу природною та привабливою. Жести синхронізовані з аудіо та залишаються контрольованими, додаючи до загального реалізму. Незначні проблеми, такі як легке розмиття під час руху рук біля об'єктів, можуть виникати, але загалом результат залишається візуально стабільним та добре підходить для розмовного та наративного контенту.

Висновок

Omnihuman 1.5 демонструє сильну здатність у генерації реалістичних AI відео з людьми, особливо через структуроване використання вхідних даних зображення, аудіо та промпту. Приклади показують, що модель добре працює як у динамічних сценаріях, таких як контент, орієнтований на музику, так і в більш контрольованих випадках використання, таких як розмовні відео або відео у стилі подкасту.

Вимога комбінованих вхідних даних дозволяє краще контролювати послідовність персонажа, вирівнювання мовлення та загальний реалізм. Однак якість результату все ще залежить від того, наскільки добре підготовлені ці вхідні дані, з незначними артефактами або невідповідностями, що з'являються в більш складних ситуаціях.

Загалом, API Omnihuman 1.5 добре підходить для масштабованих робочих процесів генерації відео, особливо для таких застосувань, як створення контенту, маркетинг та цифрові медіа. Команди, які фокусуються на чіткій структурі вхідних даних та узгодженні випадків використання, зможуть досягти більш надійних та готових до виробництва результатів.

Omnihuman 1.5 PiAPI today!

Sign up