Skip to main content

Blog

Omnihuman 1.5 API ガイド: ByteDanceのAI人物動画モデルの使い方

Omnihuman 1.5 API ガイド: ByteDanceのAI人物動画モデルの使い方

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API

Omnihuman 1.5とは

Omnihuman 1.5は、テキスト、画像、音声などの入力からリアルな人物動画を生成することに焦点を当てたByteDance開発のAIモデルです。

このモデルは、自然な表情、身体の動き、音声をシミュレートするように構築されており、トーキングアバター、プレゼンター、人物中心の動画コンテンツの作成に適しています。より汎用的な動画モデルと比較して、Omnihuman 1.5は人物のリアリズム、特にリップシンクの精度と表情の一貫性により重点を置いています。

Omnihuman API

Omnihuman 1.5 API ガイド

Omnihuman 1.5 API

Omnihuman 1.5 APIの使用は、シンプルな構造化されたフローに従います:

1. キャラクターの参照画像を提供する

2. 音声または歌唱用の音声ファイルをアップロードする

3. シーンと行動を説明するプロンプトを定義する

4. APIにリクエストを送信する

5. 生成された動画出力を取得する

3つの入力すべてが必須であるため、結果の品質はそれらがどれだけうまく整合しているかに依存します。明確なプロンプト、適切な音声、一貫した参照画像がより現実的な出力を生み出します。

Omnihuman 1.5の主要機能

Omnihuman 1.5は、画像、音声、プロンプト入力を組み合わせることで、リアルな人物動画生成に焦点を当てています。このモデルは、生成された動画全体で自然に見える動きと一貫した人物の行動を生成するように設計されています。

マルチ入力生成(画像 + 音声 + プロンプト)

モデルは参照画像、音声、プロンプトを必要とし、キャラクターのアイデンティティ、声、シーンの行動をより適切に制御できます。この構造化されたアプローチにより、プロンプトのみの生成と比較して一貫性が向上します。

リアルな表情

Omnihuman 1.5は、音声と感情に合わせた詳細な表情の動きを生成し、出力をより生き生きとさせます。

正確なリップシンク

音声をコア入力として使用することで、モデルは口の動きを音声や歌唱と密接に同期させることができます。

自然な身体の動き

モデルは、音声入力のトーンとペーシングに合った微妙なジェスチャーと身体の動きを生成します。

一貫したキャラクターアイデンティティ

参照画像を使用することで、生成された人物が動画全体で視覚的に一貫したままであることが保証されます。

Omnihuman 1.5の価格

Omnihuman 1.5 API

$0.13 per second (based on input audio length)

これは、総コストが生成された動画の長さに直接比例することを意味します。例えば、長い音声や音楽入力は高い生成コストになりますが、短いクリップは比較的手頃な価格のままです。

PiAPI Omnihuman API documentation.

例1:DJパフォーマンス(音楽 + リズム)

A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Input Photo
Input Photo

Evaluation:

Don Toliverの「Lose My Mind」を使用して、出力は動きとリズムの間に強い整合性を示し、音楽によく追従する自然な身体の動きがあります。リップシンクの精度は一般的に約85%で堅実であり、ほとんどの表情の動きが音声と説得力を持って一致しています。手のインタラクションはパフォーマンス全体を通じて安定してリアルに見えます。ソース画像の要素がフレーム内で正しく表示されないなど、軽微な視覚的アーティファクトがまだ発生する可能性がありますが、全体的に結果は音楽駆動のコンテンツに対してクリーンで魅力的なままです。

例2:ポッドキャストスタイル(モチベーショナルスピーチ)

Prompt:

A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Image Input
Image Input

Evaluation:

モチベーショナルなポッドキャストスタイルの音声を使用して、出力はシーケンス全体を通じて強いキャラクターの一貫性と安定した表情アニメーションを示しています。微妙な顎の動きと目の表情がスピーチのトーンとよく合っており、デリバリーが自然で魅力的に感じられます。ジェスチャーは音声と同期しており、コントロールされたままで、全体的なリアリズムを高めています。オブジェクト近くでの手の動きの際のわずかなぼかしなどの軽微な問題が発生する可能性がありますが、全体的に出力は視覚的に安定しており、会話やナレーションベースのコンテンツに適しています。

結論

Omnihuman 1.5は、特に画像、音声、プロンプト入力の構造化された使用を通じて、リアルなAI人物動画の生成において強力な能力を示しています。例では、モデルが音楽駆動のコンテンツなどの動的なシナリオと、会話やポッドキャストスタイルの動画などのより制御されたユースケースの両方でうまく機能することを示しています。

組み合わせ入力の要件により、キャラクターの一貫性、音声のアライメント、全体的なリアリズムをより適切に制御できます。ただし、出力品質はこれらの入力がどれだけうまく準備されているかに依存しており、より複雑な状況では軽微なアーティファクトや不一致が現れる可能性があります。

全体的に、Omnihuman 1.5 APIは、特にコンテンツ作成、マーケティング、デジタルメディアなどのアプリケーションに対して、スケーラブルな動画生成ワークフローに適しています。明確な入力構造とユースケースのアライメントに焦点を当てるチームは、より信頼性が高く本番環境に対応した結果を達成できるでしょう。

Omnihuman 1.5 PiAPI today!

Sign up