Omnihuman 1.5 API 指南:如何使用 ByteDance 的 AI 人物影片模型

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
什麼是 Omnihuman 1.5
Omnihuman 1.5 是由 ByteDance 開發的 AI 模型,專注於從文字、圖像或音訊等輸入生成逼真的人物影片。
該模型旨在模擬自然的面部表情、身體動作和語音,使其適合創建說話的虛擬形象、主持人和以人物為中心的影片內容。與更通用的影片模型相比,Omnihuman 1.5 更加強調人物的真實感,特別是在唇形同步準確性和表情一致性方面。
Omnihuman 1.5 API 指南
Omnihuman 1.5 API
使用 Omnihuman 1.5 API 遵循簡單的結構化流程:
1. 提供角色的參考圖像
2. 上傳用於語音或歌唱的音訊檔案
3. 定義描述場景和行為的提示詞
4. 將請求發送到 API
5. 獲取生成的影片輸出
由於這三個輸入都是必需的,結果的品質取決於它們的匹配程度。清晰的提示詞、合適的音訊和一致的參考圖像將產生更逼真的輸出。
Omnihuman 1.5 的主要功能
Omnihuman 1.5 透過組合圖像、音訊和提示詞輸入,專注於逼真的人物影片生成。該模型旨在在生成的影片中產生自然的動作和一致的人物行為。
多輸入生成(圖像 + 音訊 + 提示詞)
該模型需要參考圖像、音訊和提示詞,可以更好地控制角色身份、聲音和場景行為。這種結構化方法比僅使用提示詞的生成提高了一致性。
逼真的面部表情
Omnihuman 1.5 生成與語音和情緒相符的細緻面部動作,使輸出更加生動。
精準的唇形同步
透過使用音訊作為核心輸入,該模型能夠將嘴部動作與語音或歌唱緊密同步。
自然的身體動作
該模型產生與音訊輸入的語調和節奏相匹配的細微手勢和身體動作。
一致的角色身份
使用參考圖像確保生成的人物在整個影片中保持視覺一致性。
Omnihuman 1.5 定價
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
這意味著總成本直接與生成影片的長度成正比。例如,較長的語音或音樂輸入將導致較高的生成成本,而較短的片段則相對實惠。
PiAPI Omnihuman API documentation.
範例 1:DJ 表演(音樂 + 節奏)
Prompt: A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Evaluation:
使用 Don Toliver 的歌曲「Lose My Mind」,輸出顯示動作與節奏之間的強對齊,自然的身體動作很好地跟隨音樂。唇形同步準確度整體約為 85%,大多數面部動作與音訊匹配得很有說服力。手部互動在整個表演中表現穩定且逼真。可能仍會出現輕微的視覺瑕疵,例如來源圖像中的元素在畫面中錯誤出現,但整體結果在音樂驅動的內容中仍然乾淨且引人入勝。
範例 2:播客風格(勵志演講)
Prompt:
Prompt: A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Evaluation:
使用勵志播客風格的音訊,輸出在整個序列中顯示強大的角色一致性和穩定的面部動畫。細微的下巴動作和眼神表情與演講的語調很好地對齊,使演講感覺自然且引人入勝。手勢與音訊同步並保持受控,增加了整體的真實感。可能會出現輕微的問題,例如手部靠近物體移動時輕微模糊,但整體輸出在對話和敘事類內容中保持視覺穩定且非常適合。
結論
Omnihuman 1.5 在生成逼真的 AI 人物影片方面展示了強大的能力,特別是透過其結構化使用圖像、音訊和提示詞輸入。範例顯示該模型在動態場景(如音樂驅動的內容)和更受控的用例(如對話或播客風格的影片)中都表現良好。
對組合輸入的要求允許更好地控制角色一致性、語音對齊和整體真實感。然而,輸出品質仍然取決於這些輸入的準備程度,在更複雜的情況下可能會出現輕微的瑕疵或不一致。
總體而言,Omnihuman 1.5 API 非常適合可擴展的影片生成工作流程,特別是用於內容創作、行銷和數位媒體等應用。專注於清晰的輸入結構和用例對齊的團隊將能夠獲得更可靠和可投入生產的結果。
Omnihuman 1.5 PiAPI today!



