Omnihuman 1.5 API 指南: 如何使用字节跳动的 AI 人物视频模型

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
什么是 Omnihuman 1.5
Omnihuman 1.5 是字节跳动开发的 AI 模型,专注于从文本、图像或音频等输入生成逼真的人物视频。
该模型旨在模拟自然的面部表情、身体动作和语音,使其适合创建会说话的虚拟形象、主持人和以人物为中心的视频内容。与更通用的视频模型相比,Omnihuman 1.5 更加强调人物的真实性,特别是在唇形同步准确性和表情一致性方面。
Omnihuman 1.5 API 指南
Omnihuman 1.5 API
使用 Omnihuman 1.5 API 遵循简单的结构化流程:
1. 提供角色的参考图像
2. 上传用于语音或唱歌的音频文件
3. 定义描述场景和行为的提示词
4. 向 API 发送请求
5. 获取生成的视频输出
由于所有三个输入都是必需的,结果的质量取决于它们的配合程度。清晰的提示词、合适的音频和一致的参考图像将产生更逼真的输出。
Omnihuman 1.5 核心功能
Omnihuman 1.5 通过结合图像、音频和提示词输入,专注于逼真的人物视频生成。该模型旨在生成自然的动作和一致的人物行为。
多输入生成(图像 + 音频 + 提示词)
该模型需要参考图像、音频和提示词,从而更好地控制角色身份、声音和场景行为。这种结构化方法比仅使用提示词的生成方式具有更好的一致性。
逼真的面部表情
Omnihuman 1.5 生成与语音和情感相匹配的精细面部动作,使输出更加逼真。
精准的唇形同步
通过将音频作为核心输入,该模型能够使嘴部动作与语音或唱歌紧密同步。
自然的身体动作
该模型产生与音频输入的语调和节奏相匹配的微妙手势和身体动作。
一致的角色身份
使用参考图像确保生成的人物在整个视频中保持视觉一致性。
Omnihuman 1.5 定价
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
这意味着总成本与生成视频的长度直接相关。例如,较长的语音或音乐输入将产生较高的生成成本,而较短的片段则相对实惠。
PiAPI Omnihuman API documentation.
示例 1:DJ 表演(音乐 + 节奏)
A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Evaluation:
使用 Don Toliver 的歌曲《Lose My Mind》,输出显示动作与节奏之间有很强的对齐,自然的身体动作很好地跟随音乐。唇形同步准确度通常在 85% 左右,大多数面部动作与音频匹配得令人信服。手部交互在整个表演过程中显得稳定且真实。可能仍会出现轻微的视觉伪影,例如源图像中的元素在画面中显示不正确,但总体而言,对于音乐驱动的内容,结果仍然干净且引人入胜。
示例 2:播客风格(励志演讲)
Prompt:
A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Evaluation:
使用励志播客风格的音频,输出显示出很强的角色一致性和整个序列中稳定的面部动画。微妙的下巴动作和眼神表情与演讲的语调很好地对齐,使表达感觉自然且引人入胜。手势与音频同步并保持可控,增加了整体的真实感。可能会出现轻微问题,例如手部在物体附近移动时出现轻微模糊,但总体而言,输出视觉上稳定,非常适合对话和叙述类内容。
结论
Omnihuman 1.5 在生成逼真的 AI 人物视频方面展现了强大的能力,特别是通过其对图像、音频和提示词输入的结构化使用。示例表明,该模型在动态场景(如音乐驱动的内容)和更可控的用例(如对话或播客风格的视频)中都表现良好。
对组合输入的要求允许更好地控制角色一致性、语音对齐和整体真实感。然而,输出质量仍然取决于这些输入的准备程度,在更复杂的情况下可能会出现轻微的伪影或不一致。
总体而言,Omnihuman 1.5 API 非常适合可扩展的视频生成工作流程,特别是对于内容创作、营销和数字媒体等应用。专注于清晰输入结构和用例对齐的团队将能够获得更可靠和可投入生产的结果。
Omnihuman 1.5 PiAPI today!



