Skip to main content

Blog

Guide de l'API Omnihuman 1.5 : Comment Utiliser le Modèle Vidéo IA Humain de ByteDance

Guide de l'API Omnihuman 1.5 : Comment Utiliser le Modèle Vidéo IA Humain de ByteDance

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API

Qu'est-ce qu'Omnihuman 1.5 ?

Omnihuman 1.5 est un modèle d'IA développé par ByteDance qui se concentre sur la génération de vidéos humaines réalistes à partir d'entrées telles que du texte, des images ou de l'audio.

Le modèle est conçu pour simuler des expressions faciales naturelles, des mouvements corporels et la parole, ce qui le rend adapté à la création d'avatars parlants, de présentateurs et de contenu vidéo centré sur l'humain. Comparé à des modèles vidéo plus généraux, Omnihuman 1.5 met davantage l'accent sur le réalisme humain, en particulier sur la précision de la synchronisation labiale et la cohérence des expressions.

Omnihuman API

Guide de l'API Omnihuman 1.5

Omnihuman 1.5 API

L'utilisation de l'API Omnihuman 1.5 suit un flux structuré simple :

1. Fournir une image de référence pour le personnage

2. Télécharger un fichier audio pour la parole ou le chant

3. Définir un prompt décrivant la scène et le comportement

4. Envoyer la requête à l'API

5. Récupérer la sortie vidéo générée

Comme les trois entrées sont requises, la qualité du résultat dépend de leur alignement. Un prompt clair, un audio approprié et une image de référence cohérente produiront des sorties plus réalistes.

Fonctionnalités Clés d'Omnihuman 1.5

Omnihuman 1.5 se concentre sur la génération de vidéos humaines réalistes en combinant des entrées d'image, d'audio et de prompt. Le modèle est conçu pour produire des mouvements d'apparence naturelle et un comportement humain cohérent dans les vidéos générées.

Génération Multi-Entrées (Image + Audio + Prompt)

Le modèle nécessite une image de référence, un audio et un prompt, permettant un meilleur contrôle sur l'identité du personnage, la voix et le comportement de la scène. Cette approche structurée améliore la cohérence par rapport à la génération basée uniquement sur le prompt.

Expressions Faciales Réalistes

Omnihuman 1.5 génère des mouvements faciaux détaillés qui s'alignent avec la parole et l'émotion, rendant les sorties plus vivantes.

Alignement Précis de la Synchronisation Labiale

En utilisant l'audio comme entrée principale, le modèle est capable de synchroniser étroitement les mouvements de la bouche avec la parole ou le chant.

Mouvement Corporel Naturel

Le modèle produit des gestes subtils et des mouvements corporels qui correspondent au ton et au rythme de l'entrée audio.

Identité de Personnage Cohérente

L'utilisation d'une image de référence garantit que l'humain généré reste visuellement cohérent tout au long de la vidéo.

Tarification d'Omnihuman 1.5

Omnihuman 1.5 API

$0.13 per second (based on input audio length)

Cela signifie que le coût total évolue directement avec la longueur de la vidéo générée. Par exemple, des entrées vocales ou musicales plus longues entraîneront des coûts de génération plus élevés, tandis que des clips plus courts restent relativement abordables.

PiAPI Omnihuman API documentation.

Exemple 1 : Performance DJ (Musique + Rythme)

Prompt: A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Input Photo
Input Photo

Evaluation:

En utilisant le morceau "Lose My Mind" de Don Toliver, la sortie montre un fort alignement entre le mouvement et le rythme, avec un mouvement corporel naturel qui suit bien la musique. La précision de la synchronisation labiale est généralement solide à environ 85%, avec la plupart des mouvements faciaux correspondant de manière convaincante à l'audio. Les interactions des mains apparaissent stables et réalistes tout au long de la performance. Des artefacts visuels mineurs peuvent encore se produire, comme des éléments de l'image source apparaissant incorrectement dans le cadre, mais globalement le résultat reste propre et engageant pour le contenu musical.

Exemple 2 : Style Podcast (Discours Motivationnel)

Prompt:

Prompt: A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Image Input
Image Input

Evaluation:

En utilisant un audio de style podcast motivationnel, la sortie montre une forte cohérence du personnage et une animation faciale stable tout au long de la séquence. Les mouvements subtils de la mâchoire et les expressions des yeux s'alignent bien avec le ton du discours, rendant la livraison naturelle et engageante. Les gestes sont synchronisés avec l'audio et restent contrôlés, ajoutant au réalisme général. Des problèmes mineurs comme un léger flou lors du mouvement de la main près d'objets peuvent se produire, mais globalement la sortie reste visuellement stable et bien adaptée au contenu conversationnel et narratif.

Conclusion

Omnihuman 1.5 démontre une forte capacité dans la génération de vidéos IA humaines réalistes, particulièrement grâce à son utilisation structurée des entrées d'image, d'audio et de prompt. Les exemples montrent que le modèle fonctionne bien à la fois dans des scénarios dynamiques, comme le contenu musical, et dans des cas d'utilisation plus contrôlés comme les vidéos conversationnelles ou de style podcast.

L'exigence d'entrées combinées permet un meilleur contrôle sur la cohérence du personnage, l'alignement de la parole et le réalisme global. Cependant, la qualité de sortie dépend toujours de la façon dont ces entrées sont préparées, avec des artefacts mineurs ou des incohérences apparaissant dans des situations plus complexes.

Dans l'ensemble, l'API Omnihuman 1.5 est bien adaptée aux flux de travail de génération vidéo évolutifs, en particulier pour des applications telles que la création de contenu, le marketing et les médias numériques. Les équipes qui se concentrent sur une structure d'entrée claire et un alignement des cas d'utilisation seront en mesure d'obtenir des résultats plus fiables et prêts pour la production.

Omnihuman 1.5 PiAPI today!

Sign up