Skip to main content

Blog

Omnihuman 1.5 API गाइड: ByteDance के AI ह्यूमन वीडियो मॉडल का उपयोग कैसे करें

Omnihuman 1.5 API गाइड: ByteDance के AI ह्यूमन वीडियो मॉडल का उपयोग कैसे करें

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API

Omnihuman 1.5 क्या है

Omnihuman 1.5 ByteDance द्वारा विकसित एक AI मॉडल है जो टेक्स्ट, इमेज या ऑडियो जैसे इनपुट से यथार्थवादी मानव वीडियो बनाने पर फोकस करता है।

यह मॉडल प्राकृतिक चेहरे की अभिव्यक्तियों, शरीर की गति और भाषण का अनुकरण करने के लिए बनाया गया है, जो इसे टॉकिंग अवतार, प्रेज़ेंटर और मानव-केंद्रित वीडियो कंटेंट बनाने के लिए उपयुक्त बनाता है। अधिक सामान्य वीडियो मॉडल की तुलना में, Omnihuman 1.5 मानव यथार्थवाद पर अधिक जोर देता है, विशेष रूप से लिप-सिंक सटीकता और अभिव्यक्ति संगति में।

Omnihuman API

Omnihuman 1.5 API गाइड

Omnihuman 1.5 API

Omnihuman 1.5 API का उपयोग एक सरल स्ट्रक्चर्ड फ्लो का पालन करता है:

1. कैरेक्टर के लिए एक रेफरेंस इमेज प्रदान करें

2. भाषण या गायन के लिए एक ऑडियो फ़ाइल अपलोड करें

3. सीन और व्यवहार का वर्णन करने वाला एक प्रॉम्प्ट परिभाषित करें

4. API को रिक्वेस्ट भेजें

5. जनरेटेड वीडियो आउटपुट प्राप्त करें

चूंकि सभी तीन इनपुट आवश्यक हैं, परिणाम की गुणवत्ता इस बात पर निर्भर करती है कि वे कितनी अच्छी तरह अलाइन हैं। एक स्पष्ट प्रॉम्प्ट, उपयुक्त ऑडियो और एक सुसंगत रेफरेंस इमेज अधिक यथार्थवादी आउटपुट उत्पन्न करेंगे।

Omnihuman 1.5 की मुख्य विशेषताएं

Omnihuman 1.5 इमेज, ऑडियो और प्रॉम्प्ट इनपुट को मिलाकर यथार्थवादी मानव वीडियो जनरेशन पर फोकस करता है। मॉडल को जनरेटेड वीडियो में प्राकृतिक दिखने वाली गति और सुसंगत मानव व्यवहार उत्पन्न करने के लिए डिज़ाइन किया गया है।

मल्टी-इनपुट जनरेशन (इमेज + ऑडियो + प्रॉम्प्ट)

मॉडल को एक रेफरेंस इमेज, ऑडियो और प्रॉम्प्ट की आवश्यकता होती है, जो कैरेक्टर आइडेंटिटी, आवाज़ और सीन व्यवहार पर बेहतर नियंत्रण की अनुमति देता है। यह स्ट्रक्चर्ड दृष्टिकोण प्रॉम्प्ट-ओनली जनरेशन की तुलना में संगति में सुधार करता है।

यथार्थवादी चेहरे की अभिव्यक्तियां

Omnihuman 1.5 विस्तृत चेहरे की गतिविधियां उत्पन्न करता है जो भाषण और भावना के साथ अलाइन होती हैं, जिससे आउटपुट अधिक जीवंत लगते हैं।

सटीक लिप-सिंक अलाइनमेंट

ऑडियो को कोर इनपुट के रूप में उपयोग करके, मॉडल भाषण या गायन के साथ मुंह की गतिविधियों को निकटता से सिंक्रनाइज़ करने में सक्षम है।

प्राकृतिक शरीर की गति

मॉडल सूक्ष्म हावभाव और शरीर की गति उत्पन्न करता है जो ऑडियो इनपुट के टोन और पेसिंग से मेल खाते हैं।

सुसंगत कैरेक्टर आइडेंटिटी

रेफरेंस इमेज का उपयोग यह सुनिश्चित करता है कि जनरेटेड मानव पूरे वीडियो में दृश्य रूप से सुसंगत रहे।

Omnihuman 1.5 प्राइसिंग

Omnihuman 1.5 API

$0.13 per second (based on input audio length)

इसका मतलब है कि कुल लागत सीधे जनरेटेड वीडियो की लंबाई के साथ स्केल होती है। उदाहरण के लिए, लंबे भाषण या संगीत इनपुट के परिणामस्वरूप उच्च जनरेशन लागत होगी, जबकि छोटे क्लिप अपेक्षाकृत किफायती रहते हैं।

PiAPI Omnihuman API documentation.

उदाहरण 1: DJ परफॉर्मेंस (संगीत + रिदम)

A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Input Photo
Input Photo

Evaluation:

Don Toliver के ट्रैक "Lose My Mind" का उपयोग करते हुए, आउटपुट मूवमेंट और रिदम के बीच मजबूत अलाइनमेंट दिखाता है, प्राकृतिक शरीर की गति के साथ जो संगीत का अच्छी तरह अनुसरण करती है। लिप-सिंक सटीकता आमतौर पर लगभग 85% पर ठोस है, अधिकांश चेहरे की गतिविधियां ऑडियो से विश्वसनीय रूप से मेल खाती हैं। परफॉर्मेंस के दौरान हाथ की इंटरैक्शन स्थिर और यथार्थवादी दिखाई देती हैं। मामूली विज़ुअल आर्टिफैक्ट अभी भी हो सकते हैं, जैसे सोर्स इमेज के एलिमेंट्स गलत तरीके से इन-फ्रेम दिखाई देना, लेकिन कुल मिलाकर परिणाम संगीत-संचालित कंटेंट के लिए साफ और आकर्षक रहता है।

उदाहरण 2: पॉडकास्ट स्टाइल (प्रेरणादायक भाषण)

Prompt:

A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Image Input
Image Input

Evaluation:

एक प्रेरणादायक पॉडकास्ट-स्टाइल ऑडियो का उपयोग करते हुए, आउटपुट पूरे सीक्वेंस में मजबूत कैरेक्टर संगति और स्थिर फेशियल एनीमेशन दिखाता है। सूक्ष्म जबड़े की गति और आंखों की अभिव्यक्तियां भाषण के टोन के साथ अच्छी तरह अलाइन होती हैं, जिससे डिलीवरी प्राकृतिक और आकर्षक लगती है। हावभाव ऑडियो के साथ सिंक्रनाइज़ हैं और नियंत्रित रहते हैं, जो समग्र यथार्थवाद में योगदान करते हैं। ऑब्जेक्ट के पास हाथ की गति के दौरान थोड़ी धुंधलापन जैसी मामूली समस्याएं हो सकती हैं, लेकिन कुल मिलाकर आउटपुट दृश्य रूप से स्थिर रहता है और बातचीत और कथन-आधारित कंटेंट के लिए अच्छी तरह उपयुक्त है।

निष्कर्ष

Omnihuman 1.5 यथार्थवादी AI मानव वीडियो बनाने में मजबूत क्षमता प्रदर्शित करता है, विशेष रूप से इमेज, ऑडियो और प्रॉम्प्ट इनपुट के स्ट्रक्चर्ड उपयोग के माध्यम से। उदाहरण दिखाते हैं कि मॉडल डायनेमिक परिदृश्यों में अच्छा प्रदर्शन करता है, जैसे संगीत-संचालित कंटेंट, और अधिक नियंत्रित उपयोग मामलों में जैसे बातचीत या पॉडकास्ट-स्टाइल वीडियो।

संयुक्त इनपुट की आवश्यकता कैरेक्टर संगति, भाषण अलाइनमेंट और समग्र यथार्थवाद पर बेहतर नियंत्रण की अनुमति देती है। हालांकि, आउटपुट गुणवत्ता अभी भी इस बात पर निर्भर करती है कि ये इनपुट कितनी अच्छी तरह तैयार किए गए हैं, अधिक जटिल परिस्थितियों में मामूली आर्टिफैक्ट या असंगतियां दिखाई दे सकती हैं।

कुल मिलाकर, Omnihuman 1.5 API स्केलेबल वीडियो जनरेशन वर्कफ़्लो के लिए अच्छी तरह उपयुक्त है, विशेष रूप से कंटेंट क्रिएशन, मार्केटिंग और डिजिटल मीडिया जैसे एप्लिकेशन के लिए। जो टीमें स्पष्ट इनपुट स्ट्रक्चर और उपयोग मामले के अलाइनमेंट पर फोकस करती हैं, वे अधिक विश्वसनीय और प्रोडक्शन-रेडी परिणाम प्राप्त करने में सक्षम होंगी।

Omnihuman 1.5 PiAPI today!

Sign up