Omnihuman 1.5 API गाइड: ByteDance के AI ह्यूमन वीडियो मॉडल का उपयोग कैसे करें

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
Omnihuman 1.5 क्या है
Omnihuman 1.5 ByteDance द्वारा विकसित एक AI मॉडल है जो टेक्स्ट, इमेज या ऑडियो जैसे इनपुट से यथार्थवादी मानव वीडियो बनाने पर फोकस करता है।
यह मॉडल प्राकृतिक चेहरे की अभिव्यक्तियों, शरीर की गति और भाषण का अनुकरण करने के लिए बनाया गया है, जो इसे टॉकिंग अवतार, प्रेज़ेंटर और मानव-केंद्रित वीडियो कंटेंट बनाने के लिए उपयुक्त बनाता है। अधिक सामान्य वीडियो मॉडल की तुलना में, Omnihuman 1.5 मानव यथार्थवाद पर अधिक जोर देता है, विशेष रूप से लिप-सिंक सटीकता और अभिव्यक्ति संगति में।
Omnihuman 1.5 API गाइड
Omnihuman 1.5 API
Omnihuman 1.5 API का उपयोग एक सरल स्ट्रक्चर्ड फ्लो का पालन करता है:
1. कैरेक्टर के लिए एक रेफरेंस इमेज प्रदान करें
2. भाषण या गायन के लिए एक ऑडियो फ़ाइल अपलोड करें
3. सीन और व्यवहार का वर्णन करने वाला एक प्रॉम्प्ट परिभाषित करें
4. API को रिक्वेस्ट भेजें
5. जनरेटेड वीडियो आउटपुट प्राप्त करें
चूंकि सभी तीन इनपुट आवश्यक हैं, परिणाम की गुणवत्ता इस बात पर निर्भर करती है कि वे कितनी अच्छी तरह अलाइन हैं। एक स्पष्ट प्रॉम्प्ट, उपयुक्त ऑडियो और एक सुसंगत रेफरेंस इमेज अधिक यथार्थवादी आउटपुट उत्पन्न करेंगे।
Omnihuman 1.5 की मुख्य विशेषताएं
Omnihuman 1.5 इमेज, ऑडियो और प्रॉम्प्ट इनपुट को मिलाकर यथार्थवादी मानव वीडियो जनरेशन पर फोकस करता है। मॉडल को जनरेटेड वीडियो में प्राकृतिक दिखने वाली गति और सुसंगत मानव व्यवहार उत्पन्न करने के लिए डिज़ाइन किया गया है।
मल्टी-इनपुट जनरेशन (इमेज + ऑडियो + प्रॉम्प्ट)
मॉडल को एक रेफरेंस इमेज, ऑडियो और प्रॉम्प्ट की आवश्यकता होती है, जो कैरेक्टर आइडेंटिटी, आवाज़ और सीन व्यवहार पर बेहतर नियंत्रण की अनुमति देता है। यह स्ट्रक्चर्ड दृष्टिकोण प्रॉम्प्ट-ओनली जनरेशन की तुलना में संगति में सुधार करता है।
यथार्थवादी चेहरे की अभिव्यक्तियां
Omnihuman 1.5 विस्तृत चेहरे की गतिविधियां उत्पन्न करता है जो भाषण और भावना के साथ अलाइन होती हैं, जिससे आउटपुट अधिक जीवंत लगते हैं।
सटीक लिप-सिंक अलाइनमेंट
ऑडियो को कोर इनपुट के रूप में उपयोग करके, मॉडल भाषण या गायन के साथ मुंह की गतिविधियों को निकटता से सिंक्रनाइज़ करने में सक्षम है।
प्राकृतिक शरीर की गति
मॉडल सूक्ष्म हावभाव और शरीर की गति उत्पन्न करता है जो ऑडियो इनपुट के टोन और पेसिंग से मेल खाते हैं।
सुसंगत कैरेक्टर आइडेंटिटी
रेफरेंस इमेज का उपयोग यह सुनिश्चित करता है कि जनरेटेड मानव पूरे वीडियो में दृश्य रूप से सुसंगत रहे।
Omnihuman 1.5 प्राइसिंग
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
इसका मतलब है कि कुल लागत सीधे जनरेटेड वीडियो की लंबाई के साथ स्केल होती है। उदाहरण के लिए, लंबे भाषण या संगीत इनपुट के परिणामस्वरूप उच्च जनरेशन लागत होगी, जबकि छोटे क्लिप अपेक्षाकृत किफायती रहते हैं।
PiAPI Omnihuman API documentation.
उदाहरण 1: DJ परफॉर्मेंस (संगीत + रिदम)
A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Evaluation:
Don Toliver के ट्रैक "Lose My Mind" का उपयोग करते हुए, आउटपुट मूवमेंट और रिदम के बीच मजबूत अलाइनमेंट दिखाता है, प्राकृतिक शरीर की गति के साथ जो संगीत का अच्छी तरह अनुसरण करती है। लिप-सिंक सटीकता आमतौर पर लगभग 85% पर ठोस है, अधिकांश चेहरे की गतिविधियां ऑडियो से विश्वसनीय रूप से मेल खाती हैं। परफॉर्मेंस के दौरान हाथ की इंटरैक्शन स्थिर और यथार्थवादी दिखाई देती हैं। मामूली विज़ुअल आर्टिफैक्ट अभी भी हो सकते हैं, जैसे सोर्स इमेज के एलिमेंट्स गलत तरीके से इन-फ्रेम दिखाई देना, लेकिन कुल मिलाकर परिणाम संगीत-संचालित कंटेंट के लिए साफ और आकर्षक रहता है।
उदाहरण 2: पॉडकास्ट स्टाइल (प्रेरणादायक भाषण)
Prompt:
A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Evaluation:
एक प्रेरणादायक पॉडकास्ट-स्टाइल ऑडियो का उपयोग करते हुए, आउटपुट पूरे सीक्वेंस में मजबूत कैरेक्टर संगति और स्थिर फेशियल एनीमेशन दिखाता है। सूक्ष्म जबड़े की गति और आंखों की अभिव्यक्तियां भाषण के टोन के साथ अच्छी तरह अलाइन होती हैं, जिससे डिलीवरी प्राकृतिक और आकर्षक लगती है। हावभाव ऑडियो के साथ सिंक्रनाइज़ हैं और नियंत्रित रहते हैं, जो समग्र यथार्थवाद में योगदान करते हैं। ऑब्जेक्ट के पास हाथ की गति के दौरान थोड़ी धुंधलापन जैसी मामूली समस्याएं हो सकती हैं, लेकिन कुल मिलाकर आउटपुट दृश्य रूप से स्थिर रहता है और बातचीत और कथन-आधारित कंटेंट के लिए अच्छी तरह उपयुक्त है।
निष्कर्ष
Omnihuman 1.5 यथार्थवादी AI मानव वीडियो बनाने में मजबूत क्षमता प्रदर्शित करता है, विशेष रूप से इमेज, ऑडियो और प्रॉम्प्ट इनपुट के स्ट्रक्चर्ड उपयोग के माध्यम से। उदाहरण दिखाते हैं कि मॉडल डायनेमिक परिदृश्यों में अच्छा प्रदर्शन करता है, जैसे संगीत-संचालित कंटेंट, और अधिक नियंत्रित उपयोग मामलों में जैसे बातचीत या पॉडकास्ट-स्टाइल वीडियो।
संयुक्त इनपुट की आवश्यकता कैरेक्टर संगति, भाषण अलाइनमेंट और समग्र यथार्थवाद पर बेहतर नियंत्रण की अनुमति देती है। हालांकि, आउटपुट गुणवत्ता अभी भी इस बात पर निर्भर करती है कि ये इनपुट कितनी अच्छी तरह तैयार किए गए हैं, अधिक जटिल परिस्थितियों में मामूली आर्टिफैक्ट या असंगतियां दिखाई दे सकती हैं।
कुल मिलाकर, Omnihuman 1.5 API स्केलेबल वीडियो जनरेशन वर्कफ़्लो के लिए अच्छी तरह उपयुक्त है, विशेष रूप से कंटेंट क्रिएशन, मार्केटिंग और डिजिटल मीडिया जैसे एप्लिकेशन के लिए। जो टीमें स्पष्ट इनपुट स्ट्रक्चर और उपयोग मामले के अलाइनमेंट पर फोकस करती हैं, वे अधिक विश्वसनीय और प्रोडक्शन-रेडी परिणाम प्राप्त करने में सक्षम होंगी।
Omnihuman 1.5 PiAPI today!



