دليل واجهة برمجة تطبيقات Omnihuman 1.5: كيفية استخدام نموذج الفيديو البشري بالذكاء الاصطناعي من ByteDance

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
ما هو Omnihuman 1.5؟
Omnihuman 1.5 هو نموذج ذكاء اصطناعي طورته ByteDance يركز على توليد فيديوهات بشرية واقعية من مدخلات مثل النص أو الصور أو الصوت.
تم بناء النموذج لمحاكاة تعبيرات الوجه الطبيعية وحركة الجسم والكلام، مما يجعله مناسبًا لإنشاء صور رمزية ناطقة ومقدمين ومحتوى فيديو يركز على البشر. مقارنة بنماذج الفيديو الأكثر عمومية، يضع Omnihuman 1.5 تركيزًا أكبر على الواقعية البشرية، خاصة في دقة مزامنة الشفاه واتساق التعبيرات.
دليل واجهة برمجة تطبيقات Omnihuman 1.5
Omnihuman 1.5 API
يتبع استخدام واجهة برمجة تطبيقات Omnihuman 1.5 تدفقًا منظمًا بسيطًا:
1. توفير صورة مرجعية للشخصية
2. تحميل ملف صوتي للكلام أو الغناء
3. تحديد موجه يصف المشهد والسلوك
4. إرسال الطلب إلى واجهة برمجة التطبيقات
5. استرداد مخرجات الفيديو المولدة
نظرًا لأن جميع المدخلات الثلاثة مطلوبة، تعتمد جودة النتيجة على مدى توافقها. سينتج الموجه الواضح والصوت المناسب والصورة المرجعية المتسقة مخرجات أكثر واقعية.
الميزات الرئيسية لـ Omnihuman 1.5
يركز Omnihuman 1.5 على توليد فيديو بشري واقعي من خلال الجمع بين مدخلات الصورة والصوت والموجه. تم تصميم النموذج لإنتاج حركة طبيعية المظهر وسلوك بشري متسق عبر مقاطع الفيديو المولدة.
توليد متعدد المدخلات (صورة + صوت + موجه)
يتطلب النموذج صورة مرجعية وصوتًا وموجهًا، مما يتيح تحكمًا أفضل في هوية الشخصية والصوت وسلوك المشهد. يحسن هذا النهج المنظم الاتساق مقارنة بالتوليد بالموجه فقط.
تعبيرات وجه واقعية
ينتج Omnihuman 1.5 حركات وجه مفصلة تتوافق مع الكلام والعاطفة، مما يجعل المخرجات تبدو أكثر واقعية.
محاذاة دقيقة لمزامنة الشفاه
باستخدام الصوت كمدخل أساسي، يستطيع النموذج مزامنة حركات الفم بشكل وثيق مع الكلام أو الغناء.
حركة جسم طبيعية
ينتج النموذج إيماءات دقيقة وحركة جسم تتوافق مع نبرة وإيقاع مدخل الصوت.
هوية شخصية متسقة
يضمن استخدام صورة مرجعية أن يظل الإنسان المولد متسقًا بصريًا طوال الفيديو.
تسعير Omnihuman 1.5
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
هذا يعني أن التكلفة الإجمالية تتناسب مباشرة مع طول الفيديو المولد. على سبيل المثال، ستؤدي مدخلات الكلام أو الموسيقى الأطول إلى تكاليف توليد أعلى، بينما تظل المقاطع الأقصر ميسورة التكلفة نسبيًا.
PiAPI Omnihuman API documentation.
مثال 1: أداء DJ (موسيقى + إيقاع)
Prompt: A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Evaluation:
باستخدام مقطع "Lose My Mind" لـ Don Toliver، يُظهر الناتج توافقًا قويًا بين الحركة والإيقاع، مع حركة جسم طبيعية تتبع الموسيقى جيدًا. دقة مزامنة الشفاه جيدة عمومًا بحوالي 85%، مع تطابق معظم حركات الوجه بشكل مقنع مع الصوت. تظهر تفاعلات اليد مستقرة وواقعية طوال الأداء. قد تحدث عيوب بصرية طفيفة، مثل ظهور عناصر من الصورة المصدر بشكل غير صحيح في الإطار، لكن بشكل عام تظل النتيجة نظيفة وجذابة للمحتوى المدفوع بالموسيقى.
مثال 2: أسلوب البودكاست (خطاب تحفيزي)
Prompt:
Prompt: A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Evaluation:
باستخدام صوت بأسلوب بودكاست تحفيزي، يُظهر الناتج اتساقًا قويًا للشخصية ورسومًا متحركة للوجه مستقرة طوال التسلسل. تتوافق حركات الفك الدقيقة وتعبيرات العين جيدًا مع نبرة الخطاب، مما يجعل الإلقاء يبدو طبيعيًا وجذابًا. الإيماءات متزامنة مع الصوت وتظل متحكمًا فيها، مما يضيف إلى الواقعية العامة. قد تحدث مشاكل طفيفة مثل ضبابية خفيفة أثناء حركة اليد بالقرب من الأشياء، لكن بشكل عام يظل الناتج مستقرًا بصريًا ومناسبًا تمامًا للمحتوى الحواري والسردي.
الخاتمة
يُظهر Omnihuman 1.5 قدرة قوية في توليد فيديوهات بشرية واقعية بالذكاء الاصطناعي، خاصة من خلال استخدامه المنظم لمدخلات الصورة والصوت والموجه. تُظهر الأمثلة أن النموذج يعمل جيدًا في كل من السيناريوهات الديناميكية، مثل المحتوى المدفوع بالموسيقى، وحالات الاستخدام الأكثر تحكمًا مثل مقاطع الفيديو الحوارية أو بأسلوب البودكاست.
يتيح متطلب المدخلات المجمعة تحكمًا أفضل في اتساق الشخصية ومحاذاة الكلام والواقعية العامة. ومع ذلك، لا تزال جودة الناتج تعتمد على مدى جودة إعداد هذه المدخلات، مع ظهور عيوب طفيفة أو تناقضات في المواقف الأكثر تعقيدًا.
بشكل عام، واجهة برمجة تطبيقات Omnihuman 1.5 مناسبة تمامًا لسير عمل توليد الفيديو القابل للتوسع، خاصة لتطبيقات مثل إنشاء المحتوى والتسويق والوسائط الرقمية. ستتمكن الفرق التي تركز على هيكل مدخلات واضح ومواءمة حالات الاستخدام من تحقيق نتائج أكثر موثوقية وجاهزة للإنتاج.
Omnihuman 1.5 PiAPI today!



