Omnihuman 1.5 API Kilavuzu: ByteDance'in AI Insan Video Modeli Nasil Kullanilir

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
Omnihuman 1.5 Nedir
Omnihuman 1.5, metin, gorsel veya ses gibi girdilerden gercekci insan videolari olusturmaya odaklanan ByteDance tarafindan gelistirilmis bir AI modelidir.
Model, dogal yuz ifadeleri, vucut hareketi ve konusmayi simule etmek icin insa edilmistir, bu da onu konusan avatarlar, sunucular ve insan odakli video icerik olusturmak icin uygun kilar. Daha genel video modelleriyle karsilastirildiginda, Omnihuman 1.5 ozellikle dudak senkronizasyonu dogrulugu ve ifade tutarliligi konusunda insan gercekciligi uzerine daha guclu bir vurgu yapar.
Omnihuman 1.5 API Kilavuzu
Omnihuman 1.5 API
Omnihuman 1.5 API'yi kullanmak basit yapilandirilmis bir akisi takip eder:
1. Karakter icin bir referans gorsel saglayin
2. Konusma veya sarki icin bir ses dosyasi yukleyin
3. Sahneyi ve davranisi tanimlayan bir prompt belirleyin
4. Istegi API'ye gonderin
5. Olusturulan video ciktisini alin
Uc girdinin tumu gerektigi icin, sonucun kalitesi bunlarin ne kadar iyi hizalandigina baglidir. Net bir prompt, uygun ses ve tutarli bir referans gorsel daha gercekci ciktilar uretecektir.
Omnihuman 1.5'in Temel Ozellikleri
Omnihuman 1.5, gorsel, ses ve prompt girdilerini birlestirerek gercekci insan video olusturmaya odaklanir. Model, olusturulan videolarda dogal gorunen hareket ve tutarli insan davranisi uretmek icin tasarlanmistir.
Coklu Girdi Olusturma (Gorsel + Ses + Prompt)
Model bir referans gorsel, ses ve prompt gerektirir, karakter kimligi, ses ve sahne davranisi uzerinde daha iyi kontrol saglar. Bu yapilandirilmis yaklasim, yalnizca prompt ile olusturmaya kiyasla tutarliligi arttirir.
Gercekci Yuz Ifadeleri
Omnihuman 1.5, konusma ve duyguyla uyumlu ayrintili yuz hareketleri olusturur, ciktilarin daha gercekci hissetmesini saglar.
Dogru Dudak Senkronizasyonu Hizalamasi
Sesi temel girdi olarak kullanarak, model agiz hareketlerini konusma veya sarkiyla yakindan senkronize edebilir.
Dogal Vucut Hareketi
Model, ses girdisinin tonuna ve temposuna uyan ince jestler ve vucut hareketi uretir.
Tutarli Karakter Kimligi
Referans gorsel kullanmak, olusturulan insanin video boyunca gorsel olarak tutarli kalmasini saglar.
Omnihuman 1.5 Fiyatlandirma
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
Bu, toplam maliyetin dogrudan olusturulan videonun uzunluguyla olceklendigi anlamina gelir. Ornegin, daha uzun konusma veya muzik girdileri daha yuksek olusturma maliyetlerine neden olurken, daha kisa klipler nispeten uygun fiyatli kalir.
PiAPI Omnihuman API documentation.
Ornek 1: DJ Performansi (Muzik + Ritim)
A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Evaluation:
Don Toliver'in "Lose My Mind" parcasini kullanarak, cikti hareket ve ritim arasinda guclu hizalama gosterir, muziği iyi takip eden dogal vucut hareketiyle. Dudak senkronizasyonu dogrulugu genellikle %85 civarinda saglamdir, cogu yuz hareketi sesle ikna edici sekilde eslenir. El etkilesimleri performans boyunca istikrarli ve gercekci gorunur. Kaynak gorselden ogeler cercevede yanlis gorunme gibi kucuk gorsel artefaktlar hala olusabilir, ancak genel olarak sonuc muzik odakli icerik icin temiz ve ilgi cekici kalir.
Ornek 2: Podcast Stili (Motivasyon Konusmasi)
Prompt:
A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Evaluation:
Motivasyonel podcast stili ses kullanarak, cikti sekans boyunca guclu karakter tutarliligi ve istikrarli yuz animasyonu gosterir. Ince cene hareketi ve goz ifadeleri konusmanin tonuyla iyi uyum saglar, sunumun dogal ve ilgi cekici hissetmesini saglar. Jestler sesle senkronize edilir ve kontrol altinda kalir, genel gercekcilige katkida bulunur. Nesnelerin yakininda el hareketi sirasinda hafif bulaniklik gibi kucuk sorunlar olusabilir, ancak genel olarak cikti gorsel olarak istikrarli kalir ve konusma ve anlati tabanli icerik icin cok uygundur.
Sonuc
Omnihuman 1.5, ozellikle gorsel, ses ve prompt girdilerinin yapilandirilmis kullanimi araciligiyla gercekci AI insan videolari olusturmada guclu yetenek gosterir. Ornekler, modelin muzik odakli icerik gibi dinamik senaryolarda ve konusma veya podcast stili videolar gibi daha kontrollü kullanim durumlarinda iyi performans gosterdigini gostermektedir.
Kombine girdiler icin gereklilik, karakter tutarliligi, konusma hizalamasi ve genel gercekcilik uzerinde daha iyi kontrol saglar. Ancak, cikti kalitesi hala bu girdilerin ne kadar iyi hazirlanidigina bagli olup, daha karmasik durumlarda kucuk artefaktlar veya tutarsizliklar gorulebilir.
Genel olarak, Omnihuman 1.5 API, ozellikle icerik olusturma, pazarlama ve dijital medya gibi uygulamalar icin olceklenebilir video olusturma is akislari icin cok uygundur. Net girdi yapisi ve kullanim durumu hizalamasina odaklanan ekipler daha guvenilir ve uretime hazir sonuclar elde edebilecektir.
Omnihuman 1.5 PiAPI today!



