คู่มือ API Omnihuman 1.5: วิธีใช้โมเดลวิดีโอ AI Human ของ ByteDance

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
Omnihuman 1.5 คืออะไร
Omnihuman 1.5 เป็นโมเดล AI ที่พัฒนาโดย ByteDance ซึ่งมุ่งเน้นที่การสร้างวิดีโอมนุษย์ที่สมจริงจากอินพุตเช่น ข้อความ รูปภาพ หรือเสียง
โมเดลถูกสร้างขึ้นเพื่อจำลองการแสดงออกทางสีหน้าธรรมชาติ การเคลื่อนไหวร่างกาย และเสียงพูด ทำให้เหมาะสำหรับการสร้างอวาตาร์พูด ผู้นำเสนอ และเนื้อหาวิดีโอที่เน้นมนุษย์ เมื่อเทียบกับโมเดลวิดีโอทั่วไป Omnihuman 1.5 ให้ความสำคัญกับความสมจริงของมนุษย์มากขึ้น โดยเฉพาะในความแม่นยำของการซิงค์ปากและความสม่ำเสมอของการแสดงออก
คู่มือ API Omnihuman 1.5
Omnihuman 1.5 API
การใช้ API Omnihuman 1.5 เป็นไปตามขั้นตอนที่มีโครงสร้างง่ายๆ:
1. ให้รูปภาพอ้างอิงสำหรับตัวละคร
2. อัปโหลดไฟล์เสียงสำหรับการพูดหรือร้องเพลง
3. กำหนดพรอมต์ที่อธิบายฉากและพฤติกรรม
4. ส่งคำขอไปยัง API
5. รับเอาต์พุตวิดีโอที่สร้างขึ้น
เนื่องจากอินพุตทั้งสามจำเป็น คุณภาพของผลลัพธ์ขึ้นอยู่กับว่าพวกมันสอดคล้องกันดีแค่ไหน พรอมต์ที่ชัดเจน เสียงที่เหมาะสม และรูปภาพอ้างอิงที่สม่ำเสมอจะสร้างเอาต์พุตที่สมจริงมากขึ้น
ฟีเจอร์หลักของ Omnihuman 1.5
Omnihuman 1.5 มุ่งเน้นที่การสร้างวิดีโอมนุษย์ที่สมจริงโดยรวมอินพุตรูปภาพ เสียง และพรอมต์ โมเดลถูกออกแบบมาเพื่อสร้างการเคลื่อนไหวที่ดูเป็นธรรมชาติและพฤติกรรมมนุษย์ที่สม่ำเสมอตลอดวิดีโอที่สร้างขึ้น
การสร้างหลายอินพุต (รูปภาพ + เสียง + พรอมต์)
โมเดลต้องการรูปภาพอ้างอิง เสียง และพรอมต์ ทำให้สามารถควบคุมตัวตนของตัวละคร เสียง และพฤติกรรมฉากได้ดีขึ้น วิธีการที่มีโครงสร้างนี้ปรับปรุงความสม่ำเสมอเมื่อเทียบกับการสร้างจากพรอมต์อย่างเดียว
การแสดงออกทางสีหน้าที่สมจริง
Omnihuman 1.5 สร้างการเคลื่อนไหวใบหน้าโดยละเอียดที่สอดคล้องกับคำพูดและอารมณ์ ทำให้เอาต์พุตรู้สึกสมจริงมากขึ้น
การจัดตำแหน่งการซิงค์ปากที่แม่นยำ
โดยใช้เสียงเป็นอินพุตหลัก โมเดลสามารถซิงโครไนซ์การเคลื่อนไหวปากกับการพูดหรือร้องเพลงได้อย่างใกล้ชิด
การเคลื่อนไหวร่างกายธรรมชาติ
โมเดลสร้างท่าทางที่ละเอียดอ่อนและการเคลื่อนไหวร่างกายที่ตรงกับโทนและจังหวะของอินพุตเสียง
ตัวตนของตัวละครที่สม่ำเสมอ
การใช้รูปภาพอ้างอิงรับประกันว่ามนุษย์ที่สร้างขึ้นยังคงสม่ำเสมอทางภาพตลอดวิดีโอ
ราคา Omnihuman 1.5
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
หมายความว่าค่าใช้จ่ายรวมขยายโดยตรงตามความยาวของวิดีโอที่สร้างขึ้น ตัวอย่างเช่น อินพุตการพูดหรือเพลงที่ยาวกว่าจะส่งผลให้ค่าใช้จ่ายการสร้างสูงขึ้น ในขณะที่คลิปสั้นยังคงราคาไม่แพง
PiAPI Omnihuman API documentation.
ตัวอย่าง 1: การแสดง DJ (เพลง + จังหวะ)
A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Evaluation:
โดยใช้เพลง "Lose My Mind" โดย Don Toliver เอาต์พุตแสดงการจัดตำแหน่งที่แข็งแกร่งระหว่างการเคลื่อนไหวและจังหวะ โดยมีการเคลื่อนไหวร่างกายธรรมชาติที่ตามเพลงได้ดี ความแม่นยำของการซิงค์ปากโดยทั่วไปแข็งแกร่งประมาณ 85% โดยการเคลื่อนไหวใบหน้าส่วนใหญ่ตรงกับเสียงอย่างน่าเชื่อ การโต้ตอบของมือดูเหมือนมั่นคงและสมจริงตลอดการแสดง สิ่งประดิษฐ์ภาพเล็กน้อยอาจยังคงเกิดขึ้น เช่น องค์ประกอบจากภาพต้นฉบับปรากฏไม่ถูกต้องในเฟรม แต่โดยรวมผลลัพธ์ยังคงสะอาดและน่าสนใจสำหรับเนื้อหาที่ขับเคลื่อนด้วยเพลง
ตัวอย่าง 2: สไตล์พอดแคสต์ (สุนทรพจน์สร้างแรงบันดาลใจ)
Prompt:
A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Evaluation:
โดยใช้เสียงสไตล์พอดแคสต์สร้างแรงบันดาลใจ เอาต์พุตแสดงความสม่ำเสมอของตัวละครที่แข็งแกร่งและแอนิเมชันใบหน้าที่มั่นคงตลอดลำดับ การเคลื่อนไหวกรามที่ละเอียดอ่อนและการแสดงออกทางตาสอดคล้องกับโทนของสุนทรพจน์ ทำให้การนำเสนอรู้สึกเป็นธรรมชาติและน่าสนใจ ท่าทางซิงโครไนซ์กับเสียงและยังคงควบคุมได้ เพิ่มความสมจริงโดยรวม ปัญหาเล็กน้อย เช่น ความพร่ามัวเล็กน้อยระหว่างการเคลื่อนไหวมือใกล้วัตถุอาจเกิดขึ้น แต่โดยรวมเอาต์พุตยังคงมีความมั่นคงทางภาพและเหมาะสำหรับเนื้อหาที่อิงการสนทนาและการเล่าเรื่อง
สรุป
Omnihuman 1.5 แสดงความสามารถที่แข็งแกร่งในการสร้างวิดีโอ AI มนุษย์ที่สมจริง โดยเฉพาะผ่านการใช้อินพุตรูปภาพ เสียง และพรอมต์ที่มีโครงสร้าง ตัวอย่างแสดงให้เห็นว่าโมเดลทำงานได้ดีทั้งในสถานการณ์ไดนามิก เช่น เนื้อหาที่ขับเคลื่อนด้วยเพลง และกรณีใช้งานที่ควบคุมได้มากขึ้น เช่น วิดีโอการสนทนาหรือสไตล์พอดแคสต์
ข้อกำหนดสำหรับอินพุตรวมกันทำให้สามารถควบคุมความสม่ำเสมอของตัวละคร การจัดตำแหน่งการพูด และความสมจริงโดยรวมได้ดีขึ้น อย่างไรก็ตาม คุณภาพเอาต์พุตยังคงขึ้นอยู่กับว่าอินพุตเหล่านี้เตรียมมาดีแค่ไหน โดยมีสิ่งประดิษฐ์เล็กน้อยหรือความไม่สอดคล้องกันปรากฏในสถานการณ์ที่ซับซ้อนกว่า
โดยรวม API Omnihuman 1.5 เหมาะสำหรับเวิร์กโฟลว์การสร้างวิดีโอที่ขยายได้ โดยเฉพาะสำหรับแอปพลิเคชัน เช่น การสร้างเนื้อหา การตลาด และสื่อดิจิทัล ทีมที่มุ่งเน้นที่โครงสร้างอินพุตที่ชัดเจนและการจัดตำแหน่งกรณีใช้งานจะสามารถบรรลุผลลัพธ์ที่น่าเชื่อถือและพร้อมสำหรับการผลิตมากขึ้น
Omnihuman 1.5 PiAPI today!



