Hướng dẫn API Omnihuman 1.5: Cách sử dụng mô hình video AI con người của ByteDance

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API
Omnihuman 1.5 là gì
Omnihuman 1.5 là một mô hình AI được phát triển bởi ByteDance, tập trung vào việc tạo video con người chân thực từ các đầu vào như văn bản, hình ảnh hoặc âm thanh.
Mô hình được xây dựng để mô phỏng biểu cảm khuôn mặt tự nhiên, chuyển động cơ thể và giọng nói, phù hợp để tạo avatar nói, người dẫn chương trình và nội dung video tập trung vào con người. So với các mô hình video tổng quát hơn, Omnihuman 1.5 nhấn mạnh hơn vào tính chân thực của con người, đặc biệt là độ chính xác đồng bộ môi và tính nhất quán biểu cảm.
Hướng dẫn API Omnihuman 1.5
Omnihuman 1.5 API
Sử dụng API Omnihuman 1.5 theo quy trình có cấu trúc đơn giản:
1. Cung cấp hình ảnh tham chiếu cho nhân vật
2. Tải lên tệp âm thanh cho giọng nói hoặc ca hát
3. Định nghĩa prompt mô tả cảnh và hành vi
4. Gửi yêu cầu đến API
5. Nhận đầu ra video được tạo
Vì cả ba đầu vào đều bắt buộc, chất lượng kết quả phụ thuộc vào mức độ phù hợp của chúng. Một prompt rõ ràng, âm thanh phù hợp và hình ảnh tham chiếu nhất quán sẽ tạo ra đầu ra chân thực hơn.
Các tính năng chính của Omnihuman 1.5
Omnihuman 1.5 tập trung vào việc tạo video con người chân thực bằng cách kết hợp các đầu vào hình ảnh, âm thanh và prompt. Mô hình được thiết kế để tạo ra chuyển động trông tự nhiên và hành vi con người nhất quán trong các video được tạo.
Tạo đa đầu vào (Hình ảnh + Âm thanh + Prompt)
Mô hình yêu cầu hình ảnh tham chiếu, âm thanh và prompt, cho phép kiểm soát tốt hơn danh tính nhân vật, giọng nói và hành vi cảnh. Cách tiếp cận có cấu trúc này cải thiện tính nhất quán so với việc chỉ tạo từ prompt.
Biểu cảm khuôn mặt chân thực
Omnihuman 1.5 tạo ra các chuyển động khuôn mặt chi tiết phù hợp với giọng nói và cảm xúc, làm cho đầu ra cảm thấy sống động hơn.
Đồng bộ môi chính xác
Bằng cách sử dụng âm thanh làm đầu vào cốt lõi, mô hình có thể đồng bộ hóa chuyển động miệng chặt chẽ với giọng nói hoặc ca hát.
Chuyển động cơ thể tự nhiên
Mô hình tạo ra các cử chỉ tinh tế và chuyển động cơ thể phù hợp với tông giọng và nhịp độ của đầu vào âm thanh.
Danh tính nhân vật nhất quán
Sử dụng hình ảnh tham chiếu đảm bảo rằng con người được tạo vẫn nhất quán về mặt hình ảnh trong suốt video.
Giá Omnihuman 1.5
Omnihuman 1.5 API
$0.13 per second (based on input audio length)
Điều này có nghĩa là tổng chi phí tỷ lệ trực tiếp với độ dài của video được tạo. Ví dụ, các đầu vào giọng nói hoặc âm nhạc dài hơn sẽ dẫn đến chi phí tạo cao hơn, trong khi các clip ngắn hơn vẫn tương đối phải chăng.
PiAPI Omnihuman API documentation.
Ví dụ 1: Biểu diễn DJ (Âm nhạc + Nhịp điệu)
Một DJ nam biểu diễn trực tiếp trên sân khấu, đeo tai nghe và mix nhạc trên bàn điều khiển DJ, biểu cảm tập trung, chuyển động đầu tinh tế theo nhịp, tương tác tay tự nhiên với bàn xoay, ánh sáng câu lạc bộ mềm với bóng nhẹ, biểu cảm khuôn mặt chân thực, phong cách điện ảnh, chuyển động cơ thể mượt mà và nhịp nhàng, đồng bộ môi chính xác với âm nhạc

Evaluation:
Sử dụng bản nhạc "Lose My Mind" của Don Toliver, đầu ra cho thấy sự phù hợp mạnh mẽ giữa chuyển động và nhịp điệu, với chuyển động cơ thể tự nhiên theo nhạc tốt. Độ chính xác đồng bộ môi nói chung vững chắc ở khoảng 85%, với hầu hết các chuyển động khuôn mặt khớp với âm thanh một cách thuyết phục. Các tương tác tay xuất hiện ổn định và chân thực trong suốt buổi biểu diễn. Các lỗi hình ảnh nhỏ vẫn có thể xảy ra, chẳng hạn như các phần tử từ hình ảnh nguồn xuất hiện không chính xác trong khung hình, nhưng nhìn chung kết quả vẫn sạch sẽ và hấp dẫn cho nội dung theo nhạc.
Ví dụ 2: Phong cách Podcast (Bài phát biểu truyền cảm hứng)
Prompt:
Một thanh niên đang nói trong setup podcast, ngồi trước micro, tông giọng bình tĩnh và tự tin, truyền tải thông điệp truyền cảm hứng, biểu cảm khuôn mặt tự nhiên, gật đầu nhẹ và cử chỉ tay tinh tế, ánh sáng trong nhà ấm áp, môi trường studio thoải mái, phong cách chân thực và đối thoại

Evaluation:
Sử dụng âm thanh podcast phong cách truyền cảm hứng, đầu ra cho thấy tính nhất quán nhân vật mạnh mẽ và hoạt hình khuôn mặt ổn định trong suốt chuỗi. Chuyển động hàm tinh tế và biểu cảm mắt phù hợp tốt với tông giọng của bài phát biểu, làm cho việc truyền tải cảm thấy tự nhiên và hấp dẫn. Các cử chỉ được đồng bộ hóa với âm thanh và vẫn được kiểm soát, thêm vào tính chân thực tổng thể. Các vấn đề nhỏ như mờ nhẹ trong chuyển động tay gần đồ vật có thể xảy ra, nhưng nhìn chung đầu ra vẫn ổn định về mặt hình ảnh và phù hợp cho nội dung đối thoại và tường thuật.
Kết luận
Omnihuman 1.5 thể hiện khả năng mạnh mẽ trong việc tạo video AI con người chân thực, đặc biệt thông qua việc sử dụng có cấu trúc các đầu vào hình ảnh, âm thanh và prompt. Các ví dụ cho thấy mô hình hoạt động tốt trong cả các kịch bản động, như nội dung theo nhạc, và các trường hợp sử dụng có kiểm soát hơn như video đối thoại hoặc phong cách podcast.
Yêu cầu về các đầu vào kết hợp cho phép kiểm soát tốt hơn tính nhất quán nhân vật, đồng bộ giọng nói và tính chân thực tổng thể. Tuy nhiên, chất lượng đầu ra vẫn phụ thuộc vào mức độ chuẩn bị tốt của các đầu vào này, với các lỗi nhỏ hoặc không nhất quán xuất hiện trong các tình huống phức tạp hơn.
Nhìn chung, API Omnihuman 1.5 phù hợp cho các quy trình tạo video có thể mở rộng, đặc biệt cho các ứng dụng như tạo nội dung, marketing và truyền thông số. Các đội ngũ tập trung vào cấu trúc đầu vào rõ ràng và phù hợp trường hợp sử dụng sẽ có thể đạt được kết quả đáng tin cậy hơn và sẵn sàng cho sản xuất.
Omnihuman 1.5 PiAPI today!



