Skip to main content

Blog

Omnihuman 1.5 API 가이드: ByteDance의 AI 휴먼 비디오 모델 사용법

Omnihuman 1.5 API 가이드: ByteDance의 AI 휴먼 비디오 모델 사용법

Omnihuman 1.5 Omnihuman 1.5 API Omnihuman API

Omnihuman 1.5란?

Omnihuman 1.5는 ByteDance가 개발한 AI 모델로, 텍스트, 이미지 또는 오디오와 같은 입력에서 사실적인 휴먼 비디오를 생성하는 데 중점을 둡니다.

이 모델은 자연스러운 얼굴 표정, 신체 움직임 및 음성을 시뮬레이션하도록 구축되어 말하는 아바타, 발표자 및 인간 중심 비디오 콘텐츠를 만드는 데 적합합니다. 더 일반적인 비디오 모델과 비교하여 Omnihuman 1.5는 특히 립싱크 정확도와 표정 일관성에서 인간의 사실감에 더 큰 강조를 둡니다.

Omnihuman API

Omnihuman 1.5 API 가이드

Omnihuman 1.5 API

Omnihuman 1.5 API 사용은 간단한 구조화된 흐름을 따릅니다:

1. 캐릭터의 참조 이미지 제공

2. 음성 또는 노래를 위한 오디오 파일 업로드

3. 장면과 행동을 설명하는 프롬프트 정의

4. API로 요청 전송

5. 생성된 비디오 출력 검색

세 가지 입력이 모두 필수이므로 결과의 품질은 그것들이 얼마나 잘 정렬되어 있는지에 따라 달라집니다. 명확한 프롬프트, 적절한 오디오 및 일관된 참조 이미지가 더 사실적인 출력을 생성합니다.

Omnihuman 1.5의 주요 기능

Omnihuman 1.5는 이미지, 오디오 및 프롬프트 입력을 결합하여 사실적인 휴먼 비디오 생성에 중점을 둡니다. 이 모델은 생성된 비디오 전체에서 자연스러운 동작과 일관된 인간 행동을 생성하도록 설계되었습니다.

다중 입력 생성 (이미지 + 오디오 + 프롬프트)

모델은 참조 이미지, 오디오 및 프롬프트를 필요로 하여 캐릭터 정체성, 음성 및 장면 행동에 대한 더 나은 제어를 가능하게 합니다. 이 구조화된 접근 방식은 프롬프트만 사용하는 생성에 비해 일관성을 향상시킵니다.

사실적인 얼굴 표정

Omnihuman 1.5는 음성 및 감정과 일치하는 세밀한 얼굴 움직임을 생성하여 출력이 더 생생하게 느껴지게 합니다.

정확한 립싱크 정렬

오디오를 핵심 입력으로 사용하여 모델은 입 움직임을 음성 또는 노래와 밀접하게 동기화할 수 있습니다.

자연스러운 신체 움직임

모델은 오디오 입력의 톤과 페이싱에 맞는 미묘한 제스처와 신체 동작을 생성합니다.

일관된 캐릭터 정체성

참조 이미지를 사용하면 생성된 인간이 비디오 전체에서 시각적으로 일관되게 유지됩니다.

Omnihuman 1.5 가격

Omnihuman 1.5 API

$0.13 per second (based on input audio length)

이는 총 비용이 생성된 비디오 길이에 직접 비례한다는 것을 의미합니다. 예를 들어, 더 긴 음성 또는 음악 입력은 더 높은 생성 비용을 초래하고, 짧은 클립은 상대적으로 저렴합니다.

PiAPI Omnihuman API documentation.

예시 1: DJ 공연 (음악 + 리듬)

Prompt: A male DJ performing live on stage, wearing headphones and mixing music on a DJ controller, focused expression, subtle head movement following the beat, natural hand interaction with the turntables, soft club lighting with slight shadows, realistic facial expressions, cinematic style, smooth and rhythmic body motion, accurate lip-sync aligned with the music

Input Photo
Input Photo

Evaluation:

Don Toliver의 트랙 "Lose My Mind"를 사용하여 출력은 움직임과 리듬 사이의 강한 정렬을 보여주며, 음악을 잘 따르는 자연스러운 신체 동작을 보여줍니다. 립싱크 정확도는 일반적으로 약 85%로 견고하며, 대부분의 얼굴 움직임이 오디오와 설득력 있게 일치합니다. 손 상호작용은 공연 전반에 걸쳐 안정적이고 사실적으로 나타납니다. 소스 이미지의 요소가 프레임에 잘못 나타나는 것과 같은 사소한 시각적 아티팩트가 여전히 발생할 수 있지만, 전반적으로 결과는 음악 기반 콘텐츠에 깨끗하고 매력적으로 유지됩니다.

예시 2: 팟캐스트 스타일 (동기 부여 연설)

Prompt:

Prompt: A young man speaking in a podcast setup, sitting in front of a microphone, calm and confident tone, delivering a motivational message, natural facial expressions, slight head nods and subtle hand gestures, warm indoor lighting, relaxed studio environment, realistic and conversational style

Image Input
Image Input

Evaluation:

동기 부여 팟캐스트 스타일 오디오를 사용하여 출력은 시퀀스 전체에서 강한 캐릭터 일관성과 안정적인 얼굴 애니메이션을 보여줍니다. 미묘한 턱 움직임과 눈 표정이 연설의 톤과 잘 맞아 전달이 자연스럽고 매력적으로 느껴집니다. 제스처는 오디오와 동기화되어 제어된 상태로 유지되어 전반적인 사실감을 더합니다. 물체 근처에서 손이 움직일 때 약간의 흐림과 같은 사소한 문제가 발생할 수 있지만, 전반적으로 출력은 시각적으로 안정적이며 대화 및 내레이션 기반 콘텐츠에 적합합니다.

결론

Omnihuman 1.5는 사실적인 AI 휴먼 비디오 생성에서 강력한 능력을 보여주며, 특히 이미지, 오디오 및 프롬프트 입력의 구조화된 사용을 통해 그렇습니다. 예시는 모델이 음악 기반 콘텐츠와 같은 동적 시나리오와 대화 또는 팟캐스트 스타일 비디오와 같은 더 제어된 사용 사례 모두에서 잘 수행됨을 보여줍니다.

결합된 입력에 대한 요구 사항은 캐릭터 일관성, 음성 정렬 및 전반적인 사실감에 대한 더 나은 제어를 가능하게 합니다. 그러나 출력 품질은 여전히 이러한 입력이 얼마나 잘 준비되었는지에 따라 달라지며, 더 복잡한 상황에서는 사소한 아티팩트나 불일치가 나타날 수 있습니다.

전반적으로 Omnihuman 1.5 API는 확장 가능한 비디오 생성 워크플로우에 적합하며, 특히 콘텐츠 제작, 마케팅 및 디지털 미디어와 같은 애플리케이션에 적합합니다. 명확한 입력 구조와 사용 사례 정렬에 집중하는 팀은 더 신뢰할 수 있고 프로덕션 준비가 된 결과를 달성할 수 있습니다.

Omnihuman 1.5 PiAPI today!

Sign up