Gemini Omni 1.1 Flash는 텍스트 생성 한 번으로 끝나는 영상 모델이 아니라, 장면을 이어 붙이고 키프레임 사이를 연결하며 최종 결과를 고해상도로 만드는 제작 워크플로용 모델이다. API에서 초안→검토→최종 출력 단계를 나눌 수 있어 광고 소재, 제품 데모, 영상 편집 도구에 특히 맞는다.
핵심 제어 기능
| 기능 | 의미 | 적합한 작업 |
|---|---|---|
| 장면 연장 | 이전 영상 최대 10초 맥락을 보고 10초씩, 누적 40초까지 연장 | 이야기·카메라 동선 유지 |
| 시작·종료 프레임 | 두 키프레임 사이의 연속 영상을 생성 | 전환, 루프, 줌·오비트 샷 |
| 360p 초안 | 720p보다 최대 60% 빠르고 비용은 약 3분의 1 | 스토리보드와 프롬프트 탐색 |
| 1080p·4K 업스케일 | 검토를 마친 결과를 고해상도로 변환 | 최종 납품용 출력 |
| 영상 참조 | 최대 3초의 참조 영상으로 맥락 유지 | 동작·캐릭터 일관성 |
비용을 제어하는 제작 흐름
처음부터 4K를 생성하지 말고 360p에서 구도·피사체·카메라 지시를 검증한 뒤, 선택한 결과만 업스케일한다. 장면 연장에서는 “계속”처럼 모호하게 쓰기보다 카메라 이동, 남겨야 할 피사체, 다음 행동을 분리해 지정한다. 첫·마지막 프레임 보간은 두 이미지가 서로 너무 다르면 점프나 왜곡이 생길 수 있다.
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[{"type": "text", "text": "인물과 조명은 유지하고 카메라만 뒤로 이동한다."}],
response_format={"resolution": "360p"},
)사용 전 확인할 것
생성 영상은 사실성·저작권·초상권 검토를 대체하지 않는다. 외부 참조 영상과 인물 이미지는 사용 권한을 확인하고, 제품 기능·교육 내용은 원본과 대조하는 승인 단계를 둔다.
관련 문서
- gemini — Google의 멀티모달 AI 모델 및 서비스 생태계
- gemini-omni — Gemini Omni 모델 계열의 개요
참고 자료
- Gemini Omni 1.1 Flash lets you build with more control — Google Blog (2026-08-27)