내레이션과 자막: AI 영상에 음성을 추가하는 방법
토킹헤드 모드는 TTS 음성과 립싱크가 기본 제공되지만, 일반 텍스트-투-비디오는 내레이션과 자막을 직접 추가해야 합니다.
처음 시작할 때 흔한 질문이 있습니다. "AI가 만든 영상에 내레이션이 자동으로 붙나요? 자막도 직접 추가해야 하나요?" 답은 어떤 생성 모드를 쓰느냐에 따라 달라집니다. 토킹헤드 모드는 모델 내부에서 음성과 립싱크를 자동 생성합니다. 하지만 일반 텍스트-투-비디오는 화면만 나오고 내레이션도 자막도 없습니다. 이 가이드에서 두 경우를 설명하고 자막을 어디서 추가할지 알려드립니다.
토킹헤드 모드: 참조 이미지 한 장이면 내레이션 있는 발표자 영상 생성
토킹헤드 모드는 디지털 휴먼 참조 이미지 한 장만 제공하면 한 사람이 말하는 영상을 생성합니다. 내레이션은 내장 TTS가 자동 생성하고, 립싱크도 모델 내부에서 처리하므로 별도로 음성을 녹음하거나 수동으로 맞출 필요가 없습니다. 단, 다인 장면이나 고급 모션 라이브러리는 HeyGen, Synthesia, D-ID 같은 외부 플랫폼에서 제공되며 본 사이트의 토킹헤드 모드에는 포함되지 않습니다.
일반 텍스트-투-비디오: 기본적으로 내레이션 없음
텍스트 프롬프트를 영상으로 만들기만 하고 화면에 말하는 사람이 없다면 자동 음성도 자막도 생성되지 않습니다. 순수한 화면만 나오므로 내레이션과 자막은 편집 도구에서 직접 처리해야 합니다. 생성 제한도 참고하세요: 클립당 최대 15–20초, 해상도 720p, 요청 제한 분당 16회입니다.
자막은 어떻게 추가하나요?
일반 텍스트-투-비디오 영상에는 자막이 없습니다. CapCut, Premiere 같은 편집 도구에서 내보낸 후 자막을 굽는(burn-in) 방식으로 추가하세요. 처음부터 자막이 필요하다면 토킹헤드 모드로 전환하세요. 이 모드의 영상에는 내레이션과 동기화된 자막이 포함됩니다.
데모에서 직접 체험해 보세요
온라인 Demo와 Studio 양쪽에 토킹헤드 진입점이 있고, /api-docs에서 전체 API도 공개되어 있습니다. 지금 바로 이미지 한 장으로 내레이션 있는 발표자 영상을 만들어 보세요.
데모 체험하기Voiceover & Subtitles References
The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.
- HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)
Digital-human platforms like HeyGen mentioned here are described per their official product docs.
- ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)
For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.
- Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)
For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.
- CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)
The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.
신뢰할 수 있는 이유
이 글은 주관적인 인상에 의한 결론이 아니라 arXiv 논문, 제조업체 기술 보고서 및 Stanford AI Index와 같은 1차 출처를 교차 확인하여 작성한 일선 실무자에 의해 작성되었다.
SandGrid@lcy362
Agnes Video Generator 개발자 · 풀스택 개발자
독립 개발자이자 오픈 소스 AI 비디오 생성 도구인 Agnes Video Generator의 저자입니다. 이 프로젝트는 Agnes AI의 완전 무료 비디오 모델을 기반으로 하며, MIT 프로토콜은 오픈 소스이며, 이미 1,000명 이상의 크리에이터가 무료 비용으로 AI 비디오를 제작할 수 있도록 도왔다. 비디오 생성 모델의 엔지니어링화와 보급에 오랫동안 관심을 기울여 왔으며, 글의 내용은 모두 일선 실천과 직접 연구에서 나왔다
GitHub에서 보기최종 업데이트:2026-08-21