Narração e legendas: como adicionar voz aos vídeos de IA
O modo apresentador traz voz TTS e sincronização de lábios integradas; o texto-para-vídeo comum exige que você adicione narração e legendas por conta própria.
Uma pergunta comum para quem começa: os vídeos gerados por IA vêm com narração automática? Preciso adicionar legendas eu mesmo? A resposta depende do modo de geração que você usa. O modo apresentador gera voz e sincronização de lábios automaticamente dentro do modelo. Já o texto-para-vídeo comum produz apenas imagem — sem narração, sem legendas. Este guia explica os dois casos e onde adicionar as legendas.
Modo apresentador: uma imagem de referência basta para um vídeo narrado
O modo apresentador precisa apenas de uma imagem de referência de uma pessoa digital para produzir um vídeo de uma pessoa falando. A narração é gerada automaticamente pelo TTS integrado e a sincronização de lábios é tratada dentro do modelo — sem gravação extra ou alinhamento manual. Observação: cenas com vários personagens e bibliotecas de movimento avançadas estão em plataformas externas como HeyGen, Synthesia ou D-ID, e não fazem parte do modo apresentador aqui.
Texto-para-vídeo comum: sem narração por padrão
Se você apenas transforma um prompt de texto em vídeo e ninguém fala no quadro, o resultado não terá voz automática nem legendas. Você recebe apenas imagem limpa e cuida da narração e das legendas no seu editor. Observe também os limites de geração: até 15–20 segundos por clipe, resolução 720p e limite de taxa de 16 solicitações por minuto.
Como adicionar legendas?
Clipes de texto-para-vídeo comum não têm legendas: adicione-as após a exportação com um editor como CapCut, Premiere ou similar. Se quiser legendas integradas, mude para o modo apresentador — os vídeos desse modo vêm com legendas sincronizadas com a narração.
Experimente na demo
Tanto a demo online quanto o Studio oferecem uma entrada para o modo apresentador, e o /api-docs expõe toda a API. Gere agora um vídeo narrado a partir de uma única imagem.
Experimentar a demoVoiceover & Subtitles References
The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.
- HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)
Digital-human platforms like HeyGen mentioned here are described per their official product docs.
- ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)
For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.
- Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)
For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.
- CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)
The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.
Por que você pode confiar
Este artigo foi escrito por profissionais da linha de frente. Ao escrevê-lo, fontes de primeira mão, como artigos arXiv, relatórios técnicos de fabricantes e Stanford AI Index, foram verificadas e não baseadas em conclusões subjetivas.
SandGrid@lcy362
Autor do Agnes Video Generator · Desenvolvedor Full-Stack
Desenvolvedor independente e autor da ferramenta de geração de vídeo de IA de código aberto Agnes Video Generator. O projeto é baseado no modelo de vídeo totalmente gratuito da Agnes AI, com protocolo MIT de código aberto e ajudou mais de 1.000 criadores a produzir vídeos de IA a custo zero. Há muito tempo estou preocupado com a engenharia e popularização de modelos de geração de vídeo, e o conteúdo do artigo vem da prática de primeira linha e da pesquisa em primeira mão.
Ver no GitHubÚltima atualização:2026-08-21
Pronto para começar?
“Deixe a IA de classe mundial pertencer a todos.” – Bruce Yang. Completamente grátis, sem cartão de crédito ou placa gráfica de alto desempenho, faça seu primeiro vídeo de IA a zero custo. Quer usar o modelo de vídeo gratuito da Agnes AI? Basta começar daqui.
Clone o repositório do GitHub e inicie em 2 minutos