Narración y subtítulos: cómo añadir voz a los vídeos de IA

El modo presentador incluye voz TTS y sincronización de labios integradas; el texto-a-vídeo normal requiere añadir narración y subtítulos por tu cuenta.

Una pregunta frecuente al empezar: ¿los vídeos generados por IA vienen con narración automática? ¿Tengo que añadir los subtítulos yo mismo? La respuesta depende del modo de generación que uses. El modo presentador genera la voz y la sincronización de labios automáticamente dentro del modelo. En cambio, el texto-a-vídeo normal solo produce imagen — sin narración, sin subtítulos. Esta guía explica ambos casos y dónde añadir los subtítulos.

Modo presentador: una imagen de referencia basta para un vídeo narrado

El modo presentador solo necesita una imagen de referencia de una persona digital para producir un vídeo de una persona hablando. La narración se genera automáticamente con el TTS integrado y la sincronización de labios se gestiona dentro del modelo — sin grabación adicional ni ajuste manual. Ten en cuenta: las escenas de varios personajes y las bibliotecas de movimiento avanzadas están en plataformas externas como HeyGen, Synthesia o D-ID, y no forman parte del modo presentador aquí.

Consejo: una imagen de presentador y el TTS integrado son suficientes — no necesitas herramientas de voz adicionales.

Texto-a-vídeo normal: sin narración por defecto

Si simplemente conviertes un prompt de texto en un vídeo y nadie habla en el encuadre, el resultado no tiene voz automática ni subtítulos. Solo obtienes imagen limpia y te encargas tú de la narración y los subtítulos en tu herramienta de edición. Ten también en cuenta los límites: hasta 15–20 segundos por clip, resolución 720p y límite de velocidad de 16 peticiones por minuto.

¿Cómo añado subtítulos?

Los clips de texto-a-vídeo normal no tienen subtítulos: añádelos tras la exportación con un editor como CapCut, Premiere o similar. Si quieres subtítulos integrados, cambia al modo presentador — los vídeos de este modo incluyen subtítulos sincronizados con la narración.

Pruébalo en la demo

Tanto la demo en línea como Studio ofrecen una entrada al modo presentador, y /api-docs expone toda la API. Genera ahora un vídeo narrado a partir de una sola imagen.

Probar la demo

Voiceover & Subtitles References

The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.

  1. HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)

    Digital-human platforms like HeyGen mentioned here are described per their official product docs.

  2. ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)

    For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.

  3. Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)

    For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.

  4. CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)

    The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.

Por qué puedes confiar

Este artículo fue escrito por profesionales de primera línea. Al escribirlo, se verificaron fuentes de primera mano, como artículos de arXiv, informes técnicos de fabricantes y Stanford AI Index, y no se basaron en conclusiones basadas en impresiones subjetivas.

S

SandGrid@lcy362

Autor de Agnes Video Generator · Desarrollador Full-Stack

Desarrollador independiente y autor de Agnes Video Generator, una herramienta de generación de vídeo con IA de código abierto. El proyecto se basa en el modelo de video completamente gratuito de Agnes AI y el protocolo MIT es de código abierto. Ha ayudado a más de 1.000 creadores a producir videos de IA a costo cero. He estado preocupado durante mucho tiempo por la ingeniería y la popularización de modelos de generación de video, y el contenido de los artículos proviene de la práctica de primera línea e investigación de primera mano.

Ver en GitHub

Última actualización2026-08-21

¿Listo para empezar?

“Que la IA de clase mundial pertenezca a todos.” – Bruce Yang. Completamente gratis, sin tarjetas de crédito ni tarjetas gráficas de alto rendimiento, haz tu primer video de IA a costo cero. ¿Quieres usar los modelos de vídeo gratuitos de Agnes AI? Simplemente comience aquí.

Clona el repositorio de GitHub y lanza en 2 minutos