3.0.0 — Control independiente de subtítulos y narrador + estilo de subtítulos con IA + presentador digital + generación de imágenes

Control independiente de subtítulos y narrador + estilo de subtítulos con IA + presentador digital + generación de imágenes

MayorPublicado el 21 de junio de 2026Ver en GitHub

Novedades

Funciones y mejoras

  • Control independiente de subtítulos y narradorSubtitleConfig se eleva al mismo nivel que AudioConfig, cada uno con su propio interruptor enabled; cuatro modos de combinación (narrador+subtítulos, solo narrador, solo subtítulos, silencio); nuevo parámetro subtitle_enabled en los endpoints creativo y de manuscrito.
  • Estilo de subtítulos con IA (modo LLM)style_mode "fixed" (estilo global) o "llm" (posición/color/tamaño de fuente de cada subtítulo decididos por el LLM); style_hints acepta indicaciones en lenguaje natural («líneas clave en rojo, resúmenes en amarillo»); generate_subtitle_styles() envía todos los subtítulos al LLM en una llamada y renderiza mediante el sidecar subtitle_styles.json.
  • Tipo de tarea Presentador digital — presentador IA mediante t2i o i2i (foto de referencia subida por el usuario); el manuscrito se divide en párrafos de 5 a 12 s, cada uno genera un clip i2v único con gestos/expresiones diferentes; TTS unificado + superposición de subtítulos optimizada por LLM; audio del modelo o tras la concatenación; POST /api/tasks/anchor.
  • Generación de imágenes simple — nueva quinta pestaña; SimpleImageTask ligero; soporte de prompt de sistema; GET /api/image/{id} para recuperar resultados.
  • Soporte de prompt de sistema — prompt de sistema opcional para tareas de video e imagen simples, antepuesto al prompt final.

Refactorización y optimizaciones

  • División de pasos del pipeline_step_audio_subtitle se reemplaza por _step_audio + _step_subtitle independientes en los pipelines creativo y de manuscrito.
  • Mejoras en el renderizado de subtítulos — visualización multilínea con solapamiento de 0,3 s, solapamiento de transición de 0,8 s, temporización extend-end de dos pasadas, protección contra desbordamiento de márgenes seguros, posicionamiento vertical por zonas del LLM para variedad visual.

Corrección de errores

  • subprocess.run ahora añade stdin=DEVNULL, evitando que los procesos en segundo plano se cuelguen por SIGTTIN.
  • SilentTTSEngine.generate() devuelve Nonedict vacío, corrigiendo la generación de SRT en modo solo subtítulos.
  • La línea de tiempo SRT se basa en la duración real del audio, no en la duración estimada del video.
  • Cuando falla la generación de imágenes, se muestra el error concreto (estado HTTP + cuerpo + traceback).
  • Corrección defensiva de codificación UTF-8 en el pipeline del presentador digital; el TTS se genera primero para obtener la duración real del audio.

Acerca de Agnes Video Generator

Un generador de video con IA completamente gratuito y de código abierto: convierte texto en videos IA de varias escenas con narración y subtítulos.

  • Gratis y de código abierto: sin pagos, sin GPU de alta gama
  • Texto a video, imagen a video, presentador digital y generación de imágenes
  • Impulsado por los modelos gratuitos de Agnes AI, videos generados íntegramente en la nube
  • Funciona con Web UI, Docker o npm, admite autoalojamiento

Páginas relacionadas

Por qué puedes confiar

Este artículo fue escrito por profesionales de primera línea. Al escribirlo, se verificaron fuentes de primera mano, como artículos de arXiv, informes técnicos de fabricantes y Stanford AI Index, y no se basaron en conclusiones basadas en impresiones subjetivas.

S

SandGrid@lcy362

Autor de Agnes Video Generator · Desarrollador Full-Stack

Desarrollador independiente y autor de Agnes Video Generator, una herramienta de generación de vídeo con IA de código abierto. El proyecto se basa en el modelo de video completamente gratuito de Agnes AI y el protocolo MIT es de código abierto. Ha ayudado a más de 1.000 creadores a producir videos de IA a costo cero. He estado preocupado durante mucho tiempo por la ingeniería y la popularización de modelos de generación de video, y el contenido de los artículos proviene de la práctica de primera línea e investigación de primera mano.

Ver en GitHub

Última actualización2026-08-21

¿Listo para empezar?

“Que la IA de clase mundial pertenezca a todos.” – Bruce Yang. Completamente gratis, sin tarjetas de crédito ni tarjetas gráficas de alto rendimiento, haz tu primer video de IA a costo cero. ¿Quieres usar los modelos de vídeo gratuitos de Agnes AI? Simplemente comience aquí.

Clona el repositorio de GitHub y lanza en 2 minutos