6.3.0 — Notas de la versión

Historial de versiones de Agnes Video Generator: nuevas funciones, mejoras y correcciones de errores por versión.

MenorPublicado el 30 de agosto de 2026Ver en GitHub

Novedades

Funciones y mejoras

  • Hoja de ruta de optimización v6 completada (29/29 puntos) — ya se han entregado todos los lotes de la hoja de ruta v6:
  • Rendimiento (lote 2): la cadena de composición final ahora se basa en ffmpeg — la concatenación de escenas con parámetros idénticos usa -c copy, la alineación/volumen/relleno de silencio del audio se fusionan en una sola pasada de filtros, y los subtítulos se renderizan por la vía ASS con estilos por entrada (AGNES_SUBTITLE_ASS, con alternativa automática a la vía moviepy). Los vídeos de poemas componen todas las escenas en una sola pasada en lugar de recodificar escena por escena. Un pool de hilos de codificación dedicado aísla el trabajo pesado de ffmpeg/moviepy de las peticiones API, y el limitador de tasa de cubo de tokens incorpora una vía asíncrona nativa, de modo que detener una tarea durante esperas por límite de tasa es instantáneo.
  • Fiabilidad e ingeniería (lote 1): el estado de las tareas sigue un principio de escritor único con bloqueo por tarea; la reanudación admite pistas TTS a nivel de palabra persistidas (sin resíntesis al reanudar); el sondeo de vídeo es adaptativo y las esperas multi-escena se ejecutan en paralelo; el listado de tareas está indexado con paginación limit/offset/status; los artefactos y registros de errores obsoletos se gestionan; y el frontend deja de sondear en pestañas en segundo plano con backoff exponencial y un banner de pérdida de conexión.
  • Frontend e i18n: las traducciones se dividen en fragmentos de carga diferida por idioma — el bundle JS de la primera pantalla baja de ~721 kB a ~305 kB (gzip 226 kB → 97 kB, -58 %). Los flujos de envío/confirmación/toast de los formularios se unificaron en composables compartidos, y se añadieron diseño móvil, modales con trampa de foco, soporte de prefers-reduced-motion y borradores de formularios.
  • Observabilidad y operaciones (lote 3): nuevos endpoints GET /api/health y GET /api/metrics, registro opcional en archivos rotatorios (AGNES_LOG_FILE) y un HEALTHCHECK de Docker. La configuración en tiempo de ejecución ahora se consolida mediante pydantic-settings tipado (con soporte .env), por lo que los límites de concurrencia escalan dinámicamente con el número de claves API.
  • Correcciones de defectos inmediatas (lote 0): detener ahora cancela al instante sin backoff de reintentos; el bloqueo del bucle de eventos (recodificación de marca de agua, descargas síncronas) se sacó del bucle; la eliminación entre varias claves funciona correctamente; se cerró un vector XSS de v-html en el frontend; y la generación de imágenes recibió protección contra envíos duplicados.
  • Soporte completo de 22 idiomas incluido el árabe — la interfaz ya tenía 22 idiomas; esta versión completa el catálogo de voces para todos. La interfaz en árabe está totalmente soportada (PR #32), y 8 idiomas de la interfaz (turco, vietnamita, tailandés, tagalo, hindi, persa, bengalí, urdu) cuentan ahora con agrupaciones de voces edge_tts con visualización de nombres de voces nativas, expresiones regulares de detección de escritura (tailandés/devanágari/bengalí) y alternativa de fuente de subtítulos por escritura (nuevas fuentes Noto incluidas; persa/urdu reutilizan el flujo árabe de reshape+bidi).
  • Divulgación transparente de analíticas y controles de privacidad — el panel de ajustes muestra ahora una tarjeta de privacidad clara y plegable que enumera exactamente qué estadísticas de uso se informan (y qué nunca se sube: prompts, manuscritos, poemas, claves API e imágenes de referencia se anonimizan antes de informar). Las analíticas pueden desactivarse por completo desde el panel.
  • Trazas de error completas en el informe de comentarios — los fallos del pipeline ahora persisten el traceback completo en el estado de la tarea; el endpoint de diagnóstico y el informe de comentarios de la aplicación lo incluyen, de modo que puedes pegar los detalles completos del error (p. ej. un error de entorno como [WinError 2]) en issues de GitHub sin consultar la consola del servidor.

Refactorización y optimizaciones

  • Cadena de composición con ffmpeg como prioridad — la vía de ensamblado final de los vídeos creativos/manuscrito/presentador/poema pasó de 3-4 recodificaciones completas a copy-concat + una sola pasada de filtros (con alternativa elegante a la anterior vía moviepy). Es la mayor mejora de rendimiento de la línea v6, reduciendo el tiempo de ensamblado final aproximadamente entre 3 y 10 veces en salidas típicas.
  • Limitación de tasa asíncrona con pool de hilos de codificación dedicado — el cubo de tokens ofrece ahora una vía de adquisición asíncrona nativa (consciente de la detención), y la codificación pesada se ejecuta en un ejecutor dedicado, de modo que los trabajos largos de codificación ya no bloquean la vía de peticiones.

Corrección de errores

  • Comportamiento de detención corregido — cancelar una tarea ya no desencadena backoff de reintentos (hasta ~2 minutos) ni elimina un video_id reanudable.
  • Configuración multi-clave corregida — los ID de claves ahora se hashean desde la clave real, por lo que eliminar una clave entre varias configuradas elimina exactamente esa clave.
  • Bloqueos del bucle de eventos corregidos — la recodificación de marca de agua y las descargas síncronas ya no bloquean todo el servicio; se corrigió un fallo de liberación de semáforo que podía romper permanentemente el límite de concurrencia con límites de tasa bajos.
  • Problemas del frontend corregidos — se cerró un vector de XSS almacenado vía v-html sin escapar, se evita el envío duplicado de generación de imágenes sin protección, y los errores de fetch ahora muestran mensajes legibles del backend en lugar de fallos silenciosos.
  • No se requieren cambios de configuración. Las tareas existentes siguen siendo reanudables; el formato de los archivos de estado de tareas no cambia.

Acerca de Agnes Video Generator

Un generador de video con IA completamente gratuito y de código abierto: convierte texto en videos IA de varias escenas con narración y subtítulos.

  • Gratis y de código abierto: sin pagos, sin GPU de alta gama
  • Texto a video, imagen a video, presentador digital y generación de imágenes
  • Impulsado por los modelos gratuitos de Agnes AI, videos generados íntegramente en la nube
  • Funciona con Web UI, Docker o npm, admite autoalojamiento

Páginas relacionadas

Por qué puedes confiar

Este artículo fue escrito por profesionales de primera línea. Al escribirlo, se verificaron fuentes de primera mano, como artículos de arXiv, informes técnicos de fabricantes y Stanford AI Index, y no se basaron en conclusiones basadas en impresiones subjetivas.

S

SandGrid@lcy362

Autor de Agnes Video Generator · Desarrollador Full-Stack

Desarrollador independiente y autor de Agnes Video Generator, una herramienta de generación de vídeo con IA de código abierto. El proyecto se basa en el modelo de video completamente gratuito de Agnes AI y el protocolo MIT es de código abierto. Ha ayudado a más de 1.000 creadores a producir videos de IA a costo cero. He estado preocupado durante mucho tiempo por la ingeniería y la popularización de modelos de generación de video, y el contenido de los artículos proviene de la práctica de primera línea e investigación de primera mano.

Ver en GitHub

Última actualización2026-08-21

¿Listo para empezar?

“Que la IA de clase mundial pertenezca a todos.” – Bruce Yang. Completamente gratis, sin tarjetas de crédito ni tarjetas gráficas de alto rendimiento, haz tu primer video de IA a costo cero. ¿Quieres usar los modelos de vídeo gratuitos de Agnes AI? Simplemente comience aquí.

Clona el repositorio de GitHub y lanza en 2 minutos