6.3.0 — Notes de version

Historique des versions d’Agnes Video Generator : nouvelles fonctionnalités, améliorations et corrections par version.

MineurePublié le 30 août 2026Voir sur GitHub

Nouveautés

Fonctionnalités & améliorations

  • Feuille de route d'optimisation v6 entièrement réalisée (29/29 points) — chaque lot de la feuille de route v6 est désormais livré :
  • Performance (lot 2) : la chaîne de composition finale est désormais basée sur ffmpeg — la concaténation de scènes à paramètres identiques utilise -c copy, l'alignement/le volume/le remplissage silencieux de l'audio fusionnent en une seule passe de filtres, et les sous-titres sont rendus via la voie ASS avec des styles par entrée (AGNES_SUBTITLE_ASS, avec repli automatique sur la voie moviepy). Les vidéos de poèmes composent toutes les scènes en une seule passe au lieu de ré-encoder scène par scène. Un pool de threads d'encodage dédié isole le travail ffmpeg/moviepy lourd des requêtes API, et le limiteur de débit à jetons dispose d'un chemin asynchrone natif : arrêter une tâche pendant une attente de limite de débit est désormais instantané.
  • Fiabilité & ingénierie (lot 1) : l'état des tâches suit un principe d'écrivain unique avec verrouillage par tâche, la reprise prend en charge les repères TTS au niveau des mots persistés (pas de resynthèse à la reprise), l'interrogation vidéo est adaptative et les attentes multi-scènes s'exécutent en parallèle, la liste des tâches est indexée avec pagination limit/offset/status, les artefacts/journaux d'erreurs obsolètes sont gérés, et le frontend cesse l'interrogation dans les onglets en arrière-plan avec backoff exponentiel et bandeau de perte de connexion.
  • Frontend & i18n : les traductions sont découpées en chunks chargés paresseusement par langue — le bundle JS du premier écran passe de ~721 ko à ~305 ko (gzip 226 ko → 97 ko, -58 %). Les flux de soumission/confirmation/toast des formulaires ont été unifiés dans des composables partagés, avec ajout d'une mise en page mobile, de modales à piège de focus, de la prise en charge de prefers-reduced-motion et de brouillons de formulaire.
  • Observabilité & opérations (lot 3) : nouveaux points de terminaison GET /api/health et GET /api/metrics, journalisation optionnelle dans des fichiers rotatifs (AGNES_LOG_FILE) et HEALTHCHECK Docker. Les réglages d'exécution sont désormais consolidés via pydantic-settings typé (avec prise en charge .env), si bien que les limites de concurrence s'adaptent dynamiquement au nombre de clés API.
  • Corrections de défauts immédiates (lot 0) : l'arrêt annule désormais instantanément sans backoff de réessai, le blocage de la boucle d'événements (ré-encodage du filigrane, téléchargements synchrones) est sorti de la boucle, la suppression parmi plusieurs clés fonctionne correctement, un vecteur XSS v-html côté frontend est fermé, et la génération d'images a reçu une protection contre les soumissions en double.
  • Prise en charge complète de 22 langues, dont l'arabe — l'UI comptait déjà 22 langues ; cette version complète le catalogue de voix pour toutes. L'UI arabe est entièrement prise en charge (PR #32), et 8 langues d'UI (turc, vietnamien, thaï, tagalog, hindi, persan, bengali, ourdou) bénéficient désormais de regroupements de voix edge_tts avec affichage des noms de voix natives, de regex de détection d'écriture (thaï/devanagari/bengali) et d'un repli de police de sous-titres par écriture (nouvelles polices Noto fournies ; le persan/ourdou réutilisent le pipeline arabe de reshape+bidi).
  • Divulgation transparente des statistiques & contrôles de confidentialité — le panneau de paramètres affiche désormais une carte de confidentialité claire et repliable listant précisément quelles statistiques d'utilisation sont transmises (et ce qui n'est jamais envoyé : prompts, manuscrits, poèmes, clés API et images de référence sont anonymisés avant l'envoi). Les statistiques peuvent être entièrement désactivées depuis le panneau.
  • Pile d'erreurs complète dans le rapport de retour — les échecs de pipeline persistent désormais l'intégralité du traceback dans l'état de la tâche ; le point de terminaison de diagnostic et le rapport de retour intégré l'incluent, ce qui permet de coller les détails complets d'une erreur (p. ex. une erreur d'environnement [WinError 2]) dans un issue GitHub sans consulter la console du serveur.

Refactorisation & optimisations

  • Chaîne de composition axée ffmpeg — le chemin d'assemblage final des vidéos créatives/manuscrits/présentateur/poèmes est passé de 3-4 ré-encodages complets à copy-concat + une seule passe de filtres (avec repli gracieux sur l'ancienne voie moviepy). C'est le plus grand gain de performance de la gamme v6, réduisant le temps d'assemblage final d'environ 3 à 10 fois sur des sorties typiques.
  • Limitation de débit asynchrone avec pool de threads d'encodage dédié — le seau à jetons offre désormais un chemin d'acquisition asynchrone natif (conscient de l'arrêt), et l'encodage lourd s'exécute dans un exécuteur dédié afin que les longs encodages ne privent plus le chemin des requêtes.

Corrections de bugs

  • Comportement d'arrêt corrigé — l'annulation d'une tâche ne déclenche plus de backoff de réessai (jusqu'à ~2 minutes) et ne supprime plus un video_id reprisable.
  • Configuration multi-clés corrigée — les ID de clés sont désormais hachés à partir de la clé réelle ; supprimer une clé parmi plusieurs clés configurées retire exactement cette clé.
  • Blocs de boucle d'événements corrigés — le ré-encodage du filigrane et les téléchargements synchrones ne bloquent plus tout le service ; un bug de libération de sémaphore pouvant casser durablement la limite de concurrence sous faible limite de débit est corrigé.
  • Problèmes frontend corrigés — un vecteur de XSS stocké via v-html non échappé est fermé, la double soumission de génération d'images sans garde est empêchée, et les erreurs fetch affichent désormais des messages backend lisibles au lieu d'échecs silencieux.
  • Aucun changement de configuration n'est requis. Les tâches existantes restent reprenables ; le format des fichiers d'état des tâches est inchangé.

À propos d’Agnes Video Generator

Un générateur de vidéos IA entièrement gratuit et open source : transformez du texte en vidéos IA multi-scènes avec narration et sous-titres.

  • Gratuit et open source — sans paiement, sans GPU haut de gamme
  • Texte-vers-vidéo, image-vers-vidéo, présentateur numérique et génération d’images
  • Propulsé par les modèles Agnes AI gratuits, vidéos générées entièrement dans le cloud
  • Fonctionne via Web UI, Docker ou npm, prend en charge l’auto-hébergement

Pages connexes

Pourquoi vous pouvez faire confiance

Cet article a été écrit par des praticiens de première ligne. Lors de l'écriture, des sources de première main telles que des articles arXiv, des rapports techniques des fabricants et l'indice Stanford AI ont été vérifiées, et ne sont pas basées sur des conclusions subjectives.

S

SandGrid@lcy362

Auteur d'Agnes Video Generator · Développeur Full-Stack

Développeur indépendant et auteur de Agnes Video Generator, un outil de génération de vidéos IA open source. Le projet est basé sur le modèle vidéo entièrement gratuit d'Agnes AI et le protocole MIT est open source. Il a aidé plus de 1 000 créateurs à produire des vidéos IA à zéro coût. Nous nous intéressons depuis longtemps à l'ingénierie et à la vulgarisation des modèles de génération vidéo, et le contenu de cet article provient de pratiques de première ligne et de recherches de première main.

Voir sur GitHub

Dernière mise à jour2026-08-21

Prêt à commencer ?

«Que l’IA de classe mondiale appartienne à tout le monde.» – Bruce Yang. Complètement gratuit, pas de carte de crédit ni de carte graphique haute performance, créez votre première vidéo IA à zéro coût. Vous souhaitez utiliser les modèles vidéo gratuits d'Agnes AI? Commencez par ici.

Clonez le dépôt GitHub et lancez en 2 minutes