3.0.0 — सबटाइटल और नैरेटर स्वतंत्र नियंत्रण + AI सबटाइटल स्टाइलिंग + डिजिटल एंकर + इमेज जनरेशन

सबटाइटल और नैरेटर स्वतंत्र नियंत्रण + AI सबटाइटल स्टाइलिंग + डिजिटल एंकर + इमेज जनरेशन

प्रमुखरिलीज़ दिनांक 21 जून 2026GitHub पर देखें

नई सुविधाएँ

सुविधाएँ और सुधार

  • सबटाइटल और नैरेटर स्वतंत्र नियंत्रणSubtitleConfig को AudioConfig के समकक्ष बनाया गया, प्रत्येक का अपना enabled स्विच; चार संयोजन मोड (नैरेटर+सबटाइटल, केवल नैरेटर, केवल सबटाइटल, मौन); क्रिएटिव और मैनस्क्रिप्ट एंडपॉइंट पर नया subtitle_enabled पैरामीटर।
  • AI-संचालित सबटाइटल स्टाइलिंग (LLM मोड)style_mode "fixed" (वैश्विक शैली) या "llm" (प्रत्येक सबटाइटल की स्थिति/रंग/फ़ॉन्ट आकार LLM तय करता है); style_hints प्राकृतिक भाषा मार्गदर्शन स्वीकार करता है ("मुख्य पंक्तियाँ लाल, सारांश पीले"); generate_subtitle_styles() सभी सबटाइटल एक कॉल में LLM को भेजता है और साइडकार subtitle_styles.json के माध्यम से रेंडर करता है।
  • डिजिटल एंकर (डिजिटल मानव प्रस्तोता) कार्य प्रकार — t2i या i2i (उपयोगकर्ता द्वारा अपलोड की गई संदर्भ फोटो) के माध्यम से AI प्रस्तोता; मैनस्क्रिप्ट को 5–12 सेकंड के अनुच्छेदों में विभाजित किया जाता है, प्रत्येक अलग-अलग हावभाव/अभिव्यक्ति के साथ अद्वितीय i2v क्लिप उत्पन्न करता है; एकीकृत TTS + LLM-अनुकूलित सबटाइटल ओवरले; ऑडियो मॉडल से या संयोजन के बाद; POST /api/tasks/anchor
  • सरल छवि निर्माण — नया पाँचवाँ टैब; हल्का SimpleImageTask; सिस्टम-प्रॉम्प्ट समर्थन; परिणाम प्राप्त करने के लिए GET /api/image/{id}
  • सिस्टम प्रॉम्प्ट समर्थन — सरल वीडियो और छवि कार्यों के लिए वैकल्पिक सिस्टम प्रॉम्प्ट, अंतिम प्रॉम्प्ट से पहले जोड़ा जाता है।

रीफैक्टरिंग और अनुकूलन

  • पाइपलाइन चरण विभाजन — क्रिएटिव और मैनस्क्रिप्ट पाइपलाइनों में _step_audio_subtitle को स्वतंत्र _step_audio + _step_subtitle द्वारा प्रतिस्थापित किया गया।
  • सबटाइटल रेंडरिंग सुधार — 0.3 सेकंड ओवरलैप के साथ बहु-पंक्ति प्रदर्शन, 0.8 सेकंड संक्रमण ओवरलैप, दो-पास extend-end टाइमिंग, सुरक्षित-मार्जिन ओवरफ्लो सुरक्षा, दृश्य विविधता के लिए LLM ऊर्ध्वाधर-क्षेत्र स्थिति।

बग फिक्स

  • subprocess.run में stdin=DEVNULL जोड़ा गया, बैकग्राउंड प्रोसेस को SIGTTIN पर लटकने से रोकता है।
  • SilentTTSEngine.generate() None → खाली dict लौटाता है, केवल-सबटाइटल मोड SRT निर्माण को ठीक करता है।
  • SRT टाइमलाइन अनुमानित वीडियो अवधि के बजाय वास्तविक ऑडियो अवधि पर आधारित।
  • छवि निर्माण विफल होने पर विशिष्ट त्रुटि आउटपुट (HTTP status + body + traceback)।
  • डिजिटल एंकर पाइपलाइन में रक्षात्मक UTF-8 एन्कोडिंग सुधार; वास्तविक ऑडियो अवधि पाने के लिए TTS पहले उत्पन्न होता है।

Agnes Video Generator के बारे में

एक पूरी तरह से मुफ्त, ओपन-सोर्स AI वीडियो जनरेटर: टेक्स्ट को नैरेशन और सबटाइटल्स के साथ मल्टी-सीन AI वीडियो में बदलें।

  • पूरी तरह मुफ्त और ओपन-सोर्स — कोई भुगतान नहीं, कोई हाई-एंड GPU नहीं
  • टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, डिजिटल एंकर और इमेज जनरेशन
  • मुफ्त Agnes AI मॉडल पर चलता है, वीडियो पूरी तरह क्लाउड में बनते हैं
  • Web UI, Docker या npm से चलाएं, सेल्फ-होस्टिंग सपोर्ट

संबंधित पेज

इस पर भरोसा क्यों करें

यह लेख एक फ्रंटलाइन प्रैक्टिशनर ने लिखा है। लिखते समय arXiv पेपर, वेंडर तकनीकी रिपोर्ट और Stanford AI Index जैसे प्राथमिक स्रोतों को क्रॉस-चेक किया गया, न कि सिर्फ़ व्यक्तिपरक धारणा पर निष्कर्ष।

S

SandGrid@lcy362

Agnes Video Generator के लेखक · फुल-स्टैक डेवलपर

स्वतंत्र डेवलपर, ओपन सोर्स AI वीडियो जनरेशन टूल Agnes Video Generator के लेखक। यह प्रोजेक्ट Agnes AI के पूरी तरह मुफ़्त वीडियो मॉडल पर आधारित है, MIT ओपन सोर्स लाइसेंस, 1,000+ क्रिएटर की बिना लागत AI वीडियो बनाने में मदद कर चुका है। लंबे समय से वीडियो जनरेशन मॉडल के इंजीनियरिंग और लोकतंत्रीकरण पर ध्यान देता है; लेख की सामग्री सब फ्रंटलाइन प्रैक्टिस और प्राथमिक शोध से है।

GitHub पर देखें

अंतिम अपडेट2026-08-21

बनाना शुरू करने के लिए तैयार?

「दुनिया का सर्वश्रेष्ठ AI हर किसी का हो।」 — ब्रूस यांग। पूरी तरह मुफ़्त, कोई क्रेडिट कार्ड नहीं, हाई-एंड GPU की ज़रूरत नहीं। आपका पहला AI वीडियो शून्य लागत पर शुरू। Agnes AI का मुफ़्त वीडियो मॉडल इस्तेमाल करना चाहते हैं? यहीं से शुरू करें।

GitHub रेपो क्लोन करें और 2 मिनट में लॉन्च करें