3.0.0 — کنترل مستقل زیرنویس و گوینده + سبک‌دهی زیرنویس با هوش مصنوعی + مجری دیجیتال + تولید تصویر

کنترل مستقل زیرنویس و گوینده + سبک‌دهی زیرنویس با هوش مصنوعی + مجری دیجیتال + تولید تصویر

اصلیمنتشر شده در ۳۱ خرداد ۱۴۰۵مشاهده در GitHub

چه چیز جدید است

ویژگی‌ها و بهبودها

  • کنترل مستقل زیرنویس و گویندهSubtitleConfig به سطح هم‌ارز AudioConfig ارتقا یافت، هرکدام کلید enabled مستقل خود را دارد؛ چهار حالت ترکیب (گوینده+زیرنویس، فقط گوینده، فقط زیرنویس، بی‌صدا)؛ پارامتر جدید subtitle_enabled در نقاط پایانی خلاقانه و دست‌نویس.
  • سبک‌دهی زیرنویس با هوش مصنوعی (حالت LLM)style_mode با "fixed" (سبک سراسری) یا "llm" (موقعیت/رنگ/اندازه فونت هر زیرنویس توسط LLM تعیین می‌شود)؛ style_hints راهنمایی زبان طبیعی می‌پذیرد («خطوط کلیدی قرمز، خلاصه‌ها زرد»)؛ generate_subtitle_styles() همه زیرنویس‌ها را در یک فراخوانی به LLM می‌فرستد و از طریق فایل جانبی subtitle_styles.json رندر می‌کند.
  • نوع وظیفه مجری دیجیتال — مجری هوش مصنوعی از طریق t2i یا i2i (عکس مرجع بارگذاری‌شده کاربر)؛ دست‌نویس به پاراگراف‌های ۵ تا ۱۲ ثانیه‌ای تقسیم می‌شود و هرکدام کلیپ i2v منحصربه‌فرد با ژست‌ها/حالات متفاوت تولید می‌کند؛ TTS یکپارچه + لایه زیرنویس بهینه‌سازی‌شده با LLM؛ صدا از مدل یا پس از الحاق؛ POST /api/tasks/anchor.
  • تولید تصویر ساده — برگه پنجم جدید؛ SimpleImageTask سبک؛ پشتیبانی از پرامپت سیستمی؛ GET /api/image/{id} برای دریافت نتایج.
  • پشتیبانی از پرامپت سیستمی — پرامپت سیستمی اختیاری برای وظایف ساده ویدیو و تصویر، که قبل از پرامپت نهایی اضافه می‌شود.

بازسازی و بهینه‌سازی

  • تقسیم مراحل خط لوله_step_audio_subtitle در خطوط لوله خلاقانه و دست‌نویس با _step_audio + _step_subtitle مستقل جایگزین شد.
  • بهبودهای رندر زیرنویس — نمایش چندخطی با هم‌پوشانی ۰٫۳ ثانیه‌ای، هم‌پوشانی انتقالی ۰٫۸ ثانیه‌ای، زمان‌بندی extend-end دوگذره، محافظت از سرریز حاشیه امن، موقعیت‌دهی مناطق عمودی با LLM برای تنوع بصری.

رفع اشکالات

  • subprocess.run اکنون stdin=DEVNULL اضافه می‌کند و از گیرکردن فرآیندهای پس‌زمینه روی SIGTTIN جلوگیری می‌کند.
  • SilentTTSEngine.generate() به‌جای None یک dict خالی برمی‌گرداند و تولید SRT حالت فقط زیرنویس را اصلاح می‌کند.
  • خط زمانی SRT بر اساس مدت واقعی صدا است، نه مدت تخمینی ویدیو.
  • هنگام شکست تولید تصویر، خطای مشخص (HTTP status + body + traceback) نمایش داده می‌شود.
  • اصلاح دفاعی کدگذاری UTF-8 در خط لوله مجری دیجیتال؛ TTS ابتدا تولید می‌شود تا مدت واقعی صدا به دست آید.

درباره Agnes Video Generator

یک تولیدکننده ویدیوی هوش مصنوعی کاملاً رایگان و متن‌باز: متن را به ویدیوهای هوش مصنوعی چندصحنه‌ای با روایت و زیرنویس تبدیل کنید.

  • کاملاً رایگان و متن‌باز — بدون پرداخت، بدون GPU قدرتمند
  • متن به ویدیو، تصویر به ویدیو، مجری دیجیتال و تولید تصویر
  • مبتنی بر مدل‌های رایگان Agnes AI، ویدیوها کاملاً در ابر تولید می‌شوند
  • اجرا از طریق Web UI، Docker یا npm، پشتیبانی از میزبانی خود

صفحات مرتبط

چرا می‌توانید به این محتوا اعتماد کنید

این مقاله توسط یک پزشک خط مقدم نوشته شده است. هنگام نوشتن ، من منابع دست اولی مانند مقالات arXiv ، گزارش های فنی سازنده و شاخص هوش مصنوعی استنفورد را بررسی کردم و بر اساس نتیجه گیری ذهنی نبودم.

S

SandGrid@lcy362

نویسنده Agnes Video Generator · توسعه‌دهنده فول‌استک

توسعه دهنده مستقل و نویسنده ابزار تولید ویدیوی هوش مصنوعی منبع باز Agnes Video Generator. این پروژه مبتنی بر مدل ویدیویی کاملاً رایگان Agnes AI است و پروتکل MIT منبع باز است. این پروژه به 1000 خالق کمک کرده است تا ویدیوهای هوش مصنوعی را با هزینه صفر تولید کنند. من مدتهاست که به مهندسی و محبوبیت مدلهای تولید ویدئو توجه کردهام و محتوای مقاله از تمرین خط مقدم و تحقیقات دست اول میآید.

مشاهده در GitHub

آخرین به‌روزرسانی2026-08-21

آماده شروع خلاقیت هستید؟

«اجازه دهید هوش مصنوعی در سطح جهانی متعلق به همه باشد.» – بروس یانگ کاملاً رایگان ، بدون کارت اعتباری یا کارت گرافیک با کارایی بالا ، اولین ویدیوی هوش مصنوعی خود را با هزینه صفر بسازید. آیا می خواهید از مدل ویدیویی رایگان Agnes AI استفاده کنید ؟ فقط از اینجا شروع کن

مخزن GitHub را کلون کنید و در ۲ دقیقه راه‌اندازی کنید