3.0.0 — تحكم مستقل في الترجمة والراوي + تنسيق الترجمة بالذكاء الاصطناعي + مذيع رقمي + توليد الصور

تحكم مستقل في الترجمة والراوي + تنسيق الترجمة بالذكاء الاصطناعي + مذيع رقمي + توليد الصور

رئيسينُشر في 21 يونيو 2026عرض على GitHub

ما الجديد

الميزات والتحسينات

  • التحكم المستقل في الترجمة والراوي — رُفع SubtitleConfig إلى مستوى AudioConfig، ولكل منهما مفتاح enabled خاص؛ أربعة أوضاع للجمع (راوي+ترجمة، راوٍ فقط، ترجمة فقط، صامت)؛ معلمة subtitle_enabled جديدة على نقطتي الإبداع والمخطوطة.
  • تنسيق الترجمة بالذكاء الاصطناعي (وضع LLM)style_mode "fixed" (نمط عام) أو "llm" (موضع/لون/حجم خط كل ترجمة يحدده LLM)؛ يقبل style_hints إرشادات باللغة الطبيعية ("الأسطر الأساسية باللون الأحمر، الملخصات بالأصفر")؛ ترسل generate_subtitle_styles() كل الترجمات إلى LLM في استدعاء واحد وتصيَّر عبر ملف subtitle_styles.json.
  • نوع مهمة المذيع الرقمي — مذيع ذكاء اصطناعي عبر t2i أو i2i (صورة مرجعية يرفعها المستخدم)؛ تُقسَّم المخطوطة إلى فقرات من 5 إلى 12 ثانية، تولّد كل منها مقطع i2v فريدًا بإيماءات/تعبيرات مختلفة؛ TTS موحّد + طبقة ترجمة محسّنة بالـ LLM؛ الصوت من النموذج أو بعد التجميع؛ POST /api/tasks/anchor.
  • توليد الصور البسيط — علامة تبويب خامسة جديدة؛ SimpleImageTask خفيف؛ دعم موجه النظام؛ GET /api/image/{id} لاسترجاع النتائج.
  • دعم موجه النظام — موجه نظام اختياري لمهام الفيديو والصور البسيطة، يُضاف أمام الموجه النهائي.

إعادة الهيكلة والتحسينات

  • تقسيم خطوات خط الإنتاج — استُبدل _step_audio_subtitle بـ _step_audio + _step_subtitle مستقلين في خطي الإنتاج الإبداعي والمخطوطة.
  • تحسينات عرض الترجمات — عرض متعدد الأسطر بتداخل 0.3 ثانية، وتداخل انتقالي 0.8 ثانية، وتوقيت extend-end بمرحلتين، وحماية من تجاوز الهوامش الآمنة، وتحديد المناطق الرأسية بالـ LLM للتنوع البصري.

إصلاحات الأخطاء

  • يضيف subprocess.run الآن stdin=DEVNULL، لمنع تعليق العمليات الخلفية بسبب SIGTTIN.
  • يعيد SilentTTSEngine.generate() Nonedict فارغًا، لإصلاح توليد SRT في وضع الترجمة فقط.
  • يعتمد الخط الزمني لـ SRT على مدة الصوت الفعلية بدل المدة التقديرية للفيديو.
  • عند فشل توليد الصورة، يُخرج الخطأ المحدد (حالة HTTP + الجسم + traceback).
  • إصلاح ترميز UTF-8 الدفاعي في خط إنتاج المذيع الرقمي؛ يُولَّد TTS أولاً للحصول على مدة الصوت الفعلية.

حول Agnes Video Generator

مولّد فيديو بالذكاء الاصطناعي مجاني بالكامل ومفتوح المصدر: حوّل النص إلى فيديوهات ذكاء اصطناعي متعددة المشاهد مع تعليق صوتي وترجمة.

  • مجاني ومفتوح المصدر بالكامل — بدون دفع، بدون GPU عالي الأداء
  • نص إلى فيديو، صورة إلى فيديو، مذيع رقمي وتوليد صور
  • يعمل على نماذج Agnes AI المجانية، الفيديوهات تُنشأ بالكامل في السحابة
  • يعمل عبر Web UI أو Docker أو npm، ويدعم الاستضافة الذاتية

صفحات ذات صلة

لماذا يمكنك الوثوق بهذا المحتوى

تمت كتابة هذه المقالة بواسطة ممارس في الخطوط الأمامية ، وعند كتابتها ، قمت بفحص المصادر المباشرة مثل أوراق arXiv والتقارير الفنية للمصنعين ومؤشر ستانفورد للذكاء الاصطناعي ، وليس استنتاجًا بناءً على الانطباعات الذاتية.

S

SandGrid@lcy362

مؤلف Agnes Video Generator · مطور شامل (Full-stack)

مطور مستقل ومؤلف أداة إنشاء فيديو مفتوحة المصدر بالذكاء الاصطناعي Agnes Video Generator. يعتمد المشروع على نموذج الفيديو المجاني تمامًا لـ Agnes AI وبروتوكول معهد ماساتشوستس للتكنولوجيا مفتوح المصدر ، وقد ساعد 1000 مبدع على إنتاج مقاطع فيديو بالذكاء الاصطناعي بتكلفة صفرية. لقد اهتمت منذ فترة طويلة بهندسة وتعميم نماذج إنشاء الفيديو ، ويأتي محتوى المقالة من ممارسة الخطوط الأمامية والبحث المباشر.

عرض على GitHub

آخر تحديث2026-08-21

مستعد لبدء الإبداع؟

"اجعل الذكاء الاصطناعي ذو المستوى العالمي ملكًا للجميع." - بروس يانغ مجاني تمامًا ، لا تحتاج إلى بطاقة ائتمان أو بطاقة رسومات عالية الأداء ، يمكنك إنشاء أول فيديو للذكاء الاصطناعي بتكلفة صفرية. هل تريد نموذج فيديو مجاني من Agnes AI ؟ فقط ابدأ من هنا.

استنسخ مستودع GitHub وشغّله في دقيقتين