گویندگی و زیرنویس: افزودن صدا به ویدیوهای هوش مصنوعی

حالت سخنران صدای TTS و هم‌زمانی لب را به‌صورت داخلی دارد؛ اما تبدیل متن به ویدیوی معمولی نیازمند افزودن گویندگی و زیرنویس توسط خود شماست.

سوال رایجی که تازه‌کارها می‌پرسند: آیا ویدیوهای ساخته‌شده با هوش مصنوعی گویندگی خودکار دارند؟ آیا باید خودم زیرنویس اضافه کنم؟ پاسخ به حالت تولیدی بستگی دارد که استفاده می‌کنید. حالت سخنران صدا و هم‌زمانی لب را داخل مدل به‌صورت خودکار می‌سازد. در حالی که تبدیل متن به ویدیوی معمولی فقط تصویر می‌دهد — نه گویندگی، نه زیرنویس. این راهنما هر دو حالت و محل افزودن زیرنویس را توضیح می‌دهد.

حالت سخنران: یک تصویر مرجع برای ویدیوی مجریِ دارای گویندگی کافی است

حالت سخنران فقط به یک تصویر مرجع از شخص دیجیتال نیاز دارد تا ویدیویِ صحبت‌کردن یک نفر را بسازد. گویندگی به‌صورت خودکار توسط TTS داخلی تولید می‌شود و هم‌زمانی لب داخل مدل انجام می‌شود — نیازی به ضبط صدای اضافه یا هم‌راستا کردن دستی نیست. توجه داشته باشید صحنه‌های چندشخصیتی و کتابخانه‌های حرکتی پیشرفته در پلتفرم‌های خارجی مانند HeyGen، Synthesia یا D-ID در دسترس هستند و بخشی از حالت سخنران این‌جا نیستند.

نکته: یک تصویر مجری به‌همراه TTS داخلی کافی است — ابزار صدای اضافی لازم نیست.

تبدیل متن به ویدیوی معمولی: به‌صورت پیش‌فرض گویندگی ندارد

اگر فقط یک متن را به ویدیو تبدیل کنید و کسی در قاب صحبت نکند، نتیجه نه صدای خودکار دارد و نه زیرنویس. فقط تصویر تمیز دریافت می‌کنید و گویندگی و زیرنویس را خودتان در ابزار ویرایش انجام می‌دهید. به محدودیت‌های تولید هم توجه کنید: هر کلیپ حداکثر ۱۵–۲۰ ثانیه، رزولوشن 720p و محدودیت نرخ ۱۶ درخواست در دقیقه.

زیرنویس را چگونه اضافه کنم؟

کلیپ‌های تبدیل متن به ویدیوی معمولی زیرنویس ندارند: پس از خروجی‌گرفتن، زیرنویس را با ویرایشگری مثل CapCut، Premiere یا مشابه آن به تصویر اضافه (burn-in) کنید. اگر زیرنویس از ابتدا می‌خواهید، به حالت سخنران بروید — ویدیوهای این حالت زیرنویس هم‌زمان با گویندگی دارند.

در دمو امتحان کنید

هر دو Demo و Studio آنلاین ورودی حالت سخنران دارند و /api-docs کل API را باز می‌کند. همین حالا از یک تصویر ویدیوی مجریِ دارای گویندگی بسازید.

دمو را امتحان کنید

Voiceover & Subtitles References

The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.

  1. HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)

    Digital-human platforms like HeyGen mentioned here are described per their official product docs.

  2. ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)

    For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.

  3. Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)

    For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.

  4. CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)

    The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.

چرا می‌توانید به این محتوا اعتماد کنید

این مقاله توسط یک پزشک خط مقدم نوشته شده است. هنگام نوشتن ، من منابع دست اولی مانند مقالات arXiv ، گزارش های فنی سازنده و شاخص هوش مصنوعی استنفورد را بررسی کردم و بر اساس نتیجه گیری ذهنی نبودم.

S

SandGrid@lcy362

نویسنده Agnes Video Generator · توسعه‌دهنده فول‌استک

توسعه دهنده مستقل و نویسنده ابزار تولید ویدیوی هوش مصنوعی منبع باز Agnes Video Generator. این پروژه مبتنی بر مدل ویدیویی کاملاً رایگان Agnes AI است و پروتکل MIT منبع باز است. این پروژه به 1000 خالق کمک کرده است تا ویدیوهای هوش مصنوعی را با هزینه صفر تولید کنند. من مدتهاست که به مهندسی و محبوبیت مدلهای تولید ویدئو توجه کردهام و محتوای مقاله از تمرین خط مقدم و تحقیقات دست اول میآید.

مشاهده در GitHub

آخرین به‌روزرسانی2026-08-21

آماده شروع خلاقیت هستید؟

«اجازه دهید هوش مصنوعی در سطح جهانی متعلق به همه باشد.» – بروس یانگ کاملاً رایگان ، بدون کارت اعتباری یا کارت گرافیک با کارایی بالا ، اولین ویدیوی هوش مصنوعی خود را با هزینه صفر بسازید. آیا می خواهید از مدل ویدیویی رایگان Agnes AI استفاده کنید ؟ فقط از اینجا شروع کن

مخزن GitHub را کلون کنید و در ۲ دقیقه راه‌اندازی کنید