ভয়েসওভার ও সাবটাইটেল: AI ভিডিওতে কণ্ঠ যোগ করা

টকিং-হেড মোডে বিল্ট-ইন TTS ভয়েস ও ঠোঁট সিঙ্ক থাকে; সাধারণ টেক্সট-টু-ভিডিওতে ন্যারেশন ও সাবটাইটেল নিজে যোগ করতে হয়।

শুরু করলেই একটা সাধারণ প্রশ্ন ওঠে: AI তৈরি ভিডিওতে কি স্বয়ংক্রিয়ভাবে ন্যারেশন থাকে? আমাকে কি নিজে সাবটাইটেল যোগ করতে হবে? উত্তরটা নির্ভর করে আপনি কোন জেনারেশন মোড ব্যবহার করছেন তার ওপর। টকিং-হেড মোড মডেলের ভেতরেই ভয়েস ও ঠোঁট সিঙ্ক তৈরি করে। অন্যদিকে সাধারণ টেক্সট-টু-ভিডিও শুধু ভিজ্যুয়াল দেয় — না ন্যারেশন, না সাবটাইটেল। এই গাইড দুটি ক্ষেত্র ও সাবটাইটেল যোগ করার জায়গা বোঝায়।

টকিং-হেড মোড: একটি রেফারেন্স ইমেজই যথেষ্ট, ন্যারেটেড প্রেজেন্টার ভিডিও পাবেন

টকিং-হেড মোডে একটি ডিজিটাল হিউম্যান রেফারেন্স ইমেজ দিলেই একজন মানুষ কথা বলছেন এমন ভিডিও তৈরি হয়। ন্যারেশন বিল্ট-ইন TTS দিয়ে স্বয়ংক্রিয়ভাবে তৈরি হয়, আর ঠোঁট সিঙ্ক মডেলের ভেতরেই হয় — আলাদা কণ্ঠ রেকর্ড বা হাতে মিলানো লাগে না। মনে রাখবেন: একাধিক চরিত্রের দৃশ্য ও উন্নত মোশন লাইব্রেরি HeyGen, Synthesia বা D-ID-এর মতো বাইরের প্ল্যাটফর্মে পাওয়া যায়, আর এখানকার টকিং-হেড মোডের অংশ নয়।

টিপ: একটি প্রেজেন্টার ইমেজ আর বিল্ট-ইন TTS-ই যথেষ্ট — আলাদা কণ্ঠের টুল লাগে না।

সাধারণ টেক্সট-টু-ভিডিও: ডিফল্টে ন্যারেশন থাকে না

যদি শুধু টেক্সট প্রম্পটকে ভিডিওতে রূপান্তর করেন আর ফ্রেমে কেউ কথা না বলেন, তাহলে ফলাফলে অটো ভয়েসও থাকবে না, সাবটাইটেলও থাকবে না। আপনি শুধু পরিষ্কার ভিজ্যুয়াল পান, আর ন্যারেশন ও সাবটাইটেল নিজেই এডিটিং টুলে সামলাতে হয়। জেনারেশন সীমাও নোট করুন: প্রতি ক্লিপ সর্বোচ্চ ১৫–২০ সেকেন্ড, রেজোলিউশন 720p, আর রেট লিমিট প্রতি মিনিটে ১৬টি রিকোয়েস্ট।

সাবটাইটেল কীভাবে যোগ করবেন?

সাধারণ টেক্সট-টু-ভিডিও ক্লিপে ক্যাপশন থাকে না: CapCut, Premiere বা একই ধরনের এডিটরে এক্সপোর্টের পর সাবটাইটেল বার্ন-ইন করুন। সাবটাইটেল আগে থেকে চাইলে টকিং-হেড মোডে স্যুইচ করুন — এই মোডের ভিডিওতে ন্যারেশনের সঙ্গে সিঙ্ক করা সাবটাইটেল থাকে।

ডেমোতে চেষ্টা করে দেখুন

অনলাইন Demo ও Studio দুটোতেই টকিং-হেড মোডের প্রবেশপথ আছে, আর /api-docs-এ সম্পূর্ণ API খোলা। এখনই একটি ইমেজ থেকে ন্যারেটেড প্রেজেন্টার ভিডিও তৈরি করুন।

ডেমো ব্যবহার করুন

Voiceover & Subtitles References

The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.

  1. HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)

    Digital-human platforms like HeyGen mentioned here are described per their official product docs.

  2. ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)

    For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.

  3. Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)

    For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.

  4. CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)

    The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.

কেন এটি বিশ্বাস করতে পারেন

এই নিবন্ধটি একজন ফ্রন্ট-লাইন অনুশীলনকারীর দ্বারা লেখা হয়েছিল, এটি লেখার সময়, আমি প্রাথমিক উত্সগুলি যেমন arXiv কাগজপত্র, প্রস্তুতকারকের প্রযুক্তিগত প্রতিবেদন এবং স্ট্যানফোর্ড এআই সূচক ক্রস-চেক করেছি এবং বিষয়গত ছাপের উপর ভিত্তি করে উপসংহার তৈরি করিনি ।

S

SandGrid@lcy362

Agnes Video Generator-এর লেখক · ফুল-স্ট্যাক ডেভেলপার

স্বাধীন বিকাশকারী এবং ওপেন সোর্স এআই ভিডিও জেনারেশন টুল অ্যাগনেস ভিডিও জেনারেটরের লেখক । প্রকল্পটি Agnes AI-এর সম্পূর্ণ বিনামূল্যের ভিডিও মডেলের উপর ভিত্তি করে এবং MIT প্রোটোকলের অধীনে এটি 1,000+ নির্মাতাকে শূন্য খরচে AI ভিডিও তৈরি করতে সাহায্য করেছে । আমি দীর্ঘদিন ধরে ভিডিও জেনারেশন মডেলগুলির প্রকৌশল এবং জনপ্রিয়করণের দিকে মনোযোগ দিয়েছি এবং নিবন্ধের বিষয়বস্তু প্রথম-সারির অনুশীলন এবং প্রথম-হাতের গবেষণা

GitHub-এ দেখুন

সর্বশেষ আপডেট2026-08-21

তৈরি শুরু করতে প্রস্তুত?

"বিশ্বমানের এআই প্রত্যেকের জন্য হোক ।" - ব্রুস ইয়াং সম্পূর্ণ বিনামূল্যে, কোন ক্রেডিট কার্ড বা উচ্চ-পারফরম্যান্স গ্রাফিক্স কার্ডের প্রয়োজন নেই, শূন্য খরচে আপনার প্রথম AI ভিডিও তৈরি করুন । Agnes AI থেকে বিনামূল্যে ভিডিও মডেল চান? শুধু এখানে শুরু করুন ।

GitHub রিপো মোট করে ২ মিনিটে চালু করুন