Narasi & Subtitle: Menambahkan Suara pada Video AI
Mode pembicara menyediakan suara TTS dan sinkronisasi bibir bawaan; teks-ke-video biasa mengharuskan Anda menambahkan narasi dan subtitle sendiri.
Pertanyaan umum saat baru memulai: apakah video buatan AI datang dengan narasi? Apakah saya harus menambahkan subtitle sendiri? Jawabannya bergantung pada mode generasi yang Anda gunakan. Mode pembicara menghasilkan suara dan sinkronisasi bibir secara otomatis di dalam model. Sedangkan teks-ke-video biasa hanya menghasilkan visual — tanpa narasi, tanpa subtitle. Panduan ini menjelaskan kedua kasus tersebut dan di mana menambahkan subtitle.
Mode pembicara: satu gambar referensi cukup untuk video presenter bersuara
Mode pembicara hanya membutuhkan satu gambar referensi digital human untuk menghasilkan video satu orang berbicara. Narasi dibuat otomatis oleh TTS bawaan, dan sinkronisasi bibir ditangani di dalam model — tanpa perlu merekam suara tambahan atau menyesuaikan secara manual. Catatan: adegan multi-karakter dan pustaka gerakan lanjutan tersedia di platform eksternal seperti HeyGen, Synthesia atau D-ID, dan tidak termasuk dalam mode pembicara di sini.
Teks-ke-video biasa: tanpa narasi secara default
Jika Anda hanya mengubah prompt teks menjadi video dan tidak ada orang yang berbicara di dalam bingkai, hasilnya tidak memuat suara otomatis maupun subtitle. Anda hanya mendapatkan visual bersih, dan narasi serta subtitle ditangani sendiri di alat penyunting. Perhatikan juga batas generasi: hingga 15–20 detik per klip, resolusi 720p, dan batas kecepatan 16 permintaan per menit.
Bagaimana cara menambahkan subtitle?
Klip teks-ke-video biasa tidak memiliki subtitle: bakar subtitle setelah ekspor menggunakan editor seperti CapCut, Premiere, atau sejenisnya. Jika ingin subtitle bawaan, ganti ke mode pembicara — video dari mode ini disertai subtitle yang tersinkronisasi dengan narasi.
Coba di demo
Demo dan Studio daring sama-sama menyediakan pintu masuk mode pembicara, dan /api-docs membuka API lengkap. Buat video presenter bersuara dari satu gambar sekarang.
Coba DemoVoiceover & Subtitles References
The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.
- HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)
Digital-human platforms like HeyGen mentioned here are described per their official product docs.
- ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)
For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.
- Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)
For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.
- CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)
The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.
Mengapa anda bisa percaya
Artikel ini ditulis praktisi lini depan. Saat menulis, sumber-sumber utama seperti paper arXiv, laporan teknis vendor dan Stanford AI Index disilang-cek, bukan kesimpulan berdasarkan kesan subjektif.
SandGrid@lcy362
Penulis Agnes Video Generator · Pengembang Full-Stack
Developer independen, penulis tools video generation AI open source Agnes Video Generator. Proyek ini berbasis model video gratis sepenuhnya Agnes AI, lisensi open source MIT, sudah membantu 1.000+ kreator menghasilkan video AI tanpa biaya. Lama fokus pada rekayasa dan demokratisasi model video generation, konten artikel semua berasal dari praktik lini depan dan riset sumber utama.
Lihat di GitHubTerakhir diperbarui:2026-08-21
Siap Memulai Membuat?
「Jadikan AI kelas dunia milik setiap orang。」 — Bruce Yang. Gratis sepenuhnya, tanpa kartu kredit, tidak butuh GPU kelas atas. Video AI pertamamu mulai dari biaya nol. Mau pakai model video gratis Agnes AI? Mulai dari sini.
Kloning repositori GitHub dan jalankan dalam 2 menit