Voice-over en ondertitels: geluid toevoegen aan AI-video's
De spreker-modus levert ingebouwde TTS-stem en lipsynchronisatie; gewone tekst-naar-video vereist dat je voice-over en ondertitels zelf toevoegt.
Een veelgestelde vraag bij het starten: bevatten door AI gegenereerde video's automatisch voice-over? Moet ik zelf ondertitels toevoegen? Het antwoord hangt af van de generatiemodus die je gebruikt. De spreker-modus genereert stem en lipsynchronisatie automatisch in het model. Gewone tekst-naar-video levert daarentegen alleen beeld — geen voice-over, geen ondertitels. Deze gids legt beide gevallen uit en waar je ondertitels toevoegt.
Spreker-modus: één referentieafbeelding volstaat voor een vertelde presentatorvideo
De spreker-modus heeft maar één referentieafbeelding van een digitale persoon nodig om een video te maken waarin één persoon praat. De voice-over wordt automatisch gegenereerd door de ingebouwde TTS en de lipsynchronisatie wordt in het model afgehandeld — geen extra stemopname of handmatige uitlijning nodig. Let op: scènes met meerdere personages en geavanceerde bewegingsbibliotheken vind je op externe platforms zoals HeyGen, Synthesia of D-ID, en vallen niet onder de spreker-modus hier.
Gewone tekst-naar-video: standaard geen voice-over
Als je alleen een tekstprompt omzet naar video en niemand praat in beeld, bevat het resultaat geen automatische stem en geen ondertitels. Je krijgt alleen helder beeld en verzorgt voice-over en ondertitels zelf in je bewerkingsprogramma. Let ook op de generatielimieten: tot 15–20 seconden per clip, 720p-resolutie en een snelheidslimiet van 16 verzoeken per minuut.
Hoe voeg ik ondertitels toe?
Gewone tekst-naar-video-clips hebben geen ondertitels: brand deze na export in met een editor zoals CapCut, Premiere of vergelijkbaar. Wil je ingebouwde ondertitels, schakel dan over naar de spreker-modus — video's uit deze modus bevatten ondertitels die synchroon lopen met de voice-over.
Probeer het in de demo
Zowel de online demo als Studio bieden een instap in de spreker-modus, en /api-docs stelt de volledige API beschikbaar. Genereer nu een vertelde presentatorvideo uit één afbeelding.
Demo proberenVoiceover & Subtitles References
The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.
- HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)
Digital-human platforms like HeyGen mentioned here are described per their official product docs.
- ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)
For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.
- Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)
For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.
- CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)
The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.
Waarom u dit kunt vertrouwen
Dit artikel is geschreven door een frontline-beoefenaar. Tijdens het schrijven zijn primaire bronnen zoals arXiv-papers, leveranciers-technische rapporten en Stanford AI Index kruislings geverifieerd, niet gebaseerd op subjectieve indrukken.
SandGrid@lcy362
Auteur van Agnes Video Generator · Full-Stack ontwikkelaar
Onafhankelijke developer, auteur van de open-source AI-videogeneratietool Agnes Video Generator. Het project is gebaseerd op het volledig gratis videomodel van Agnes AI, MIT open-source-licentie, en heeft al meer dan 1.000 creators geholpen om zonder kosten AI-video's te maken. Houdt zich al lang bezig met de engineering en democratisering van videogeneratiemodellen; de artikelinhoud komt allemaal uit frontline-praktijk en primair onderzoek.
Bekijk op GitHubLaatst bijgewerkt:2026-08-21
Klaar om te beginnen?
「Laat wereldklasse AI van iedereen zijn。」 — Bruce Yang. Volledig gratis, geen creditcard, geen krachtige GPU nodig. Je eerste AI-video begint bij nul kosten. Wil je het gratis videomodel van Agnes AI gebruiken? Begin hier.
Kloon de GitHub-repo en start in 2 minuten