Agnes Video Generator

Lồng tiếng & Phụ đề: Thêm giọng nói vào video AI

Chế độ người dẫn tự có TTS và đồng bộ khẩu hình; văn bản-tạo-video thông thường cần bạn tự thêm lồng tiếng và phụ đề.

Câu hỏi phổ biến khi mới bắt đầu: video do AI tạo ra có sẵn lời thuyết minh không? Tôi có cần tự thêm phụ đề không? Câu trả lời phụ thuộc vào chế độ tạo bạn dùng. Chế độ người dẫn sẽ tự tạo giọng nói và đồng bộ khẩu hình ngay trong mô hình. Còn văn bản-tạo-video thông thường chỉ cho hình ảnh — không lời thuyết minh, không phụ đề. Hướng dẫn này giải thích cả hai trường hợp và nơi để thêm phụ đề.

Chế độ người dẫn: một ảnh tham chiếu là đủ để có video presenter có lời thuyết minh

Chế độ người dẫn chỉ cần một ảnh tham chiếu người ảo là có thể tạo video một người nói chuyện. Lời thuyết minh được tạo tự động bởi TTS tích hợp sẵn, và đồng bộ khẩu hình được xử lý ngay trong mô hình — không cần thu âm thêm hay căn chỉnh thủ công. Lưu ý: các cảnh nhiều nhân vật và thư viện chuyển động nâng cao nằm trên nền tảng bên ngoài như HeyGen, Synthesia hoặc D-ID, không thuộc chế độ người dẫn ở đây.

Mẹo: một ảnh người dẫn cộng TTS tích hợp là đủ — không cần công cụ giọng nói bổ sung.

Văn bản-tạo-video thông thường: không lồng tiếng mặc định

Nếu bạn chỉ chuyển prompt văn bản thành video và không có ai nói trong khung hình, kết quả không có giọng tự tạo cũng không có phụ đề. Bạn chỉ nhận được hình ảnh sạch, và tự xử lý lời thuyết minh cùng phụ đề trong công cụ chỉnh sửa. Cũng lưu ý giới hạn tạo: tối đa 15–20 giây mỗi clip, độ phân giải 720p, và giới hạn tốc độ 16 yêu cầu mỗi phút.

Thêm phụ đề như thế nào?

Clip văn bản-tạo-video thông thường không có phụ đề: hãy thêm phụ đề sau khi xuất bằng trình chỉnh sửa như CapCut, Premiere hoặc tương tự. Nếu muốn phụ đề có sẵn, hãy chuyển sang chế độ người dẫn — video từ chế độ này đi kèm phụ đề đồng bộ với lời thuyết minh.

Thử ngay trong demo

Demo và Studio trực tuyến đều có lối vào chế độ người dẫn, và /api-docs mở toàn bộ API. Tạo video presenter có lời thuyết minh từ một ảnh ngay bây giờ.

Dùng thử Demo

Voiceover & Subtitles References

The TTS voiceover, lip-sync, and subtitle-burning approaches on this page reference the following industry products and open-source tech.

  1. HeyGen — 数字人视频创作平台HeyGen · heygen.com (2025)

    Digital-human platforms like HeyGen mentioned here are described per their official product docs.

  2. ElevenLabs — AI 语音与 TTSElevenLabs · elevenlabs.io (2025)

    For DIY voiceovers, ElevenLabs is a mainstream AI TTS option; its voices and language support follow its official site.

  3. Whisper — 自动语音识别与字幕转录OpenAI · GitHub (openai/whisper) (2023)

    For auto subtitle transcription, OpenAI's open-source Whisper model is a reference implementation.

  4. CapCut — 视频剪辑与字幕工具ByteDance · capcut.com (2025)

    The subtitle-burning features of editors recommended here (Jianying/CapCut, etc.) follow their official docs.

Vì sao bạn có thể tin nội dung này

Bài viết này được viết bởi những người hành nghề tuyến đầu. Khi viết, họ đã kiểm tra chéo các nguồn trực tiếp như bài báo arXiv, báo cáo kỹ thuật của nhà sản xuất và Chỉ số AI Stanford, chứ không phải kết luận dựa trên ấn tượng chủ quan.

S

SandGrid@lcy362

Tác giả Agnes Video Generator · Lập trình viên Full-stack

Nhà phát triển độc lập và tác giả của công cụ tạo Video AI mã nguồn mở Agnes Video Generator. Dự án dựa trên mô hình video hoàn toàn miễn phí của Agnes AI và giao thức MIT mã nguồn mở. Nó đã giúp hơn 1.000 người sáng tạo sản xuất video AI với chi phí 0. Tôi đã tập trung vào kỹ thuật và phổ biến các mô hình tạo video trong một thời gian dài. Nội dung của các bài viết đều đến từ thực tiễn tuyến đầu và nghiên cứu trực tiếp.

Xem trên GitHub

Cập nhật lần cuối2026-08-21

Sẵn sàng bắt đầu sáng tạo?

“Hãy để AI đẳng cấp thế giới thuộc về tất cả mọi người” – Bruce Yang. Hoàn toàn miễn phí, không cần thẻ tín dụng hay card đồ họa hiệu suất cao, tạo video AI đầu tiên của bạn với chi phí 0. Bạn muốn sử dụng mô hình video miễn phí của Agnes AI? Bắt đầu từ đây.

Clone kho GitHub và khởi chạy trong 2 phút