Pipeline 12 công đoạn hoạt động như thế nào?
Dudu Reup sử dụng một pipeline xử lý end-to-end để biến video Douyin tiếng Trung thành video hoàn chỉnh với phụ đề và lồng tiếng tiếng Việt. Mỗi bước trong pipeline được tối ưu cho độ chính xác và chất lượng đầu ra.
Pipeline media, file dự án, cache và MP4 đầu ra được quản lý trên máy. Tùy cấu hình, dịch, kiểm tra bản dịch, tạo metadata hoặc Dudu Cloud TTS có thể gửi dữ liệu cần thiết đến nhà cung cấp cloud.
-
1Tải video từ Douyin
Dudu Reup hỗ trợ dán trực tiếp URL video Douyin. Phần mềm tải video về máy dưới dạng MP4, giữ nguyên chất lượng gốc và nhạc nền.
-
2Nhận dạng tiếng Trung — FunASR/SenseVoice
FunASR với SenseVoice và FSMN VAD chuyển lời nói tiếng Trung thành các đoạn văn bản có timestamp để dịch, chỉnh sửa và tạo giọng theo timeline.
FunASR · SenseVoice · FSMN VAD -
3Dịch sang tiếng Việt — LLM
Transcript tiếng Trung được dịch theo từng đoạn sang tiếng Việt hoặc tiếng Anh, có thể dùng ngữ cảnh series, tone và bước kiểm tra để phát hiện rồi sửa lỗi trước khi tạo giọng.
Claude / GPT-4o / Gemini -
4Tạo phụ đề đồng bộ
Hệ thống tính toán thời điểm xuất hiện của từng từ trong văn bản tiếng Việt dựa trên độ dài ký tự, tạo file phụ đề SRT với timestamp chính xác đồng bộ với audio gốc.
-
5Tổng hợp giọng nói — local hoặc cloud TTS
Dudu Reup tạo audio theo từng đoạn bằng VieNeu local cho tiếng Việt hoặc Dudu Cloud TTS theo catalogue hiện hành. Tiếng Anh hiện dùng Dudu Cloud TTS.
VieNeu TTS v2 -
6Đồng bộ audio mới với video gốc
Audio giọng nói tiếng Việt mới được đồng bộ với timeline video gốc. Dudu Reup xử lý để giọng nói không lấn át hoàn toàn nhạc nền — giữ được cảm xúc của video gốc.
-
7Ghép phụ đề và xuất MP4
Ở bước cuối, Dudu Reup có thể ghép phụ đề vào video và xuất file MP4 hoàn chỉnh. Ứng dụng không tự chèn logo hoặc watermark của Dudu Reup; chất lượng đầu ra còn phụ thuộc video nguồn và thiết lập xuất.
3 công nghệ cốt lõi
Pipeline trên dựa trên 3 công nghệ AI chính. Hiểu cách mỗi công nghệ hoạt động giúp bạn đánh giá chất lượng đầu ra và tối ưu cài đặt.
FunASR/SenseVoice — Nhận dạng
Nhận dạng tiếng Trung có timestamp, kết hợp phát hiện vùng có giọng nói để tạo transcript theo từng đoạn.
FunASR + SenseVoice + FSMN VAD
LLM — Dịch thông minh
Dịch theo timestamp với tone tùy chỉnh, ngữ cảnh series, kiểm tra ngữ nghĩa và tự động sửa lỗi theo cấu hình.
Typical usage: 2K–10K tokens/video
Local / Cloud TTS — Lồng tiếng
Tạo giọng theo từng đoạn, điều chỉnh tốc độ, gán giọng theo người nói và cache audio để retry có mục tiêu.
VieNeu local · Dudu Cloud TTS
Dudu Reup kết hợp xử lý trên máy và cloud như thế nào?
Ứng dụng giữ workflow, file media và cache trên máy, đồng thời cho phép kết nối dịch vụ AI cloud cho các tác vụ phù hợp:
- Dữ liệu dự án trên máy — Video nguồn, artifact từng công đoạn và MP4 đầu ra được tổ chức trong thư mục ứng dụng.
- Không tự chèn watermark — Dudu Reup không tự thêm logo hoặc watermark của ứng dụng vào video xuất. Quyền sử dụng nội dung vẫn phụ thuộc video nguồn và giấy phép liên quan.
- Kết nối cloud có mục đích — Dịch, kiểm tra bản dịch, metadata và Dudu Cloud TTS có thể dùng dịch vụ mạng theo cấu hình.
- Retry theo công đoạn — Cache giúp sửa phụ đề, đổi giọng hoặc khôi phục lỗi mà không lặp lại toàn bộ pipeline.
- Hiệu năng phụ thuộc cấu hình — Thời gian xử lý thay đổi theo video, phần cứng, model, mạng và giới hạn nhà cung cấp.
Tiêu thụ token
Bước dịch LLM thường dùng khoảng 2K–10K token mỗi video. Mức thực tế thay đổi theo thời lượng, lượng hội thoại, ngôn ngữ, ngữ cảnh và các lần kiểm tra hoặc sửa bản dịch.
Kết luận
Dudu Reup kết hợp nhận dạng tiếng Trung, dịch có ngữ cảnh, kiểm tra và sửa bản dịch, TTS theo từng đoạn, đồng bộ timeline, trộn âm thanh, phụ đề và FFmpeg trong một pipeline 12 công đoạn.
Điểm khác biệt chính là workflow desktop có artifact rõ ràng, chỉnh sửa trước khi xuất và retry từ công đoạn cần thiết, thay vì một kết quả cố định không thể kiểm soát.
Để tối ưu đầu ra, hãy kiểm tra transcript và bản dịch, chọn giọng phù hợp từng người nói, xem trước phụ đề và thử chiến lược đồng bộ phù hợp với từng video.