Audio tổng hợp có một kiểu hỏng đặc trưng: sạch về kỹ thuật và hoàn toàn vô hồn. Gần như không bao giờ là lỗi của model. Đó là lỗi kịch bản và lỗi phối âm, và cả hai đều sửa được mà không cần đụng tới công cụ.
Đây là quy trình thực tế dùng hai công cụ đã có trên trang này — Suno (8.0) cho nhạc và ElevenLabs (7.3) cho giọng nói.
Bắt đầu từ kịch bản, vì giọng đọc sẽ phơi bày nó
Người thuyết minh âm thầm chữa cháy cho văn viết dở. Họ ngắt khi câu quá dài, nhấn ở chỗ chữ nghĩa nhạt, và cứu một đoạn chuyển vụng bằng ngữ điệu. Giọng tổng hợp không làm gì trong số đó — nó đọc đúng thứ bạn viết, khiến văn dở trở nên nghe thấy được.
Hãy đọc to kịch bản trước khi đưa vào model. Chỗ nào bạn vấp, model sẽ vấp theo kiểu khác và tệ hơn. Câu ngắn. Mỗi câu một ý. Dấu câu đặt ở chỗ bạn muốn có hơi thở.
Giọng nói: dùng ElevenLabs ở nơi cách truyền tải quan trọng
ElevenLabs là lựa chọn mạnh hơn khi độ tự nhiên gánh phần nội dung — thuyết minh mà người ta chọn nghe, lồng tiếng nhân vật, bất cứ thứ gì mà một bản đọc phẳng sẽ mất khán giả trong mười lăm giây đầu.
Hãy tạo theo từng đoạn thay vì một bản dài liền mạch. Bản dài dễ trôi, và chỉ một từ hỏng là phải tạo lại tất cả. Cắt theo đoạn văn, giữ những bản tốt, rồi ghép.
Về nhân bản giọng: hãy quyết định ai được phép nhân bản trước khi dựng quy trình quanh nó. Đó là câu hỏi về sự đồng ý và là quyết định chính sách, không phải một nút gạt, và trả lời trước dễ hơn nhiều so với khi đã có cả kho asset phụ thuộc vào câu trả lời.
Nhạc: dùng Suno cho nền, không phải cho đoạn cao trào
Suno đạt 8.0 và thực sự tốt cho việc thử nhanh — phác thảo không khí, bản demo, audio mạng xã hội và nhạc nền. Nên coi nó là nguyên liệu chứ không phải bản master hoàn chỉnh.
Với một nền nhạc dưới lời thuyết minh, thế là vừa đủ. Hãy tạo vài phương án ở đúng không khí bạn muốn, chọn bản có kết cấu ổn định và không có chuyển động giai điệu gây phân tâm, rồi để nó chìm xuống.
Thứ nó không giỏi là đoạn nhạc mà người nghe được kỳ vọng phải chú ý. Nếu âm nhạc là sản phẩm, đây là điểm khởi đầu cho một người thật, không phải thứ thay thế người đó.
Ghép nối: hai quyết định quan trọng
Mức âm lượng trước. Nhạc nền dưới lời nói cần nhỏ hơn nhiều so với bản năng mách bảo — nhỏ tới mức bạn thôi để ý tới nó, và đó chính là mục đích. Nếu người nghe ngân nga theo được thì nó đang quá to.
Thứ hai, hãy chừa khoảng lặng. Giọng tổng hợp thường tới đều đặn, không có chỗ thở, và cách chữa nằm ở khâu dựng chứ không phải prompt: thêm khoảng nghỉ thật ở ranh giới các phần. Nửa giây im lặng làm được nhiều hơn mọi thiết lập giọng.
Nơi quy trình này không thuộc về
Bất cứ trường hợp nào mà người nghe sẽ thấy bị lừa khi biết giọng là tổng hợp. Đó là phán đoán về khán giả của bạn, nhưng quy tắc an toàn là công khai khi giọng nói được trình bày như một con người thay vì như lời thuyết minh.
Cũng nên bỏ qua với audio ngắn và quan trọng — một mẩu quảng cáo thương hiệu ba mươi giây không phải chỗ để tiết kiệm. Bài toán kinh tế của audio tổng hợp chỉ có lời ở quy mô: nhiều module, nhiều ngôn ngữ, cập nhật thường xuyên.