Cách làm giọng AI bớt giống robot: 12 mẹo hiệu quả (2026)
Vì sao giọng AI nghe như robot và 12 mẹo khắc phục: viết để nghe, dùng dấu câu tạo khoảng nghỉ, viết số thành chữ, sửa phát âm, chỉnh tốc độ và hơn thế nữa.
Bạn dán kịch bản vào, nhấn tạo, và giọng đọc nghe… cũng được. Rõ ràng, nhưng đều đều. Nó đọc vội qua các danh sách, nhấn nhầm từ, và đọc "$1.2M" như đang đọc một bảng tính.
Điều bất ngờ là: giờ đây công nghệ hiếm khi là thủ phạm. Trong một nghiên cứu năm 2025 đăng trên PLOS One, người nghe cho rằng giọng AI nhân bản là giọng người thật trong 58–70% số lần, gần bằng mức 62–81% của các bản thu giọng người thật.
Vì vậy, khi giọng AI ngày nay nghe như robot, nguyên nhân thường nằm ở kịch bản và thiết lập, chứ không phải ở bộ máy. Cả hai đều sửa được trong vài phút.
Bài hướng dẫn này sẽ chỉ cho bạn cách làm cụ thể.
Những gì bạn sẽ biết được:
- Năm điều khiến giọng AI nghe như robot
- Cách nhanh để tìm ra âm thanh của bạn đang có vấn đề gì
- 12 mẹo khắc phục, từ viết lại kịch bản đến tinh chỉnh thiết lập giọng
- Cách kiểm soát khoảng nghỉ, con số và cách phát âm mà không cần viết mã
- Giọng đọc AI nên có tốc độ bao nhiêu, kèm số liệu thực tế
- Một ví dụ viết lại hoàn chỉnh, trước và sau, để bạn làm theo
Trả lời nhanh: Để giọng AI bớt giống robot, hãy viết câu ngắn như cách người ta nói chuyện, dùng dấu phẩy, dấu chấm và ngắt đoạn để tạo khoảng nghỉ, viết số và chữ viết tắt thành chữ đầy đủ, viết lại theo cách đọc những từ mà giọng đọc phát âm sai, và chọn giọng hợp với nội dung. Sau đó giảm tốc độ một chút và hạ độ ổn định xuống một chút để giọng biểu cảm hơn. Trong một công cụ chuyển văn bản thành giọng nói bằng AI, phần lớn các bước này chỉ mất vài giây.
Vì sao giọng AI nghe như robot?
Giọng AI nghe như robot khi nhịp điệu, cao độ và khoảng nghỉ của nó không khớp với cách con người thực sự nói. Khi nói, chúng ta lúc nhanh lúc chậm, lúc lên giọng lúc xuống giọng, ngừng lại để lấy hơi và nhấn vào những từ quan trọng. Giọng tổng hợp không làm được những điều đó thì sẽ nghe như robot.
5 nguyên nhân
- Ngữ điệu đều đều. Cao độ giữ nguyên một mức thay vì lên xuống theo ý nghĩa của câu.
- Thiếu khoảng nghỉ. Các câu dính liền vào nhau, không có chỗ để lấy hơi.
- Nhịp độ không đổi. Câu nào cũng được đọc với cùng một tốc độ.
- Nhấn sai chỗ. Điểm nhấn rơi vào sai từ, khiến ý nghĩa của câu bị lệch đi.
- Đọc sai văn bản. Con số, ngày tháng, chữ viết tắt và tên riêng bị đọc không đúng.
Giới nghiên cứu có hẳn một tên gọi cho vấn đề cuối cùng: chuẩn hóa văn bản (text normalization), tức là biến chữ viết thành những từ mà giọng đọc có thể nói ra. Việc này khó ngay cả với các hệ thống hiện đại, vì "1/2" có thể là "một phần hai", "ngày hai tháng một" hay "ngày một tháng hai", tùy vào ngữ cảnh.
Giọng AI đã tiến bộ đến đâu
Các nhà khoa học nghiên cứu tiếng nói đo độ tự nhiên bằng điểm ý kiến trung bình (Mean Opinion Score, MOS): người nghe chấm điểm từng đoạn âm thanh từ 1 (kém) đến 5 (xuất sắc).
| Năm | Cột mốc | Điểm |
|---|---|---|
| 2016 | Các giọng "tham số" (parametric) và "ghép nối" (concatenative) kiểu cũ (thời của những giọng GPS nghe như robot) | 3,67 và 3,86 MOS; giọng người đạt 4,55 |
| 2016 | WaveNet của DeepMind, giọng nơ-ron lớn đầu tiên | 4,21 MOS |
| 2017 | Tacotron 2 của Google | 4,53 MOS so với 4,58 của giọng thu thật |
| 2022 | NaturalSpeech của Microsoft | Không có khác biệt có ý nghĩa thống kê so với bản thu thật |
| 2025 | Nghiên cứu nghe thử trên PLOS One | Giọng nhân bản được cho là giọng người thật trong 58–70% số lần; giọng người thật: 62–81% |
Cũng nghiên cứu đó cho thấy giọng AI có sẵn (không nhân bản từ một người thật) chỉ được cho là giọng người trong khoảng 40% số lần. Khoảng cách này rất đáng kể, và chúng ta sẽ quay lại với nó ở mẹo #11.
Phần lớn âm thanh "robot" ngày nay là do kịch bản
Giọng AI hiện đại có thể nghe như người thật. Nhưng chúng đọc đúng y những gì bạn đưa cho chúng.
Một câu dài 45 từ, có ba chữ viết tắt và một con số tiền đô, sẽ nghe như robot với gần như mọi giọng. Cùng ý đó, nếu được viết lại cho tai người nghe, sẽ trở nên tự nhiên với hầu hết các giọng. Đó là lý do phần lớn các mẹo dưới đây đều xoay quanh văn bản.
Chẩn đoán nhanh
Trước khi thay đổi bất cứ điều gì, hãy nghe một lượt và gọi tên vấn đề. Sau đó chuyển thẳng đến mẹo khắc phục tương ứng.
| Bạn nghe thấy gì | Nguyên nhân có thể | Mẹo khắc phục |
|---|---|---|
| Giọng đều đều, đơn điệu | Giọng không hợp với nội dung, hoặc độ ổn định đặt quá cao | #1, #2, #9 |
| Các ý nối liền nhau, không có chỗ thở | Câu dài, ít dấu phẩy hoặc ít ngắt đoạn | #3, #4 |
| Đọc vội, như bị hụt hơi | Tốc độ quá nhanh, danh sách bị nhồi vào một câu | #3, #8 |
| Nhấn sai từ | Từ quan trọng bị chôn giữa câu | #7 |
| "$1,000,000" bị đọc kỳ lạ | Con số và ký hiệu để nguyên dạng chữ số | #5 |
| Tên riêng hoặc thương hiệu bị đọc sai | Từ lạ, không có quy tắc rõ ràng từ chữ viết ra cách đọc | #6 |
| Mỗi đoạn nghe một kiểu | Kịch bản dài bị chia ra, mỗi phần một thiết lập khác nhau | #10 |
| Nghe "quá sạch", như thu trong phòng thí nghiệm | Âm thanh khô, không có âm nền phòng hay nhạc nền | #12 |
12 mẹo khắc phục
Mẹo #1: Bắt đầu với đúng cấp giọng
Không phải giọng AI nào cũng được tạo ra như nhau. Các mô hình nhanh và rẻ hơn rất hợp để làm bản nháp. Các mô hình cao cấp xử lý nhịp điệu và cảm xúc tốt hơn.
Trên AnySpeech, cùng một đoạn văn bản có thể được tạo ở năm cấp:
| Cấp | Phù hợp nhất cho | Cần biết |
|---|---|---|
| Basic | Bản nháp, bài đọc dài, hỗ trợ khả năng tiếp cận | Miễn phí, dùng được tại trang chuyển văn bản thành giọng nói miễn phí |
| Standard | Nhiều ngôn ngữ và chất giọng vùng miền | 300+ giọng, 40+ ngôn ngữ |
| Flash | Nội dung ngắn, sôi nổi, mang tính trò chuyện | Nhanh và biểu cảm; tối đa 5.000 ký tự mỗi lần tạo |
| Advanced | Lời dẫn tự nhiên ở 70+ ngôn ngữ | Cấp mặc định của chúng tôi cho hầu hết các bản lồng tiếng |
| Pro | Cách đọc tinh tế và tự nhiên nhất | Tốn 2 tín dụng mỗi ký tự; dành cho gói trả phí |
💡 Mẹo hay: Nếu một câu nghe đều đều, đừng vội viết lại. Trước tiên, hãy tạo lại đúng câu đó ở một cấp cao hơn. Nếu giờ nó nghe ổn, vấn đề nằm ở giọng. Nếu vẫn nghe chưa ổn, vấn đề nằm ở kịch bản.
Mẹo #2: Chọn giọng hợp với nội dung
Một giọng nghe rất hay trong quảng cáo có thể nghe lạc lõng khi đọc truyện trước giờ ngủ. Hãy chọn theo mục đích của đoạn âm thanh, đừng chọn theo mẫu nào nghe hay nhất.
| Nội dung | Nên tìm | Nên tránh |
|---|---|---|
| Sách nói, phim tài liệu | Giọng kể ấm áp, đều đặn | Giọng quá hào hứng kiểu "phát thanh viên" |
| Video giải thích, học trực tuyến | Rõ ràng, thân thiện, nhịp vừa phải | Giọng thều thào, nhiều hơi hoặc quá kịch tính |
| Quảng cáo và khuyến mãi | Đầy năng lượng, tươi sáng | Giọng chậm, nhỏ nhẹ |
| YouTube và mạng xã hội | Tự nhiên, như đang trò chuyện | Giọng quá trang trọng |
| Thiền, ru ngủ | Điềm tĩnh, trầm, chậm | Bất cứ giọng nào rộn ràng |
Hãy duyệt thư viện giọng và lọc theo phong cách. Với kịch bản YouTube, trang trình tạo lồng tiếng YouTube có sẵn danh sách các giọng hợp để dẫn chuyện.
Mẹo #3: Viết để nghe, không phải để đọc
Văn viết và văn nói khác nhau. Khi đọc, ta có thể đọc lại một câu dài. Khi nghe thì không.
- Giữ câu ngắn. Cố gắng viết dưới 20 từ. Câu nào dài hơn thì tách ra.
- Dùng lối nói đời thường. "Xong rồi" hay "chưa ai làm cả" nghe như người thật; "quá trình đã được hoàn tất" hay "chưa có cá nhân nào thực hiện" nghe cứng nhắc. Với kịch bản tiếng Anh, hãy dùng dạng rút gọn như "it's", "you'll", "don't".
- Mỗi câu một ý. Hai ý nối với nhau bằng "mà" hay "và" chính là chỗ nhịp đọc bị gãy.
- Dùng câu chủ động. "Chúng tôi đã thử mười công cụ" hay hơn "Mười công cụ đã được đội ngũ của chúng tôi thử nghiệm".
- Tự đọc to một lượt. Nếu bạn hụt hơi, giọng AI cũng sẽ như vậy.
| Viết để đọc | Viết để nghe |
|---|---|
| Sau khi hoàn tất quy trình đăng ký, người dùng sẽ nhận được một email xác nhận. | Bạn đăng ký xong là chúng tôi gửi email xác nhận cho bạn. |
| Sản phẩm, vốn được ra mắt vào năm 2024, đã được hơn 10.000 nhóm sử dụng. | Chúng tôi ra mắt năm 2024. Từ đó đến nay, đã có hơn mười nghìn nhóm đăng ký dùng. |
Mẹo #4: Dùng dấu câu để tạo khoảng nghỉ
Giọng AI hiện đại coi dấu câu như lời chỉ dẫn trong kịch bản sân khấu. Dấu phẩy là một nhịp lấy hơi ngắn. Dấu chấm khiến giọng hạ xuống để khép câu. Một đoạn mới tạo ra khoảng nghỉ dài nhất.
| Dấu câu | Tác dụng thường thấy | Dùng khi |
|---|---|---|
| Dấu phẩy , | Nghỉ ngắn | Chỗ lấy hơi, các mục trong danh sách |
| Dấu chấm . | Dừng hẳn, giọng hạ xuống | Cuối mỗi ý |
| Dấu hai chấm : | Dừng ngắn để dẫn dắt | Ngay trước điều muốn hé lộ hoặc trước một danh sách |
| Gạch ngang dài — | Ngắt mạch suy nghĩ | Lời chen ngang và những chỗ chuyển ý đột ngột |
| Dấu ba chấm … | Nghỉ dài hơn, bỏ lửng | Ngập ngừng, tạo hồi hộp |
| Dấu chấm hỏi ? | Giọng lên cao | Chỉ dùng cho câu hỏi thật |
| Dấu chấm than ! | Nhiều năng lượng hơn | Dùng dè dặt, nếu không sẽ nghe như đang quát |
| Đoạn mới | Khoảng nghỉ dài nhất | Khi chuyển sang chủ đề khác |
📝 Lưu ý: Độ dài chính xác của khoảng nghỉ khác nhau tùy giọng và bộ máy. Chính tài liệu của ElevenLabs cũng cho biết dấu gạch ngang và dấu ba chấm tạo khoảng nghỉ kém ổn định hơn các cách khác. Dấu phẩy, dấu chấm và ngắt đoạn là đáng tin cậy nhất.
Mẹo #5: Viết số, ngày tháng và ký hiệu thành chữ
Chữ số và ký hiệu là chỗ giọng AI hay vấp nhất, vì cùng một chuỗi ký tự có thể được đọc theo nhiều cách.
Tài liệu của ElevenLabs đưa ra một ví dụ rõ ràng: một trong các mô hình tốc độ cao của họ có thể đọc "$1,000,000" thành "one thousand thousand dollars" (một nghìn nghìn đô la). Viết số thành chữ giúp giọng nào cũng khỏi phải đoán.
| Thay vì | Hãy viết | Vì sao |
|---|---|---|
| $1,000,000 | một triệu đô la | Tránh cách nhóm số kỳ lạ |
| $42.50 | bốn mươi hai đô la năm mươi xu | Đọc đúng phần xu |
| 3:30 pm | ba giờ rưỡi chiều | Là giờ, không phải tỉ lệ |
| 2026-01-15 | ngày mười lăm tháng một năm hai nghìn không trăm hai mươi sáu | Cách ghi ngày mỗi nước một khác |
| 25% | hai mươi lăm phần trăm | Một số giọng bỏ qua ký hiệu |
| Dr. Smith | bác sĩ Smith | "Dr." có thể bị hiểu là "Drive" (đường) |
| Q3 | quý ba | Chữ viết tắt dễ bị đánh vần từng chữ cái |
| anyspeech.io/pricing | anyspeech chấm i o gạch chéo pricing | URL bị đọc khó lường |
| 1/2 | một phần hai | Có thể bị hiểu là ngày tháng |
Bạn không cần làm vậy với mọi con số. Những số nhỏ, đơn giản như "3" hay "10" thường không sao. Hãy tập trung vào tiền, ngày tháng, giờ giấc, phần trăm và bất cứ thứ gì có ký hiệu.
Mẹo #6: Sửa phát âm bằng cách viết lại theo cách đọc
Khi giọng đọc phát âm sai một cái tên hay một thương hiệu, hãy viết nó theo đúng cách nó được đọc. Nghe có vẻ như mẹo vặt, nhưng đây là cách duy nhất hiệu quả với mọi bộ máy.
| Từ | Viết lại thành | Vấn đề được giải quyết |
|---|---|---|
| Nguyen | Win | Họ phổ biến, giọng tiếng Anh hay đọc sai |
| Worcestershire | Wuss-ter-sher | Có chữ câm |
| AnySpeech | Any Speech | Tên thương hiệu ghép từ nhiều từ |
| SQL | sequel (hoặc S Q L) | Đọc từng chữ cái hay đọc thành một từ |
| read (thì quá khứ) | red | Cùng cách viết, khác cách đọc |
| live (tính từ) | lyve | "a lyve show" khác với "I live here" |
| GIF | jif (hoặc gif) | Chọn một cách và dùng nhất quán |
Trên AnySpeech, bạn không phải sửa từng kịch bản. Tại trang chuyển văn bản thành giọng nói, hãy mở Pronunciation dictionary (từ điển phát âm), rồi điền vào ô Written text (chữ viết) và Say it like (đọc là), quy tắc sẽ tự động áp dụng cho mọi giọng. Sau khi đăng nhập, bạn có thể lưu tối đa 50 quy tắc.
💡 Mẹo hay: Với những từ viết tắt bạn muốn đọc từng chữ cái, hãy thêm dấu cách hoặc dấu chấm: "F B I" hoặc "F.B.I.". Với từ viết tắt được đọc như một từ, như "NASA", cứ để nguyên.
Mẹo #7: Tạo điểm nhấn bằng trật tự từ
Trong một công cụ chỉ nhận văn bản thuần, bạn không thể đánh dấu một từ là "nhấn vào đây". Nhưng bạn có thể điều khiển điểm nhấn qua cách sắp xếp câu.
- Đặt từ quan trọng ở cuối câu. Tiếng Anh tự nhiên nhấn mạnh phần cuối câu, và tiếng Việt cũng thường dồn thông tin mới về cuối. So sánh "Kết quả khiến ai cũng bất ngờ" với "Ai cũng bất ngờ trước kết quả".
- Tách nó thành một câu riêng. "Miễn phí. Hoàn toàn miễn phí." Câu ngắn tạo ấn tượng mạnh.
- Dùng dấu hai chấm hoặc gạch ngang để hé lộ. "Ở đây chỉ có một điều quan trọng: thời điểm."
- Tránh VIẾT HOA TOÀN BỘ. Nhiều giọng đọc coi chữ in hoa là từ viết tắt và đánh vần từng chữ cái.
Mẹo #8: Chọn đúng tốc độ
Giọng đọc hơi nhanh một chút là lý do phổ biến nhất khiến lời dẫn nghe như máy. Hãy xem người đọc chuyên nghiệp thực sự làm thế nào:
| Nội dung | Nhịp độ thường gặp | Mức tốc độ nên bắt đầu |
|---|---|---|
| Đọc sách nói | Khoảng 155 từ mỗi phút (ACX) | 0,9×–1,0× |
| Trò chuyện hằng ngày | Khoảng 150 từ mỗi phút | 1,0× |
| Hướng dẫn, nội dung kỹ thuật | Chậm hơn một chút so với trò chuyện | 0,9× |
| Quảng cáo và khuyến mãi | Nhanh hơn, nhiều năng lượng | 1,05×–1,1× |
| Thiền, ru ngủ | Chậm và thong thả | 0,8× |
Con số 155 đến từ ACX, nền tảng sách nói của Audible. ACX cho biết phần lớn người thu sách nói đọc khoảng 9.300 từ mỗi giờ.
Trên AnySpeech, thanh trượt Tốc độ ở các cấp Standard, Advanced và Pro có phạm vi từ 0,7× đến 1,2×. Hãy điều chỉnh từng bước nhỏ 0,1×. Tăng giảm quá nhiều một lúc có thể khiến giọng nghe như bị kéo giãn hoặc bị nén lại.
Mẹo #9: Tinh chỉnh Độ ổn định và Độ giống
Ở cấp Advanced và Pro, có hai thanh trượt quyết định giọng biểu cảm đến mức nào.
| Thanh trượt | Thấp hơn | Cao hơn |
|---|---|---|
| Độ ổn định | Biến hóa hơn: dải cảm xúc rộng hơn nhưng khó đoán hơn | Ổn định hơn: nhất quán nhưng có thể nghe đơn điệu |
| Độ giống | Ít rõ hơn, bám giọng gốc lỏng hơn | Rõ hơn, bám sát giọng gốc hơn; mức quá cao có thể sinh ra tạp âm lạ |
Một điểm khởi đầu thực tế:
| Mục tiêu | Độ ổn định | Độ giống |
|---|---|---|
| Kể chuyện giàu cảm xúc | 35–45% | 75% |
| Lời dẫn cân bằng (mặc định) | 50% | 75% |
| Bài học trực tuyến điềm tĩnh, nhất quán | 60–70% | 75–80% |
Mỗi lần, hãy chỉnh độ ổn định khoảng 5–10%, và tạo lại cùng một đoạn văn để dễ so sánh.
Mẹo #10: Tạo kịch bản dài theo từng phần
Kịch bản dài gây ra hai vấn đề. Chỉ cần một câu bị lỗi là bạn phải tạo lại toàn bộ. Còn nếu chia kịch bản một cách tùy tiện, mỗi phần có thể nghe hơi khác nhau.
- Chia ở những chỗ ngắt tự nhiên: chương, cảnh hoặc chỗ chuyển chủ đề, đừng bao giờ cắt giữa đoạn.
- Giữ nguyên thiết lập cho mọi phần: cùng giọng, cùng cấp, cùng tốc độ và độ ổn định.
- Đặt tên tệp theo thứ tự (01-mo-dau, 02-thiet-lap…) để dễ ghép lại.
Trên AnySpeech, các gói trả phí có thể tạo tối đa 50.000 ký tự mỗi lần (5.000 ký tự với gói miễn phí và với cấp Flash). Dù vậy, tạo theo từng chương vẫn giúp việc sửa một câu dễ hơn nhiều.
Mẹo #11: Dùng giọng nhân bản từ người thật
Bạn còn nhớ nghiên cứu trên PLOS One chứ? Giọng nhân bản từ người thật được cho là giọng người thường xuyên hơn hẳn so với giọng AI có sẵn: khoảng 58–70% số lần so với khoảng 40%.
Một giọng nhân bản mang theo nhịp điệu, những nét riêng và cách lấy hơi của một người thật. Nếu bạn thường xuyên thu lời dẫn, bạn có thể nhân bản giọng của chính mình từ một đoạn thu ngắn và dùng nó cho mọi kịch bản.
- Thu trong phòng yên tĩnh, không có nhạc hay tiếng vang.
- Nói đúng như cách bạn muốn bản nhân bản nghe: thoải mái và tự nhiên, đừng bật chế độ "phát thanh viên".
- Chỉ nhân bản giọng của chính bạn, hoặc giọng bạn đã được cho phép rõ ràng để dùng.
Bài hướng dẫn nhân bản giọng của chúng tôi đi qua từng bước của quá trình thu âm.
Mẹo #12: Hoàn thiện ở khâu hậu kỳ
Âm thanh AI thô có thể nghe "sạch" một cách thiếu tự nhiên, như một giọng nói lơ lửng giữa khoảng không. Vài chỉnh sửa nhẹ sẽ giúp nó hòa vào không gian thật.
- Thêm âm nền phòng (room tone). ACX yêu cầu 0,5–1 giây âm nền phòng ở đầu mỗi tệp và 1–5 giây ở cuối. Nhờ vậy, âm thanh không bắt đầu hay kết thúc đột ngột.
- Để nhạc nhỏ hơn hẳn giọng nói. Hướng dẫn về khả năng tiếp cận (WCAG) khuyến nghị âm thanh nền nhỏ hơn lời nói ít nhất 20 decibel.
- Dùng hiệu ứng vừa phải. Nén (compression), vang (reverb) hay EQ quá tay có thể khiến giọng tổng hợp nghe càng giả hơn chứ không bớt đi.
- Giữ đỉnh âm dưới −3 dB để âm thanh không bị vỡ khi phát to (đây cũng là một yêu cầu của ACX).
Trước và sau: Một ví dụ viết lại hoàn chỉnh
Dưới đây là một đoạn văn được viết theo kiểu báo cáo kinh doanh thường thấy, rồi được viết lại cho giọng đọc.
Trước (37 từ, một câu):
Our Q3 revenue grew 23% YoY to $1.2M, driven by strong performance in the EMEA region, which, despite challenging macroeconomic conditions and supply-chain disruptions that affected many of our competitors throughout the period, continued to outperform expectations.
Sau (bốn câu ngắn):
Here's the headline. In the third quarter, revenue grew twenty-three percent compared with last year, to one point two million dollars.
Most of that growth came from Europe, the Middle East and Africa. That region beat our expectations, even in a tough quarter, when supply problems held many competitors back.
Những gì đã thay đổi:
| Thay đổi | Mẹo đã dùng |
|---|---|
| "Q3", "YoY", "EMEA" được viết đầy đủ thành chữ | #5 |
| "23%" và "$1.2M" được viết thành chữ | #5 |
| Một câu 37 từ được tách thành bốn câu | #3 |
| Một câu mở đầu ngắn ("Here's the headline.") để dẫn vào tin chính | #7 |
| Ngắt đoạn giữa phần kết quả và phần bối cảnh | #4 |
Cùng một thông tin. Chẳng có gì cao siêu. Nhưng với gần như mọi giọng, bản thứ hai nghe như một người đang nói chuyện.
Còn SSML thì sao?
SSML (Speech Synthesis Markup Language, ngôn ngữ đánh dấu tổng hợp giọng nói) là một bộ thẻ mà một số bộ máy chuyển văn bản thành giọng nói chấp nhận, chẳng hạn để chèn một khoảng nghỉ có độ dài chính xác hoặc đọc một từ theo cách phát âm cụ thể.
<speak>
Welcome back. <break time="700ms"/> Let's get started.
</speak>SSML vẫn hoạt động với nhiều giọng đám mây truyền thống. Nhưng các mô hình mới, biểu cảm hơn ngày càng bỏ qua nó hoặc chỉ hỗ trợ một phần. Ví dụ, ElevenLabs cho biết các mô hình v3 và v4 mới nhất của họ không hỗ trợ thẻ break của SSML. Các giọng Chirp 3 HD của Google cũng chỉ hỗ trợ một phần.
AnySpeech làm việc với văn bản thuần, vì vậy mọi mẹo trong bài này đều dựa vào cách viết, dấu câu và thiết lập thay vì thẻ. Những cách này hiệu quả với mọi giọng và mọi cấp.
Mẹo cho từng ngôn ngữ
Phần lớn các mẹo ở trên áp dụng được cho mọi ngôn ngữ. Có vài vấn đề chỉ xuất hiện với văn bản không phải tiếng Anh:
- Dùng giọng bản ngữ. Kịch bản tiếng Tây Ban Nha nghe tự nhiên hơn nhiều khi được đọc bằng một giọng dành riêng cho tiếng Tây Ban Nha. Hãy duyệt theo ngôn ngữ ở trang các ngôn ngữ chuyển văn bản thành giọng nói, hoặc chọn một chất giọng, chẳng hạn giọng Anh-Anh.
- Viết số thành chữ bằng ngôn ngữ đích. Với văn bản trộn nhiều ngôn ngữ, giọng đọc có thể đọc nhầm chữ số sang ngôn ngữ khác.
- Dùng dấu câu riêng của ngôn ngữ đó. Tiếng Trung và tiếng Nhật dùng dấu câu toàn độ rộng (。,?), và giọng đọc coi chúng là khoảng nghỉ.
- Nghe thử văn bản trộn ngôn ngữ trước khi chốt. Tên thương hiệu và thuật ngữ tiếng Anh nằm giữa câu của một ngôn ngữ khác là chỗ hay bị vấp. Nếu cần, hãy viết lại chúng theo cách đọc (mẹo #6).
Danh sách kiểm tra cho giọng AI tự nhiên
Hãy rà qua danh sách này trước khi đăng. Nếu một mục chưa đạt, bảng chẩn đoán nhanh sẽ cho bạn biết nên dùng mẹo nào.
- Giọng hợp với nội dung (giọng kể chuyện, giọng trò chuyện hay giọng sôi nổi)
- Câu ngắn, mỗi câu một ý
- Lối nói đời thường được dùng ở những chỗ người thật sẽ nói như vậy
- Mỗi lần chuyển chủ đề đều có ngắt đoạn
- Tiền, ngày tháng, giờ giấc và phần trăm đều được viết thành chữ
- Tên riêng và thương hiệu khó đọc đã được viết lại theo cách đọc hoặc đã có trong từ điển phát âm
- Từ quan trọng trong mỗi câu chính nằm gần cuối câu
- Tốc độ hợp với nội dung (với lời dẫn, hãy bắt đầu ở 0,9×–1,0×)
- Độ ổn định được đặt theo sắc thái bạn muốn
- Kịch bản dài được chia ở chỗ ngắt tự nhiên, với thiết lập giống hệt nhau
- Nhạc nhỏ hơn giọng ít nhất 20 dB
- Bạn đã nghe trọn một lượt, từ đầu đến cuối
Câu hỏi thường gặp
Vì sao giọng AI của tôi nghe như robot?
Thường là do văn bản, không phải do giọng. Câu dài, thiếu dấu câu, chữ viết tắt và chữ số đều đẩy giọng AI về phía cách đọc đều đều, vội vã. Giọng không hợp nội dung, tốc độ quá nhanh hoặc độ ổn định đặt quá cao cũng có thể khiến giọng nghe đơn điệu.
Giọng AI nào nghe tự nhiên nhất?
Còn tùy nội dung và ngôn ngữ, nên hãy thử cùng một kịch bản với vài giọng. Trong các lựa chọn của chúng tôi, cấp Advanced và Pro cho cách đọc tự nhiên nhất. Giọng nhân bản từ người thật thường còn tự nhiên hơn nữa: trong một nghiên cứu năm 2025 trên PLOS One, giọng nhân bản được cho là giọng người thật trong 58–70% số lần.
Làm sao để thêm khoảng nghỉ khi chuyển văn bản thành giọng nói?
Hãy dùng dấu câu. Dấu phẩy tạo khoảng nghỉ ngắn, dấu chấm tạo điểm dừng hẳn, và một đoạn mới tạo khoảng nghỉ dài nhất. Dấu hai chấm và gạch ngang dài tạo một quãng ngắt trước điều muốn hé lộ. Một số bộ máy cũng nhận thẻ break của SSML, nhưng nhiều mô hình mới bỏ qua chúng.
Làm sao để công cụ chuyển văn bản thành giọng nói phát âm đúng một từ?
Hãy viết lại từ đó theo cách đọc, chẳng hạn "Win" cho "Nguyen" (với giọng tiếng Anh) hoặc "red" cho "read" ở thì quá khứ. Trên AnySpeech, hãy lưu cách viết lại này vào Pronunciation dictionary để nó tự động áp dụng cho mọi giọng.
Giọng đọc AI nên có tốc độ bao nhiêu?
Khoảng 150–155 từ mỗi phút hợp với hầu hết lời dẫn. ACX cho biết người thu sách nói trung bình đọc khoảng 9.300 từ mỗi giờ, tức khoảng 155 từ mỗi phút. Hãy bắt đầu ở tốc độ 0,9× đến 1,0×, và chậm lại một chút với nội dung kỹ thuật.
Giọng AI có thể thể hiện cảm xúc không?
Có. Các giọng cao cấp nắm bắt cảm xúc từ chính câu chữ, nên hãy viết cảm xúc vào kịch bản ("Tôi không thể tin nổi."). Hạ độ ổn định sẽ cho dải cảm xúc rộng hơn. Giọng nhân bản Pro còn có sẵn phần điều khiển cảm xúc.
Tôi có còn cần SSML không?
Với hầu hết dự án thì không. SSML hữu ích khi cần khoảng nghỉ và cách phát âm chính xác trên các giọng đám mây truyền thống, nhưng các mô hình biểu cảm mới thường bỏ qua một số thẻ. Các cách dùng văn bản thuần (dấu câu, viết lại theo cách đọc và viết số thành chữ) hiệu quả với mọi bộ máy.
Người nghe có phân biệt được giọng AI với giọng thật không?
Thường là không. Trong một nghiên cứu năm 2025 trên PLOS One, người nghe cho rằng giọng nhân bản là giọng người thật trong 58–70% số lần, so với 62–81% của các bản thu giọng người thật. Giọng AI có sẵn đạt điểm thấp hơn, khoảng 40%.
Làm cho bản lồng tiếng tiếp theo nghe như người thật
Bạn không cần công cụ mới hay kỹ sư âm thanh để sửa một giọng nghe như robot. Hãy bắt đầu từ kịch bản: câu ngắn hơn, dấu câu đầy đủ và số được viết thành chữ. Sau đó tinh chỉnh giọng, tốc độ và độ ổn định.
Thử ngay: dán một đoạn văn vào công cụ chuyển văn bản thành giọng nói của AnySpeech, tạo một lần với văn bản gốc, rồi tạo lại sau khi áp dụng mẹo #3 đến #5. Bạn sẽ nghe ra khác biệt ngay.
Tác giả

Danh mục
Thêm bài viết

Cách bật Voice Isolation: Hướng dẫn từng bước cho mọi thiết bị (2026)
Tìm hiểu cách bật voice isolation trên iPhone, iPad, Mac và Android. Hướng dẫn từng bước cho FaceTime, cuộc gọi điện thoại và các mẹo cho các công cụ tách âm thanh AI.

Cách lồng tiếng video YouTube sang ngôn ngữ khác (2026)
Lồng tiếng video YouTube: dùng lồng tiếng tự động hay tự làm bằng AI, cách thêm track âm thanh đa ngôn ngữ trong Studio, chi phí và danh sách kiểm tra.


Cách tạo podcast bằng AI: Từ một ý tưởng đến chương trình nhiều người dẫn (2026)
Học cách tạo podcast bằng AI chỉ trong vài phút. Biến một chủ đề hay một kịch bản thành cuộc trò chuyện tự nhiên giữa hai người dẫn với giọng AI — từng bước, không cần micro hay chỉnh sửa.
