Trả lời nhanh: Voicebot (bot giọng nói) là phần mềm trò chuyện với con người bằng lời nói thay vì gõ chữ. Nó nghe, chuyển lời thành văn bản, hiểu ý định, quyết định phản hồi rồi trả lời bằng giọng tổng hợp. Voicebot có mặt trong tổng đài, ứng dụng di động, loa thông minh, ô tô và nhà thông minh.
Điểm chính
- Voicebot kiểu truyền thống là một chuỗi 5 khâu: bắt giọng nói, nhận dạng giọng nói (ASR), hiểu ý (NLU hoặc LLM), quản lý hội thoại và tổng hợp giọng nói (TTS).
- Thế hệ mới dùng mô hình “nghe và nói trực tiếp” (speech-to-speech). OpenAI công bố GPT-4o ngày 13/05/2024 với thời gian phản hồi âm thanh trung bình 320 mili giây, gần với tốc độ đối đáp của người.
- Tiếng Việt khó với máy vì thanh điệu mang nghĩa, giọng vùng miền, tên riêng, số liệu và tiếng ồn từ đường điện thoại.
- Đánh giá voicebot không chỉ bằng độ chính xác nhận dạng (WER) mà còn bằng tỷ lệ hoàn thành tác vụ, độ trễ, khả năng xử lý khi bị ngắt lời.
- Tại Việt Nam, voicebot phải cho người dùng biết họ đang nói với AI (Luật Trí tuệ nhân tạo 134/2025/QH15), tuân thủ quy định gọi quảng cáo (Nghị định 91/2020/NĐ-CP) và bảo vệ giọng nói như dữ liệu cá nhân (Luật 91/2025/QH15).
Mục lục
- Voicebot là gì?
- Voicebot hoạt động như thế nào?
- Voicebot khác chatbot, IVR, callbot và trợ lý ảo thế nào?
- Voicebot thế hệ LLM khác gì voicebot truyền thống?
- Vì sao làm voicebot tiếng Việt khó?
- Voicebot được ứng dụng trong những ngành nào?
- Đánh giá chất lượng voicebot bằng chỉ số nào?
- Pháp luật Việt Nam quy định gì với voicebot?
- Giọng nói giả bằng AI ảnh hưởng tới voicebot thế nào?
- Doanh nghiệp nên bắt đầu với voicebot như thế nào?
- Câu hỏi thường gặp
Voicebot là gì?
Voicebot, còn viết là voice bot hay gọi là bot giọng nói, là một hệ thống phần mềm có thể hội thoại với con người bằng giọng nói. Bạn nói một câu tự nhiên như “Tôi muốn đổi lịch hẹn sang thứ Sáu”. Voicebot nghe, hiểu bạn cần gì, kiểm tra dữ liệu, rồi trả lời bằng giọng nói: “Thứ Sáu còn trống lúc 9 giờ và 14 giờ, bạn chọn giờ nào?”.
Điểm khác biệt cốt lõi so với tổng đài bấm phím hay loa phát thông báo là hai chiều và có ngữ cảnh. Voicebot không chỉ phát một đoạn ghi âm sẵn. Nó theo dõi cuộc trò chuyện qua nhiều lượt, nhớ bạn vừa nói gì, hỏi lại khi thiếu thông tin và thực hiện hành động thật như đặt lịch, tra cứu đơn hàng hay bật điều hoà.
Ngày nay, cụm từ “voicebot AI” thường dùng để nhấn mạnh rằng các khâu nghe, hiểu và nói đều chạy bằng mô hình học máy, khác với hệ thống nhận lệnh cố định thời kỳ đầu.
Voicebot “sống” ở những đâu?
Nhiều bài viết chỉ gắn voicebot với tổng đài. Thực tế, đó chỉ là một trong năm môi trường phổ biến:
- Tổng đài điện thoại: tiếp nhận cuộc gọi đến hoặc gọi ra cho khách hàng. Ví dụ, theo Hiệp hội Ngân hàng Việt Nam, VietinBank chính thức triển khai AI VoiceBot từ ngày 05/02/2026, hoạt động 24/7 bằng tiếng Việt, tiếng Anh và tiếng Nhật.
- Ứng dụng di động và website: nút micro để hỏi đáp, tìm kiếm, đặt hàng bằng giọng nói ngay trong app.
- Ô tô: trợ lý giọng nói trên xe điều khiển điều hoà, dẫn đường, gọi điện mà tài xế không rời tay khỏi vô lăng. Trợ lý ViVi do VinBigData phát triển được tích hợp trên xe VinFast VF e34, kích hoạt bằng câu “Hey VinFast” (báo Diễn đàn Doanh nghiệp, 12/2021).
- Loa thông minh và nhà thông minh: bật đèn, hẹn giờ, hỏi thời tiết qua các thiết bị như Amazon Echo (ra mắt cùng Alexa tháng 11/2014).
- Thiết bị và quy trình nội bộ: nhân viên kho, kỹ thuật viên hiện trường ra lệnh hoặc ghi nhận công việc bằng giọng nói khi tay đang bận (ví dụ minh hoạ).
Khi voicebot đặt trong tổng đài và kết hợp với định tuyến cuộc gọi, ghi âm, chấm điểm chất lượng, ta có một hệ thống lớn hơn gọi là tổng đài AI. Phần vận hành tổng đài, các dạng callbot và KPI tổng đài được phân tích riêng trong bài AI call center và callbot. Bài này tập trung vào bản thân công nghệ voicebot.
Voicebot hoạt động như thế nào?
Phần lớn voicebot đang chạy thực tế được ghép từ nhiều mô-đun nối tiếp nhau, gọi là kiến trúc chuỗi (cascade). Mỗi lượt nói đi qua 5 khâu dưới đây.
Khâu 1: Bắt giọng nói (đánh thức và VAD)
Trên loa hay ô tô, thiết bị luôn “nghe” một từ đánh thức (wake word) như “Hey VinFast” và chỉ bắt đầu xử lý sau khi nghe thấy. Trong cuộc gọi, voicebot dùng bộ phát hiện lời nói (Voice Activity Detection, VAD) để biết khi nào người dùng bắt đầu và kết thúc câu. Khâu này nghe đơn giản nhưng quyết định trải nghiệm: cắt câu quá sớm thì bot trả lời khi bạn chưa nói xong; chờ quá lâu thì bot “đơ” vài giây.
Khâu 2: Nhận dạng giọng nói (ASR)
Mô-đun nhận dạng giọng nói tự động (Automatic Speech Recognition, ASR) chuyển âm thanh thành văn bản. Với voicebot, ASR phải chạy dạng luồng (streaming): vừa nghe vừa nhả chữ, không đợi hết câu. Cách ASR trích đặc trưng âm thanh, giải mã và hậu xử lý được giải thích chi tiết trong bài speech to text là gì.
Khâu 3: Hiểu ý (NLU hoặc LLM)
Văn bản từ ASR được đưa vào bộ hiểu ngôn ngữ tự nhiên (Natural Language Understanding, NLU) để xác định ý định (muốn đổi lịch, hỏi số dư, báo hỏng) và thực thể (ngày, giờ, mã đơn, số tiền). Voicebot đời cũ dùng bộ phân loại ý định huấn luyện trên câu mẫu. Voicebot mới thường dùng mô hình ngôn ngữ lớn (LLM), hiểu được câu nói vòng vo, sửa lời giữa chừng hoặc gộp nhiều yêu cầu trong một câu.
Khâu 4: Quản lý hội thoại và hành động
Bộ quản lý hội thoại (dialog manager) quyết định bước tiếp theo: hỏi thêm thông tin còn thiếu, gọi API sang hệ thống CRM hay phần mềm đặt lịch, xác nhận lại với người dùng hoặc chuyển sang người thật. Đây là nơi chứa “luật chơi” của doanh nghiệp: câu nào được nói, dữ liệu nào được đọc ra, khi nào phải dừng.
Khâu 5: Tổng hợp giọng nói (TTS)
Câu trả lời dạng chữ được chuyển thành giọng nói bằng công nghệ tổng hợp giọng nói (Text to Speech, TTS). Chất lượng TTS quyết định bot nghe “như người” hay “như máy”: ngữ điệu, ngắt nghỉ, đọc đúng số tiền và tên riêng. Các thế hệ TTS và giọng tiếng Việt được trình bày trong bài chuyển văn bản thành giọng nói (TTS).
Vì sao voicebot hay bị “khựng”?
Trong kiến trúc chuỗi, độ trễ của 5 khâu và đường truyền mạng cộng dồn lại. Chính OpenAI cho biết chế độ trò chuyện giọng nói (Voice Mode) trước GPT-4o là chuỗi 3 mô hình riêng: một mô hình chép lời, GPT-3.5 hoặc GPT-4 xử lý văn bản, một mô hình đọc lại thành tiếng. Độ trễ trung bình là 2,8 giây với GPT-3.5 và 5,4 giây với GPT-4. Trong hội thoại, vài giây im lặng đủ khiến người nghe tưởng mất kết nối hoặc nói chen vào.
Kiến trúc chuỗi còn làm mất thông tin. Khi giọng nói bị rút gọn thành chữ, mô hình ở giữa không “nghe” được giọng điệu bực bội, tiếng cười hay tiếng ồn xung quanh. OpenAI cũng nêu đúng hạn chế này khi giải thích lý do xây GPT-4o.
Voicebot khác chatbot, IVR, callbot và trợ lý ảo thế nào?
Năm khái niệm này hay bị dùng lẫn lộn. Bảng dưới đây giúp bạn phân biệt nhanh.
| Tiêu chí | Voicebot | Chatbot | IVR truyền thống | Callbot | Trợ lý ảo |
|---|---|---|---|---|---|
| Kênh giao tiếp | Giọng nói | Văn bản (web, app, mạng xã hội) | Giọng nói và phím bấm qua điện thoại | Cuộc gọi điện thoại | Giọng nói, văn bản hoặc cả hai |
| Người dùng nói gì | Câu tự nhiên | Câu tự nhiên dạng gõ | Bấm phím theo menu hoặc vài từ khoá | Câu tự nhiên | Câu tự nhiên |
| Cách xử lý | ASR, NLU/LLM, quản lý hội thoại, TTS | NLU/LLM, quản lý hội thoại | Cây menu cố định, ghi âm sẵn | Như voicebot, thêm hạ tầng tổng đài | Như voicebot hoặc chatbot, thêm khả năng thực hiện nhiều loại tác vụ |
| Phạm vi | Một hoặc vài nghiệp vụ | Một hoặc vài nghiệp vụ | Định tuyến cuộc gọi | Chủ yếu gọi ra (nhắc lịch, khảo sát, xác nhận) | Rộng, phục vụ một người dùng trong nhiều việc |
| Ví dụ | Bot đặt lịch qua điện thoại, giọng nói trong app | Hộp chat hỗ trợ trên website | “Bấm 1 để gặp bộ phận thẻ” | Cuộc gọi tự động xác nhận đơn hàng | Siri, Alexa, Google Assistant |
Có ba điểm cần nhớ:
- Voicebot và chatbot có chung “bộ não” hiểu ngôn ngữ. Voicebot chỉ thêm tai (ASR) và miệng (TTS). Vì vậy nhiều doanh nghiệp dùng chung kho tri thức cho cả hai. Cách xây dựng phần bộ não được trình bày trong bài chatbot AI.
- Callbot là voicebot đặt trong tổng đài, thường gắn với cuộc gọi ra. Mọi callbot là voicebot, nhưng voicebot trong ô tô hay loa thông minh không phải callbot.
- Trợ lý ảo là khái niệm rộng hơn: một trợ lý có thể dùng voicebot làm giao diện, nhưng còn quản lý lịch, email, thiết bị cho riêng một người. Xem thêm bài trợ lý ảo để hiểu các thế hệ của nó.
Voicebot thế hệ LLM khác gì voicebot truyền thống?
Từ năm 2024, voicebot thay đổi theo hai hướng. Hướng thứ nhất giữ kiến trúc chuỗi nhưng thay khâu hiểu ý bằng LLM. Hướng thứ hai bỏ hẳn chuỗi, dùng một mô hình nghe và nói trực tiếp (speech-to-speech).
Speech-to-speech: nghe và nói không qua chữ
Ngày 13/05/2024, OpenAI công bố GPT-4o, một mô hình xử lý trực tiếp âm thanh, hình ảnh và văn bản. Theo OpenAI, mô hình có thể phản hồi đầu vào âm thanh nhanh nhất trong 232 mili giây, trung bình 320 mili giây, tương đương thời gian phản hồi của con người trong hội thoại. So với 2,8 đến 5,4 giây của chuỗi cũ, đây là bước nhảy lớn.
Cùng năm 2024, nhóm nghiên cứu Kyutai công bố Moshi, mô hình đối thoại giọng nói “song công toàn phần” (full-duplex). Theo bài báo đăng trên arXiv tháng 9/2024, Moshi mô hình hoá song song giọng của chính nó và giọng người dùng, nên không cần chia lượt nói cứng nhắc. Độ trễ lý thuyết là 160 mili giây, thực tế khoảng 200 mili giây. Nhóm tác giả cũng chỉ ra ba hạn chế của kiến trúc chuỗi: trễ vài giây, mất thông tin phi ngôn ngữ như cảm xúc, và không xử lý được việc nói chồng, ngắt lời.
Ngắt lời (barge-in) và chen lời
Người thật thường cắt ngang: “À không, ý tôi là thứ Bảy”. Một voicebot tốt phải:
- Dừng phát ngay khi người dùng bắt đầu nói (barge-in), thay vì đọc hết câu dài.
- Phân biệt ngắt lời thật với tiếng “ừ”, “vâng” xác nhận đang nghe, hoặc tiếng ồn nền.
- Cập nhật lại ngữ cảnh: phần câu bot chưa kịp đọc coi như chưa nói.
Kiến trúc chuỗi xử lý việc này bằng VAD và quy tắc. Kiến trúc full-duplex xử lý tự nhiên hơn vì mô hình luôn nghe trong khi nói.
Đổi lại, doanh nghiệp phải chấp nhận gì?
Mô hình speech-to-speech khiến việc kiểm soát nội dung khó hơn. Với kiến trúc chuỗi, bạn có bản chữ của từng câu bot sẽ nói, có thể lọc, chặn hoặc ghi log trước khi đọc. Với mô hình hợp nhất, câu nói sinh ra trực tiếp dưới dạng âm thanh. LLM cũng có thể “bịa” thông tin như mọi mô hình tạo sinh. Vì vậy, với nghiệp vụ nhạy cảm như đọc số dư, xác nhận giao dịch, nhiều hệ thống vẫn dùng câu trả lời theo mẫu cố định, chỉ để mô hình tự do ở phần trò chuyện thông thường.
Vì sao làm voicebot tiếng Việt khó?
Một voicebot tiếng Việt tốt phải vượt qua cả khó khăn của nhận dạng lẫn tổng hợp. Dưới đây là năm thách thức hay gặp nhất khi đưa voicebot ra dùng thật.
1. Thanh điệu mang nghĩa
Tiếng Việt chuẩn miền Bắc có 6 thanh. “Ma, má, mà, mả, mã, mạ” là 6 từ khác nhau. Nhận nhầm thanh là nhận nhầm từ. Ở chiều ngược lại, TTS đặt sai thanh hoặc ngữ điệu khiến câu nghe “lơ lớ”, thậm chí đổi nghĩa.
2. Giọng vùng miền
Nhiều phương ngữ miền Nam không phân biệt thanh hỏi và thanh ngã. Giọng miền Trung có cách phát âm và từ vựng riêng. Người dùng cũng trộn từ địa phương như “hổng”, “mô”, “răng”. Một bot chỉ huấn luyện bằng giọng Hà Nội sẽ hỏi lại liên tục khi gặp khách miền Trung, gây khó chịu. Nhận thấy điều này, VinBigData giới thiệu ViVi là trợ lý tiếng Việt “đa vùng miền” ngay từ đầu (theo The Leader, 09/2021).
3. Tên riêng, số và mã
Đây là nơi voicebot hay sai nhất, vì đó lại là thông tin quan trọng nhất của giao dịch:
- Tên người, tên đường, tên sản phẩm: ít xuất hiện trong dữ liệu huấn luyện, dễ bị nhận thành từ phổ thông gần âm.
- Số tiền và ngày tháng: “một trăm linh năm”, “một trăm lẻ năm”, “trăm lẻ năm” là cùng một số. TTS phải đọc “1.500.000 đ” thành “một triệu năm trăm nghìn đồng”, không phải từng chữ số.
- Mã đơn, biển số, email: chuỗi ký tự lẫn chữ và số, cần bot đọc lại từng phần để xác nhận.
4. Nói chen tiếng Anh
Người dùng Việt nói “check lại order giúp em”, “app bị lỗi OTP”. ASR phải nhận được cả từ tiếng Anh phát âm kiểu Việt. TTS phải đọc đúng “OTP”, “Wi-Fi” thay vì đánh vần sai.
5. Tiếng ồn và đường truyền điện thoại
Người gọi thường đứng ngoài đường, trong quán ăn hoặc trên xe máy. Âm thanh qua mạng điện thoại truyền thống còn bị thu hẹp: chuẩn mã hoá G.711 của ITU-T lấy mẫu 8.000 Hz, chỉ giữ dải tần khoảng 300 đến 3.400 Hz, nên nhiều âm gió, âm cuối bị mờ. Mô hình nhận dạng tốt trên micro điện thoại có thể kém hẳn khi chạy trên tổng đài.
Lưu ý: đừng chọn voicebot chỉ dựa trên bản demo trong phòng yên tĩnh. Hãy thử bằng bản ghi thật của khách hàng (đã được phép sử dụng), có đủ giọng ba miền, người lớn tuổi, tiếng ồn đường phố và cuộc gọi qua mạng di động.
Voicebot được ứng dụng trong những ngành nào?
Voicebot hợp nhất với những việc lặp lại, có cấu trúc rõ, hoặc khi người dùng không tiện cầm màn hình. Bảng dưới đây tóm tắt các ứng dụng voicebot phổ biến.
| Ngành, bối cảnh | Việc voicebot làm | Ghi chú |
|---|---|---|
| Ngân hàng, tài chính | Tra cứu thông tin sản phẩm, dịch vụ; hỗ trợ khách hàng mà không phải chờ tổng đài viên | VietinBank triển khai AI VoiceBot từ 05/02/2026, 24/7, ba ngôn ngữ |
| Bán lẻ, thương mại điện tử | Xác nhận đơn, theo dõi giao hàng, tìm sản phẩm bằng giọng nói | Phần vận hành tổng đài xem bài AI call center |
| Ô tô | Điều khiển điều hoà, dẫn đường, gọi điện, đọc tin | ViVi trên VinFast VF e34; VinFast cũng hợp tác Cerence cho trợ lý 6 ngôn ngữ |
| Nhà thông minh | Bật tắt thiết bị, hẹn giờ, hỏi thông tin | Qua loa thông minh hoặc ứng dụng điện thoại |
| Y tế | Nhắc lịch khám, nhắc uống thuốc, đặt lịch | Ví dụ minh hoạ; không dùng để chẩn đoán |
| Dịch vụ công | Hướng dẫn thủ tục, giờ làm việc, hồ sơ cần chuẩn bị | Ví dụ minh hoạ |
| Sản xuất, kho vận | Ghi nhận công việc, đọc checklist khi tay đang bận | Ví dụ minh hoạ |
Nếu bạn đang tính đưa voicebot vào tổng đài, hãy đọc thêm bài về tổng đài AI đã dẫn ở phần đầu để nắm các dạng callbot, quy trình chuyển người thật và KPI vận hành. Bài này không nhắc lại phần đó.
Đánh giá chất lượng voicebot bằng chỉ số nào?
Một voicebot có thể nhận dạng đúng 95% từ mà vẫn thất bại, nếu sai đúng con số trong mã đơn hàng. Vì vậy cần đo ở cả ba tầng: nghe, hiểu và hoàn thành việc.
| Tầng | Chỉ số | Đo thế nào | Ý nghĩa |
|---|---|---|---|
| Nghe | Tỷ lệ lỗi từ (WER) | WER = (S + D + I) / N: số từ bị thay (S), bị mất (D), bị chèn thêm (I) chia cho số từ của bản chép lời chuẩn (N) | Càng thấp càng tốt. Nên đo riêng theo vùng miền và độ ồn |
| Nghe | Độ chính xác thực thể | Tỷ lệ số điện thoại, mã đơn, ngày giờ được nhận đúng hoàn toàn | Quan trọng hơn WER với nghiệp vụ giao dịch |
| Hiểu | Độ chính xác ý định | Tỷ lệ câu được gán đúng ý định trên bộ câu thử | Cho biết bot có “hiểu đúng việc” không |
| Hoàn thành | Tỷ lệ hoàn thành tác vụ | Số phiên người dùng đạt mục đích mà không cần người thật / tổng số phiên | Chỉ số kinh doanh quan trọng nhất |
| Hoàn thành | Tỷ lệ hỏi lại, tỷ lệ chuyển người | Số lần bot nói “Xin lỗi, bạn nói lại được không” hoặc chuyển tổng đài viên | Tăng đột biến là dấu hiệu nhận dạng kém |
| Trải nghiệm | Độ trễ phản hồi | Thời gian từ lúc người dùng dứt câu tới lúc bot phát âm thanh đầu tiên | Nên theo dõi cả trung bình và các lượt chậm nhất |
| Trải nghiệm | Xử lý ngắt lời | Tỷ lệ bot dừng đúng khi bị ngắt, tỷ lệ dừng nhầm vì tiếng ồn | Ảnh hưởng mạnh tới cảm giác “nói chuyện với người” |
| Trải nghiệm | Độ tự nhiên của giọng (MOS) | Người nghe chấm điểm từ 1 đến 5 | Đánh giá khâu TTS |
Một lưu ý về WER: chỉ số này có thể lớn hơn 100% nếu hệ thống chèn quá nhiều từ thừa. Cách tính WER và các yếu tố làm sai lệch nó được giải thích kỹ trong bài về speech to text.
Cách kiểm thử voicebot trước khi đưa ra dùng
- Xây bộ câu thử thật: lấy từ ghi âm, lịch sử chat hoặc câu hỏi thường gặp, có đủ cách nói vòng vo, sửa lời, nói tắt.
- Phủ đủ điều kiện âm thanh: ba miền, nam nữ, người lớn tuổi, môi trường ồn, điện thoại cũ.
- Thử các tình huống khó: người dùng im lặng, ngắt lời liên tục, hỏi ngoài phạm vi, cố tình dụ bot nói điều không được phép.
- Chạy thử có giám sát: phát hành cho một nhóm nhỏ, nghe lại mẫu phiên thất bại mỗi tuần, cập nhật kịch bản và từ điển tên riêng.
Pháp luật Việt Nam quy định gì với voicebot?
Chưa có văn bản riêng cho voicebot, nhưng ít nhất ba nhóm quy định áp dụng trực tiếp. Thông tin dưới đây cập nhật đến tháng 10/2026.
Gọi điện tự động và quảng cáo: Nghị định 91/2020/NĐ-CP
Nghị định 91/2020/NĐ-CP ngày 14/08/2020 về chống tin nhắn rác, thư điện tử rác, cuộc gọi rác (hiệu lực từ 01/10/2020) điều chỉnh “gọi điện thoại quảng cáo” nói chung. Văn bản không có điều khoản riêng cho cuộc gọi tự động, nên voicebot gọi ra để quảng cáo cũng phải tuân thủ như người gọi:
- Chỉ gọi quảng cáo khi người nhận đã đồng ý trước. Cuộc gọi quảng cáo không có sự đồng ý trước là cuộc gọi rác (Điều 3).
- Tối đa 01 cuộc gọi quảng cáo tới một số điện thoại trong 24 giờ, chỉ trong khung từ 08 giờ đến 17 giờ, trừ khi có thoả thuận khác với người dùng (Điều 13).
- Không gọi tới số đã đăng ký Danh sách không quảng cáo hoặc đã từ chối nhận quảng cáo.
Ngày 08/09/2026, Bộ Công an đã công bố dự thảo Nghị định mới về chống tin nhắn rác, thư điện tử rác, cuộc gọi rác để lấy ý kiến, mở rộng phạm vi sang cuộc gọi qua ứng dụng OTT và đề xuất định danh doanh nghiệp. Đến thời điểm viết bài, dự thảo chưa được ban hành và Nghị định 91/2020/NĐ-CP vẫn đang áp dụng. Chi tiết về danh sách không quảng cáo, tên định danh và cách cấu hình chiến dịch gọi ra có trong bài về AI call center đã dẫn ở trên.
Phải cho người dùng biết họ đang nói với AI
Luật Trí tuệ nhân tạo số 134/2025/QH15, thông qua ngày 10/12/2025 và có hiệu lực từ 01/03/2026, quy định tại khoản 1 Điều 11: nhà cung cấp phải bảo đảm hệ thống AI tương tác trực tiếp với con người được thiết kế và vận hành để người sử dụng nhận biết khi đang tương tác với hệ thống, trừ trường hợp pháp luật có quy định khác. Với voicebot, cách đơn giản nhất là tự giới thiệu ngay câu đầu, ví dụ “Tôi là trợ lý tự động của…”.
Khoản 4 Điều 11 yêu cầu âm thanh do AI tạo ra để mô phỏng, giả lập giọng nói của người thật phải được gắn nhãn dễ nhận biết. Nếu doanh nghiệp nhân bản giọng một người dẫn chương trình hay một nhân viên làm giọng cho voicebot, cần lưu ý điều này. Nghị định 142/2026/NĐ-CP ngày 30/04/2026 (hiệu lực từ 01/05/2026) quy định chi tiết Luật Trí tuệ nhân tạo, trong đó có hình thức gắn nhãn, kể cả bằng thông báo âm thanh.
Giọng nói là dữ liệu cá nhân, có thể là dữ liệu sinh trắc học
Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 (thông qua 26/06/2025, hiệu lực 01/01/2026) định nghĩa dữ liệu cá nhân là dữ liệu xác định hoặc giúp xác định một con người cụ thể. Bản ghi giọng nói, nội dung cuộc trò chuyện, số điện thoại mà voicebot thu được thường thuộc nhóm này. Ba điểm cần lưu ý:
- Sự đồng ý phải rõ ràng. Theo Điều 9, im lặng hoặc không phản hồi không được coi là đồng ý. Nghị định 356/2025/NĐ-CP ngày 31/12/2025 (hiệu lực 01/01/2026) công nhận cuộc gọi có ghi âm là một phương thức thể hiện sự đồng ý (điểm b khoản 1 Điều 6), nên voicebot có thể xin đồng ý ngay trong cuộc gọi, nhưng phải lưu lại bằng chứng.
- Dùng giọng nói để nhận diện người là xử lý dữ liệu nhạy cảm. Khoản 2 Điều 31 Luật 91/2025/QH15 định nghĩa dữ liệu sinh trắc học là dữ liệu về thuộc tính vật lý, đặc điểm sinh học cá biệt và ổn định của một người để xác định người đó. Luật không liệt kê đích danh “giọng nói”, nhưng khi doanh nghiệp tạo “dấu vân giọng” (voiceprint) để xác thực khách hàng, dữ liệu này có thể rơi vào định nghĩa trên. Điều 4 khoản 1 Nghị định 356/2025/NĐ-CP xếp dữ liệu sinh trắc học vào dữ liệu cá nhân nhạy cảm, kéo theo yêu cầu bảo vệ cao hơn.
- Kiểm soát nhà cung cấp. Hỏi rõ bản ghi lưu ở đâu, bao lâu, ai được nghe lại, có bị dùng để huấn luyện mô hình hay không. Nếu dữ liệu được xử lý trên máy chủ ở nước ngoài, cần xem thêm quy định về chuyển dữ liệu cá nhân ra nước ngoài.
Lưu ý: nội dung trên là tóm tắt để định hướng, không thay thế tư vấn pháp lý. Với dự án gọi ra quy mô lớn hoặc dùng sinh trắc học giọng nói, hãy rà soát cùng bộ phận pháp chế trước khi triển khai.
Giọng nói giả bằng AI ảnh hưởng tới voicebot thế nào?
Cùng công nghệ giúp voicebot nói tự nhiên cũng giúp kẻ xấu giả giọng người khác. Ngày 05/01/2023, nhóm nghiên cứu của Microsoft công bố VALL-E, mô hình có thể tổng hợp giọng nói cá nhân hoá chất lượng cao chỉ từ một bản ghi 3 giây của người nói chưa từng gặp. Điều này tạo ra hai rủi ro:
- Vượt qua xác thực bằng giọng nói. Nếu voicebot ngân hàng chỉ dựa vào câu “giọng nói của tôi là mật khẩu”, một bản ghi giả có thể đánh lừa hệ thống thiếu cơ chế chống giả mạo.
- Lừa đảo bằng cuộc gọi giả người thân, giả cán bộ. Ngày 31/03/2025, Công an TP Hà Nội cảnh báo thủ đoạn dùng deepfake giả hình ảnh, giọng nói người thân; một người mẹ đã chuyển 150 triệu đồng cho “con trai” giả.
Luật An ninh mạng số 116/2025/QH15 (hiệu lực từ 01/07/2026) cấm sử dụng trí tuệ nhân tạo hoặc công nghệ mới để giả mạo video, hình ảnh, giọng nói của người khác trái quy định pháp luật (Điều 7). Với doanh nghiệp vận hành voicebot, các biện pháp nên áp dụng là:
- Không dùng giọng nói làm yếu tố xác thực duy nhất cho giao dịch giá trị cao. Kết hợp OTP, ứng dụng ngân hàng hoặc gọi lại số đã đăng ký.
- Nếu dùng sinh trắc học giọng nói, yêu cầu nhà cung cấp có cơ chế phát hiện giọng giả (anti-spoofing) và kiểm thử định kỳ.
- Không để voicebot đọc thông tin nhạy cảm cho bất kỳ ai chỉ vì “nghe giống” chủ tài khoản.
- Truyền thông cho khách: voicebot của doanh nghiệp không bao giờ đề nghị chuyển tiền vào tài khoản cá nhân hay hỏi mã OTP.
Cách nhận biết và phòng chống nội dung giả mạo được trình bày đầy đủ trong bài deepfake là gì.
Doanh nghiệp nên bắt đầu với voicebot như thế nào?
- Chọn một nghiệp vụ hẹp: ví dụ nhắc lịch hẹn hoặc tra cứu trạng thái đơn. Tránh khởi đầu bằng “bot trả lời mọi câu hỏi”.
- Chọn kênh: tổng đài, ứng dụng hay thiết bị. Mỗi kênh có yêu cầu âm thanh và độ trễ khác nhau.
- Chọn kiến trúc theo rủi ro: nghiệp vụ có số liệu, tiền bạc nên dùng kiến trúc chuỗi với câu trả lời theo mẫu; nghiệp vụ tư vấn, trò chuyện có thể thử LLM hoặc speech-to-speech.
- Thiết kế lối thoát: người dùng luôn có cách gặp người thật hoặc chuyển sang kênh khác khi bot không hiểu.
- Làm sạch pháp lý từ đầu: câu giới thiệu là AI, xin đồng ý ghi âm, chính sách lưu trữ, hợp đồng xử lý dữ liệu với nhà cung cấp.
- Đo và cải tiến hằng tuần: theo các chỉ số ở phần đánh giá chất lượng, ưu tiên sửa lỗi ở tên riêng và số liệu.
Câu hỏi thường gặp
Voicebot là gì nói ngắn gọn?
Voicebot là phần mềm trò chuyện với bạn bằng giọng nói: nghe, hiểu, làm việc bạn yêu cầu và trả lời bằng giọng tổng hợp. Nó có thể chạy trong tổng đài, ứng dụng, loa thông minh hay ô tô.
Voice bot và voicebot có khác nhau không?
Không. Đây chỉ là hai cách viết của cùng một khái niệm, tiếng Việt thường gọi là bot giọng nói hoặc trợ lý giọng nói.
Voicebot và callbot có giống nhau không?
Callbot là voicebot hoạt động qua cuộc gọi điện thoại, thường dùng để gọi ra như nhắc lịch, khảo sát, xác nhận đơn. Voicebot là khái niệm rộng hơn, bao gồm cả bot giọng nói trong app, thiết bị, ô tô.
Voicebot tiếng Việt có hiểu giọng miền Trung, miền Nam không?
Có thể, nếu mô hình được huấn luyện và kiểm thử đủ dữ liệu từng vùng. Đây là điểm cần kiểm tra kỹ khi chọn giải pháp: yêu cầu nhà cung cấp chạy thử trên bản ghi thật của khách hàng ở cả ba miền.
Voicebot có cần kết nối Internet không?
Tuỳ thiết kế. Phần lớn voicebot xử lý trên đám mây nên cần kết nối. Một số thiết bị như ô tô, loa có thể xử lý lệnh cơ bản ngay trên máy (on-device) và chỉ dùng đám mây cho câu hỏi phức tạp.
Có bắt buộc báo cho khách biết họ đang nói chuyện với voicebot?
Có. Khoản 1 Điều 11 Luật Trí tuệ nhân tạo số 134/2025/QH15 (hiệu lực 01/03/2026) yêu cầu hệ thống AI tương tác trực tiếp với con người phải để người dùng nhận biết họ đang tương tác với hệ thống AI, trừ trường hợp pháp luật có quy định khác.
Voicebot có thay thế được nhân viên không?
Voicebot làm tốt các việc lặp lại, có quy trình rõ, nhưng còn hạn chế với tình huống phức tạp, cần cảm thông hoặc cần quyết định ngoại lệ. Cách làm phổ biến là để voicebot xử lý phần đơn giản và chuyển phần khó cho người thật kèm đầy đủ ngữ cảnh.