Trả lời nhanh: Speech to text (STT), còn gọi là nhận dạng giọng nói tự động (ASR) hay speech recognition, là công nghệ chuyển giọng nói thành văn bản. Máy nghe bản ghi hoặc luồng âm thanh trực tiếp rồi xuất ra chữ có thể tìm kiếm, chỉnh sửa, ví dụ tự gỡ băng một cuộc họp thành biên bản.
Điểm chính
- STT đi qua 4 khâu: tiền xử lý âm thanh, trích đặc trưng, giải mã thành chữ, hậu xử lý.
- Hệ thống cũ ghép mô hình âm học với mô hình ngôn ngữ; hệ thống mới như Whisper (OpenAI, 9/2022) dùng một mạng nơ-ron end-to-end.
- Độ chính xác đo bằng WER (tỷ lệ lỗi từ). Con số “chính xác 98%” chỉ có nghĩa khi biết đo trên dữ liệu nào.
- Tiếng Việt khó vì 6 thanh điệu, giọng vùng miền, từ mượn, âm thanh điện thoại và ít dữ liệu huấn luyện.
- Bản ghi và bản chép lời gắn với một người là dữ liệu cá nhân theo Luật Bảo vệ dữ liệu cá nhân 2025.
Mục lục
- Speech to text là gì?
- Nhận dạng giọng nói ra đời và phát triển thế nào?
- Speech to text hoạt động như thế nào?
- Mô hình truyền thống và mô hình end-to-end khác nhau ra sao?
- Đo độ chính xác speech to text bằng WER như thế nào?
- Vì sao nhận dạng giọng nói tiếng Việt khó hơn?
- Tách người nói, dấu câu và nhận dạng thời gian thực là gì?
- Speech to text được ứng dụng ở đâu trong doanh nghiệp?
- Speech to text và text to speech khác nhau thế nào?
- Chọn giải pháp chuyển giọng nói thành văn bản theo tiêu chí nào?
- Dữ liệu giọng nói có phải dữ liệu cá nhân không?
- Câu hỏi thường gặp
Speech to text là gì?
Nếu cần trả lời speech to text là gì trong một câu: đó là công nghệ nhận đầu vào là giọng nói và trả đầu ra là văn bản. Tài liệu kỹ thuật còn gọi nó là nhận dạng giọng nói tự động (Automatic Speech Recognition, ASR), nhận dạng tiếng nói (speech recognition) hay voice to text.
Ví dụ minh hoạ: cuộc họp giao ban 45 phút được ghi âm. Thay vì thư ký nghe lại và gõ, hệ thống trả về bản chép lời có dấu câu, ghi rõ ai nói câu nào, kèm mốc thời gian. Thư ký chỉ còn rà lỗi và gửi biên bản. Bản chép còn tìm kiếm được: gõ “hạn chót” là thấy ngay đoạn nhắc deadline.
Đừng nhầm với nhận diện người nói (speaker recognition): công nghệ đó trả lời “ai đang nói” để xác thực danh tính, còn STT trả lời “người này nói gì”. STT cũng chỉ chép lời; muốn máy hiểu ý định hay tóm tắt, bạn cần thêm xử lý ngôn ngữ tự nhiên (NLP) ở bước sau.
Nhận dạng giọng nói ra đời và phát triển thế nào?
Bảng dưới chỉ giữ các mốc có tài liệu gốc kiểm chứng được.
| Thời điểm | Sự kiện | Ý nghĩa |
|---|---|---|
| 1952 | Bell Labs (Balashek, Biddulph, Davis) xây máy Audrey | Nhận dạng chữ số do một người đọc |
| 1961–1962 | IBM giới thiệu Shoebox, trình diễn tại Hội chợ Thế giới Seattle 1962 | Hiểu 10 chữ số và 6 từ lệnh như “plus”, “minus”, “total” |
| Thập niên 1970 | James và Janet M. Baker (Carnegie Mellon) đưa mô hình Markov ẩn (HMM) vào nhận dạng tiếng nói | HMM trở thành phương pháp thống trị từ thập niên 1980 |
| Giữa thập niên 1980 | Nhóm Fred Jelinek (IBM) làm máy đánh chữ bằng giọng Tangora | Vốn từ khoảng 20.000 từ, theo hướng thống kê |
| 2006 | Alex Graves và cộng sự công bố CTC | Mạng nơ-ron học được từ âm thanh chưa căn chỉnh, nền móng của mô hình end-to-end |
| 2009–2012 | Nhóm Geoffrey Hinton, Microsoft Research và các nhóm khác dùng mạng nơ-ron sâu cho mô hình âm học | Học sâu bắt đầu thay thế mô hình thống kê cũ |
| 2015–2016 | Mô hình “Listen, Attend and Spell” (Carnegie Mellon, Google Brain) | Một mạng encoder–decoder học trọn từ âm thanh ra chữ |
| 21/09/2022 | OpenAI công bố Whisper, mã nguồn mở | Huấn luyện trên 680.000 giờ âm thanh đa ngôn ngữ, có tiếng Việt |
Bước nhảy lớn nhất đến từ học sâu (deep learning): từ nhận vài chục từ của một người tới chép hội thoại tự nhiên của bất kỳ ai.
Speech to text hoạt động như thế nào?
Quá trình chuyển giọng nói thành văn bản đi qua 4 khâu. Khác biệt lớn nhất giữa các hệ thống nằm ở khâu 3.
Khâu 1: Tiền xử lý âm thanh
Âm thanh được đưa về cùng tần số lấy mẫu (Whisper đổi mọi bản ghi về 16.000 Hz), khử ồn, chuẩn hoá âm lượng. Bộ phát hiện giọng nói (Voice Activity Detection, VAD) bỏ đoạn im lặng; bản ghi dài được chia thành đoạn ngắn. Micro đặt xa, phòng vang hay nhạc chờ sẽ làm sai lệch mọi bước sau.
Khâu 2: Trích đặc trưng
Âm thanh được cắt thành khung rất ngắn, mỗi khung được phân tích năng lượng theo tần số. Kết quả là phổ âm (spectrogram), một dạng “bức ảnh” của âm thanh. Hai đặc trưng phổ biến:
- Phổ log-Mel: dồn phổ theo thang Mel, mô phỏng việc tai người phân biệt tần số thấp tinh hơn tần số cao. Whisper dùng 80 kênh Mel, cửa sổ 25 mili giây, bước 10 mili giây.
- MFCC (Mel-Frequency Cepstral Coefficients): nén phổ Mel thành một nhóm nhỏ hệ số mỗi khung; từng là đặc trưng chuẩn của hệ thống HMM.
Khâu 3: Giải mã thành chữ
Hướng truyền thống chia bài toán cho nhiều mô hình nhỏ. Hướng end-to-end giao cả bài toán cho một mạng nơ-ron. Chi tiết ở phần tiếp theo.
Khâu 4: Hậu xử lý
Đầu ra thô thường là chuỗi chữ thường, không dấu câu, số viết bằng chữ. Hậu xử lý thêm dấu câu, viết hoa, chuẩn hoá ngược (inverse text normalization) như “hai mươi lăm phần trăm” thành “25%”, tách người nói, gắn mốc thời gian và có thể che số thẻ, số giấy tờ trước khi lưu.
Mô hình truyền thống và mô hình end-to-end khác nhau ra sao?
Hệ thống HMM cổ điển ghép bốn mảnh. Mô hình âm học (acoustic model) đoán khung âm thanh ứng với âm vị nào. Từ điển phát âm nối âm vị thành từ. Mô hình ngôn ngữ (language model) chấm điểm chuỗi từ nào hợp lý, ví dụ “báo giá” phổ biến hơn “báo già”. Bộ giải mã tìm câu có tổng điểm cao nhất. Từ khoảng 2009–2012, mô hình âm học dần được thay bằng mạng nơ-ron sâu (hệ lai DNN-HMM).
Mô hình end-to-end nhận đặc trưng âm thanh và xuất thẳng ra chữ. Ba họ kiến trúc chính:
- CTC: đoán một ký tự hoặc ký hiệu “trống” cho mỗi khung rồi gộp ký hiệu lặp. Nhanh, hợp nhận dạng trực tiếp, nhưng thường cần mô hình ngôn ngữ ngoài để sửa chính tả.
- Encoder–decoder có attention: bộ mã hoá “nghe” cả đoạn, bộ giải mã “viết” từng mảnh từ, mỗi bước nhìn lại phần âm thanh liên quan, nên tự học được ngữ cảnh.
- Transformer: dùng cơ chế tự chú ý (self-attention), dễ mở rộng khi có nhiều dữ liệu. Whisper là một encoder–decoder Transformer.
| Tiêu chí | Truyền thống (HMM, DNN-HMM) | End-to-end |
|---|---|---|
| Cấu trúc | Nhiều mô hình huấn luyện riêng rồi ghép | Một mạng, huấn luyện một lần |
| Dữ liệu cần | Ít hơn, nhưng cần từ điển phát âm do chuyên gia làm | Rất nhiều giờ âm thanh có lời chép |
| Thêm từ mới | Sửa từ điển, mô hình ngôn ngữ | Danh sách gợi ý từ (nếu có) hoặc tinh chỉnh |
| Lỗi đặc trưng | Sai với từ ngoài từ điển | “Ảo giác”: lặp câu, chép nội dung không có trong âm thanh |
Lỗi ảo giác được chính bài báo về Whisper ghi nhận: mô hình có thể kẹt lặp một câu hoặc xuất bản chép không liên quan tới âm thanh. Bản chép dùng cho hồ sơ quan trọng vì vậy luôn cần người rà lại.
Đo độ chính xác speech to text bằng WER như thế nào?
Chỉ số chuẩn là WER (Word Error Rate), tỷ lệ lỗi từ. Bạn căn bản máy chép với bản chuẩn do người chép cẩn thận, rồi đếm ba loại lỗi: S (substitution, thay thế: nghe nhầm từ), D (deletion, xoá: bỏ sót từ) và I (insertion, chèn: thêm từ không ai nói).
Công thức: WER = (S + D + I) / N, với N là số từ của bản chuẩn. WER càng thấp càng tốt, và có thể vượt 100% khi máy chèn quá nhiều. Ví dụ tính tay với một câu trong cuộc gọi bán hàng:
Câu chép ra trông gần giống câu gốc, nhưng khách hỏi “giá” thì máy ghi “già”. Vì vậy đừng chỉ nhìn tỷ lệ phần trăm. Vài lưu ý khi đọc WER:
- Quy ra khối lượng sửa: biên bản 1.000 từ với WER 5% là khoảng 50 từ cần sửa.
- Tiếng Việt tính theo âm tiết: công cụ tách theo dấu cách nên “báo giá” là hai từ. WER tiếng Việt và tiếng Anh vì thế không hoàn toàn so được với nhau.
- Chuẩn hoá trước khi so: “25%” và “hai mươi lăm phần trăm” có thể bị tính là lỗi dù đúng nghĩa. Hãy thống nhất quy tắc dấu câu, chữ hoa, cách viết số.
- Hỏi “đo trên dữ liệu nào”: WER trên sách nói đọc rõ có thể thấp hơn nhiều so với cuộc gọi ồn. Con số không kèm bộ dữ liệu đo thì không dùng để so sánh được.
Vì sao nhận dạng giọng nói tiếng Việt khó hơn?
Mô hình chép tiếng Anh rất tốt vẫn có thể chép tiếng Việt kém, vì chất lượng phụ thuộc vào dữ liệu và đặc điểm từng ngôn ngữ.
Thanh điệu mang nghĩa
Tiếng Việt chuẩn miền Bắc có 6 thanh: ngang, huyền, sắc, hỏi, ngã, nặng. Khác thanh là khác từ: “giá” và “già”, “bán” và “bàn”. Thanh thể hiện qua đường cao độ, vốn khác nhau giữa người giọng trầm và giọng cao, nói nhanh và nói chậm.
Giọng vùng miền và từ đồng âm
Ở phương ngữ Nam, thanh hỏi và thanh ngã nhập làm một, nên “sửa” và “sữa” nghe gần như giống hệt; máy chỉ chọn đúng nhờ ngữ cảnh “sửa máy” hay “uống sữa”. Nhiều phụ âm và vần cũng đọc khác giữa các vùng, như “v” và “d”, “-n” và “-ng” cuối từ. Khi thử nghiệm, bạn cần mẫu ghi âm đủ ba miền.
Từ mượn và nói chen tiếng Anh
Hội thoại văn phòng đầy từ như “deadline”, “KPI”, “check lại file”; khách đọc tên sản phẩm, mã đơn, email. Máy phải quyết định viết “meeting” hay “mít tinh”. Giải pháp tốt cho phép khai báo danh sách từ chuyên ngành.
Tiếng ồn và âm thanh điện thoại
Theo chuẩn G.711 của ITU-T dùng phổ biến trong điện thoại, âm thanh được lấy mẫu 8.000 Hz và chỉ giữ dải khoảng 300–3.400 Hz, trong khi nhiều mô hình hiện đại học trên âm thanh 16.000 Hz. Cộng thêm tiếng xe, nhạc chờ, hai người nói chen, cuộc gọi thường khó chép hơn bản ghi phòng họp.
Dữ liệu huấn luyện ít
Theo bài báo công bố Whisper, trong 680.000 giờ dữ liệu có khoảng 438.000 giờ (65%) là nhận dạng tiếng Anh, còn phần nhận dạng tiếng Việt chưa tới 700 giờ. Nhóm tác giả ghi nhận lượng dữ liệu của một ngôn ngữ dự báo rất sát độ chính xác trên ngôn ngữ đó. Bộ dữ liệu công khai VIVOS của Phòng thí nghiệm AILAB, Trường Đại học Khoa học Tự nhiên (ĐHQG TP.HCM) chỉ có khoảng 15 giờ ghi âm.
Muốn chép tốt trong một ngành cụ thể, doanh nghiệp thường phải có dữ liệu riêng được chép và kiểm tra cẩn thận. Đó là công việc gán nhãn dữ liệu cho âm thanh: nghe, chép lại, đánh dấu người nói và mốc thời gian.
Tách người nói, dấu câu và nhận dạng thời gian thực là gì?
Tách người nói (speaker diarization)
Diarization trả lời câu hỏi “ai nói khi nào”: chia bản ghi thành đoạn và gán nhãn Người nói 1, Người nói 2. Với biên bản họp, đây là khác biệt giữa một khối chữ liền và bản ghi rõ ai cam kết việc gì. Diarization chỉ đánh số; muốn gắn tên thật cần thêm thông tin như danh sách người dự họp. Mẹo cho tổng đài: ghi âm hai kênh riêng cho khách và nhân viên thì hệ thống biết chắc câu nào của ai.
Dấu câu và định dạng
Bản chép không dấu câu khó đọc và làm hỏng các bước sau như tóm tắt. Hãy kiểm tra giải pháp có tự thêm dấu câu, viết hoa, viết số, ngày, tiền theo kiểu Việt Nam hay không.
Thời gian thực (streaming) và theo lô (batch)
| Tiêu chí | Thời gian thực | Theo lô |
|---|---|---|
| Cách chạy | Chép trong lúc người đang nói | Nhận cả tệp ghi âm rồi mới chép |
| Ưu tiên | Độ trễ thấp | Độ chính xác, chi phí |
| Độ chính xác | Thường thấp hơn vì chưa nghe hết câu | Thường cao hơn vì thấy toàn bộ ngữ cảnh |
| Ứng dụng | Phụ đề trực tiếp, callbot, trợ lý ảo | Biên bản họp, phân tích cuộc gọi, phụ đề video đã quay |
Speech to text được ứng dụng ở đâu trong doanh nghiệp?
- Biên bản họp, phỏng vấn: ghi âm, chép lời, tách người nói, rồi dùng mô hình ngôn ngữ tóm tắt và liệt kê việc cần làm. Thư ký chuyển từ “gõ lại” sang “kiểm tra và biên tập”.
- Kiểm soát chất lượng cuộc gọi: thay vì nghe ngẫu nhiên vài cuộc, bộ phận chất lượng chép lời toàn bộ rồi tìm theo từ khoá: nhân viên có đọc đủ câu xác nhận, có dùng từ cấm, khách có đòi huỷ dịch vụ không. STT cũng là “cái tai” của callbot. Cách tổ chức tổng đài có trong bài call center và mô hình vận hành; tổng đài tự động xem tại bài tổng đài AI và callbot.
- Phụ đề, nội dung số: phụ đề cho video đào tạo, livestream, podcast; chép lời để biên tập viên tìm đoạn trích nhanh.
- Ghi chép y tế: bác sĩ đọc nhận xét trong lúc khám, hệ thống chép vào hồ sơ để bác sĩ duyệt. Một số nhà cung cấp có mô hình riêng cho thuật ngữ y khoa, ví dụ chức năng chép lời y tế của Amazon Transcribe. Sai tên thuốc hay liều lượng có thể gây hại, nên bước bác sĩ xác nhận là bắt buộc.
- Trợ lý ảo, điều khiển bằng giọng nói: ra lệnh cho điện thoại, xe, tra cứu thông tin nội bộ; STT phải chạy thời gian thực.
- Hỗ trợ người khiếm thính: phụ đề trực tiếp trong cuộc họp, lớp học, sự kiện; với người khó gõ phím, đọc chính tả là cách nhập liệu chính.
- Nhập liệu hiện trường: nhân viên đọc báo cáo kiểm kho, biên bản giao hàng; bản chép được bóc thành các trường và đẩy vào hệ thống, trở thành một mắt xích của tự động hoá quy trình.
Speech to text và text to speech khác nhau thế nào?
| Tiêu chí | Speech to text (STT, ASR) | Text to speech (TTS) |
|---|---|---|
| Chiều chuyển đổi | Giọng nói → văn bản | Văn bản → giọng nói |
| Vai trò trong callbot | “Cái tai” | “Cái miệng” |
| Khó khăn với tiếng Việt | Nghe đúng thanh điệu, vùng miền, tiếng ồn | Đọc đúng số, ngày, viết tắt; ngữ điệu tự nhiên |
| Đo chất lượng | WER, khách quan | Điểm nghe chủ quan (MOS) |
Cách hoạt động và ứng dụng của chiều ngược lại được trình bày trong bài về TTS tiếng Việt.
Chọn giải pháp chuyển giọng nói thành văn bản theo tiêu chí nào?
Không có giải pháp tốt nhất cho mọi doanh nghiệp. Hãy chấm điểm trên dữ liệu của chính bạn.
| Tiêu chí | Câu hỏi nên đặt | Cách kiểm tra |
|---|---|---|
| Độ chính xác trên dữ liệu thật | WER trên cuộc gọi, cuộc họp của doanh nghiệp là bao nhiêu? | Chép tay chuẩn 1–2 giờ ghi âm thật đã ẩn danh, chạy qua mọi giải pháp, tự tính WER |
| Vùng miền, thuật ngữ | Chép đều ba miền không? Thêm được tên sản phẩm, thuật ngữ không? | Tách WER theo vùng; thử trước và sau khi khai báo từ |
| Tính năng đi kèm | Có tách người nói, dấu câu, mốc thời gian, thời gian thực? | Đọc kết quả mẫu, không chỉ đọc tài liệu |
| Chi phí | Tính theo phút, giây hay gói? Làm tròn thế nào? Tính năng nào thu thêm? | Lấy báo giá chính thức, quy ra chi phí một tháng âm thanh thực tế |
| Bảo mật | Âm thanh lưu ở đâu, bao lâu, có dùng để huấn luyện không? | Đọc điều khoản xử lý dữ liệu, đưa vào hợp đồng |
Triển khai trên đám mây hay tại chỗ (on-premise)?
| Tiêu chí | Đám mây (API) | Tại chỗ |
|---|---|---|
| Bắt đầu | Nhanh, gọi API là dùng | Cần máy chủ, thường cần GPU và đội vận hành |
| Chi phí | Trả theo lượng âm thanh, hợp khối lượng nhỏ, biến động | Đầu tư ban đầu lớn, có lợi khi khối lượng lớn, ổn định |
| Dữ liệu | Âm thanh ra khỏi hạ tầng doanh nghiệp | Âm thanh ở lại mạng nội bộ |
| Phù hợp | Thử nghiệm, doanh nghiệp vừa và nhỏ | Ngân hàng, y tế, đơn vị có yêu cầu dữ liệu nghiêm ngặt |
Mô hình mã nguồn mở như Whisper cho phép tự cài đặt tại chỗ, nhưng doanh nghiệp tự chịu trách nhiệm về độ chính xác tiếng Việt, hạ tầng và bảo trì.
Dữ liệu giọng nói có phải dữ liệu cá nhân không?
Trong đa số trường hợp doanh nghiệp gặp, câu trả lời là có. Căn cứ chính là Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15, thông qua ngày 26/06/2025, có hiệu lực từ 01/01/2026.
- Định nghĩa: khoản 1 Điều 2 định nghĩa dữ liệu cá nhân là dữ liệu số hoặc thông tin dưới dạng khác xác định hoặc giúp xác định một con người cụ thể. Bản ghi gắn số điện thoại khách, bản chép có tên người phát biểu đều thuộc phạm vi này. Cũng khoản này quy định dữ liệu đã khử nhận dạng không còn là dữ liệu cá nhân, nên che tên, số điện thoại trong bản chép trước khi phân tích là cách giảm rủi ro đáng làm.
- Giọng nói dùng để xác thực: khoản 2 Điều 31 mô tả dữ liệu sinh trắc học là dữ liệu về thuộc tính vật lý, đặc điểm sinh học cá biệt và ổn định của một người để xác định người đó. Dùng “dấu vân giọng” để nhận diện khách là xử lý loại dữ liệu này, và Nghị định 356/2025/NĐ-CP ngày 31/12/2025 xếp dữ liệu sinh trắc học vào nhóm dữ liệu cá nhân nhạy cảm.
- Sự đồng ý: theo Điều 9, đồng ý chỉ có hiệu lực khi tự nguyện và người nói biết rõ loại dữ liệu, mục đích, bên kiểm soát dữ liệu, quyền của mình; đồng ý theo từng mục đích; im lặng hoặc không phản hồi không được coi là đồng ý. Điều 19 liệt kê các trường hợp không cần đồng ý, trong đó có thực hiện thoả thuận của chủ thể dữ liệu theo quy định pháp luật.
- Nền tảng trực tuyến: khoản 5 Điều 29 cấm tổ chức cung cấp mạng xã hội, dịch vụ truyền thông trực tuyến ghi âm cuộc gọi khi không có sự đồng ý của chủ thể dữ liệu, trừ trường hợp pháp luật quy định khác.
Cách làm phổ biến là thông báo ngay đầu cuộc gọi hoặc cuộc họp rằng nội dung được ghi âm, chép lời để làm gì, kèm cách từ chối. Điều 6 Nghị định 356/2025/NĐ-CP liệt kê cuộc gọi ghi âm là một phương thức thể hiện sự đồng ý, bên cạnh văn bản, tin nhắn, thư điện tử, và bên kiểm soát dữ liệu phải lưu bằng chứng đồng ý. Ghi âm để giải quyết khiếu nại khác ghi âm để huấn luyện mô hình, nên mỗi mục đích cần căn cứ riêng. Khi thuê dịch vụ STT bên ngoài, hợp đồng nên ghi rõ nhà cung cấp là bên xử lý dữ liệu, không dùng âm thanh để huấn luyện nếu bạn không cho phép, và thời hạn xoá.
Lưu ý: phần này tóm tắt quy định chung để bạn nhận diện rủi ro, không phải tư vấn pháp lý. Ngân hàng, viễn thông, y tế có thể có quy định riêng; hãy rà soát cùng bộ phận pháp chế trước khi triển khai.
Câu hỏi thường gặp
ASR là gì?
ASR là viết tắt của Automatic Speech Recognition, tức nhận dạng giọng nói tự động. Đây là tên gọi kỹ thuật của speech to text.
Speech recognition và voice recognition có giống nhau không?
Không hẳn. Speech recognition nhận ra người ta nói gì; voice recognition (speaker recognition) nhận ra ai đang nói, thường để xác thực danh tính.
Speech to text tiếng Việt chính xác đến đâu?
Độ chính xác nhận dạng giọng nói tiếng Việt phụ thuộc vào chất lượng âm thanh, giọng vùng miền và lĩnh vực. Cùng một giải pháp có thể chép tốt phòng họp yên tĩnh nhưng kém hơn rõ với cuộc gọi ồn. Hãy tự đo WER trên dữ liệu thật của bạn.
Có công cụ chuyển giọng nói thành văn bản miễn phí không?
Có. Bàn phím điện thoại và hệ điều hành thường có sẵn nhập liệu bằng giọng nói, đủ cho ghi chú cá nhân. Với dữ liệu doanh nghiệp, hãy đọc điều khoản vì âm thanh có thể được gửi lên máy chủ bên ngoài.
Speech to text có chạy offline được không?
Được, với các mô hình chạy trên thiết bị hoặc máy chủ nội bộ. Đổi lại bạn cần phần cứng đủ mạnh và tự lo cập nhật.
Ghi âm cuộc họp để chép lời có cần xin phép không?
Nên thông báo trước cho người tham dự và nói rõ mục đích. Bản ghi và bản chép có tên người nói là dữ liệu cá nhân, cần lưu trữ, phân quyền và xoá đúng hạn.