NLP là gì? Xử lý ngôn ngữ tự nhiên và ứng dụng thực tế

Trả lời nhanh: NLP (Natural Language Processing), tức xử lý ngôn ngữ tự nhiên, là nhánh của trí tuệ nhân tạo giúp máy tính đọc, hiểu và tạo ra ngôn ngữ của con người ở dạng văn bản hoặc lời nói. Ví dụ: Gmail tự lọc thư rác, Google Dịch chuyển câu tiếng Anh sang tiếng Việt.

Điểm chính

  • NLP gồm nhiều tác vụ: tách từ, gán nhãn từ loại, nhận dạng thực thể, phân tích cảm xúc, phân loại văn bản, dịch máy, tóm tắt, hỏi đáp.
  • NLP đi qua ba thời kỳ: luật viết tay (từ thập niên 1950), thống kê (từ khoảng 1990) và học sâu với Transformer (từ 2017).
  • Tiếng Việt khó hơn tiếng Anh vì dấu cách tách âm tiết chứ không tách từ. Ngay cả PhoBERT cũng yêu cầu văn bản đầu vào đã được tách từ.
  • LLM như ChatGPT là một thế hệ mô hình NLP, không thay thế toàn bộ NLP. Nhiều bài toán vẫn chạy tốt và rẻ hơn với mô hình nhỏ.
  • Văn bản khách hàng thường chứa dữ liệu cá nhân, nên dự án NLP phải tuân thủ Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15.
Mục lục
  1. NLP là gì?
  2. NLP ra đời và phát triển như thế nào?
  3. NLP làm được những tác vụ gì?
  4. NLP hoạt động như thế nào?
  5. NLU và NLG khác nhau ra sao?
  6. Vì sao NLP tiếng Việt khó hơn tiếng Anh?
  7. Công cụ và dữ liệu NLP tiếng Việt có những gì?
  8. Ứng dụng NLP trong doanh nghiệp là gì?
  9. NLP có hạn chế và rủi ro gì?
  10. Doanh nghiệp nên bắt đầu NLP từ đâu?
  11. Những hiểu lầm phổ biến về NLP
  12. Câu hỏi thường gặp

NLP là gì?

NLP (Natural Language Processing) là lĩnh vực kết hợp khoa học máy tính, ngôn ngữ học và học máy để máy tính xử lý được ngôn ngữ con người nói và viết hằng ngày. Mục tiêu là biến câu chữ vốn mơ hồ, nhiều tầng nghĩa thành dữ liệu máy hiểu và hành động được.

Ví dụ: bạn gõ “quán phở gần đây còn mở không”. Hệ thống phải hiểu “gần đây” là gần vị trí của bạn, “còn mở” là hỏi giờ hoạt động, rồi mới trả kết quả. Chuỗi “hiểu ý” đó chính là NLP.

NLP là một nhánh của trí tuệ nhân tạo, và các hệ thống hiện đại hầu hết được xây bằng học máy. Có thể hình dung: AI là mục tiêu “máy thông minh”, học máy là cách làm, còn NLP là lĩnh vực áp dụng cho ngôn ngữ, giống thị giác máy tính áp dụng cho hình ảnh. Vậy xử lý ngôn ngữ tự nhiên là gì nếu nói gọn? Đó là mọi kỹ thuật giúp máy làm việc với chữ và lời nói, từ đếm từ khoá đến tóm tắt hợp đồng 50 trang.

Đừng nhầm với NLP trong tâm lý học (Neuro-Linguistic Programming, thường dịch là “lập trình ngôn ngữ tư duy”). Hai khái niệm chỉ trùng chữ viết tắt. Bài này nói về NLP trong công nghệ.

NLP ra đời và phát triển như thế nào?

Để hiểu trọn NLP là gì, hãy nhìn lại hơn 70 năm phát triển của nó. Các mốc quan trọng:

  • Tháng 1/1954, thí nghiệm Georgetown–IBM: Đại học Georgetown và IBM trình diễn tại New York hệ thống dịch tiếng Nga sang tiếng Anh trên máy IBM 701. Hệ thống chỉ có 250 từ và 6 luật ngữ pháp, dịch hơn 60 câu chọn sẵn. Theo nhà nghiên cứu W. John Hutchins, nó làm dấy lên kỳ vọng quá lạc quan rằng dịch máy hoàn chỉnh sắp thành hiện thực.
  • Năm 1966, ELIZA: Joseph Weizenbaum tại MIT viết ELIZA, chương trình trò chuyện đóng vai nhà trị liệu tâm lý. ELIZA chỉ khớp mẫu và thay thế từ để hỏi lại người dùng, nhưng vẫn khiến nhiều người tưởng đang nói chuyện với người thật.
  • Năm 1990, chuyển sang thống kê: nhóm IBM (Peter F. Brown và cộng sự) công bố “A Statistical Approach to Machine Translation” trên tạp chí Computational Linguistics. Máy học cách dịch từ kho văn bản song ngữ thay vì luật viết tay.
  • Năm 2013, word2vec: Tomas Mikolov và cộng sự tại Google biến mỗi từ thành vector số, học từ 1,6 tỷ từ trong chưa đầy một ngày. Từ gần nghĩa nằm gần nhau trong không gian vector.
  • Năm 2017, Transformer: bài báo “Attention Is All You Need” giới thiệu kiến trúc chỉ dựa vào cơ chế chú ý (attention), bỏ mạng hồi quy, nhờ đó huấn luyện được mô hình lớn hơn nhiều.
  • Năm 2018, BERT: Google công bố BERT, mô hình đọc ngữ cảnh cả hai phía của một từ. Cách “tiền huấn luyện rồi tinh chỉnh” trở thành chuẩn cho tác vụ hiểu văn bản.
  • Năm 2020, PhoBERT: VinAI công bố tại EMNLP 2020 (nhánh Findings), mô hình ngôn ngữ đơn ngữ tiếng Việt quy mô lớn công khai đầu tiên.
Các mốc chính của NLP Từ luật viết tay, sang thống kê, rồi học sâu 1954 Georgetown–IBM dịch Nga–Anh 1966 ELIZA chatbot sơ khai 1990 NLP thống kê dịch xác suất 2013 word2vec từ thành vector 2017 Transformer cơ chế attention 2018 BERT ngữ cảnh 2 chiều 2020 PhoBERT cho tiếng Việt Sau 2018: mô hình ngôn ngữ lớn (LLM) dựa trên Transformer phổ biến rộng
Hình 1. Dòng thời gian rút gọn của xử lý ngôn ngữ tự nhiên, các mốc lấy theo công bố gốc của từng công trình.

Từ nền Transformer, các mô hình ngôn ngữ lớn ra đời và đưa NLP tới người dùng phổ thông. Cách các mô hình này hoạt động được giải thích riêng trong bài mô hình ngôn ngữ lớn LLM; bài này tập trung vào NLP như một lĩnh vực rộng hơn.

NLP làm được những tác vụ gì?

NLP là tập hợp nhiều tác vụ, và một sản phẩm thực tế thường ghép vài tác vụ với nhau. Bảng dưới tóm tắt tám tác vụ phổ biến, kèm ví dụ minh hoạ bằng tiếng Việt.

Tác vụMáy làm gìVí dụ minh hoạDùng ở đâu
Tách từ (word segmentation)Chia câu thành đơn vị có nghĩa“Tôi mua máy tính” → Tôi | mua | máy_tínhBước nền của mọi hệ thống tiếng Việt
Gán nhãn từ loại (POS tagging)Xác định danh từ, động từ, tính từ…“bay” trong “chim bay” là động từ, trong “máy bay” là một phần danh từPhân tích cú pháp, trích xuất thông tin
Nhận dạng thực thể (NER)Tìm tên người, tổ chức, địa điểm, ngày, số tiền“Công ty A ký hợp đồng ngày 05/03 tại Đà Nẵng” → tổ chức, ngày, địa điểmĐọc hồ sơ, hợp đồng, che thông tin cá nhân
Phân tích cảm xúc (sentiment analysis)Đánh giá câu tích cực, tiêu cực hay trung tính“Giao nhanh nhưng hộp móp” → khen giao hàng, chê đóng góiĐánh giá sản phẩm, bình luận mạng xã hội
Phân loại văn bản (text classification)Gắn văn bản vào nhóm định sẵnEmail “xin hoàn tiền đơn 123” → Khiếu nại thanh toánĐịnh tuyến ticket, lọc thư rác
Dịch máy (machine translation)Chuyển sang ngôn ngữ khácDịch tài liệu kỹ thuật Anh – ViệtBản địa hoá, hỗ trợ khách quốc tế
Tóm tắt (summarization)Rút gọn văn bản, giữ ý chínhBiên bản họp 2 giờ → 10 gạch đầu dòngBáo cáo, tin tức, hồ sơ
Hỏi đáp (question answering)Trả lời câu hỏi dựa trên tài liệu“Nhân viên thử việc được nghỉ phép không?” → trích đúng điều trong quy chếTrợ lý nội bộ, chăm sóc khách hàng

NLP hoạt động như thế nào?

Máy tính chỉ làm việc với số. Vì vậy mọi hệ thống NLP đều biến chữ thành số, xử lý, rồi biến kết quả trở lại thành thứ con người dùng được.

Quy trình NLP điển hình trong doanh nghiệp 1. Thu thập dữ liệu Email, chat, hợp đồng, bình luận, bản ghi âm 2. Làm sạch, chuẩn hoá Bỏ HTML, chữ ký email, chuẩn Unicode, ẩn danh 3. Tách câu, tách từ học sinh → học_sinh gán từ loại, thực thể 4. Biểu diễn số Token → vector (embedding) 5. Mô hình xử lý Phân loại, NER, cảm xúc, tóm tắt, sinh văn bản 6. Đánh giá, triển khai Đo độ chính xác, người duyệt, giám sát Vòng phản hồi: câu xử lý sai được gán nhãn lại để huấn luyện tiếp Với LLM, bước 3–5 thường gộp lại: mô hình tự tách token và xử lý theo câu lệnh
Hình 2. Sáu bước của một hệ thống NLP, từ dữ liệu thô tới vận hành; chất lượng bước 1–2 quyết định phần lớn kết quả.
  1. Thu thập dữ liệu: email, khung chat, khảo sát, hợp đồng, bản ghi cuộc gọi. Nếu nguồn là bản quét, cần nhận dạng ký tự quang học trước để có chữ.
  2. Làm sạch, chuẩn hoá: bỏ thẻ HTML, chữ ký email; đưa chữ về một chuẩn Unicode; ẩn danh số điện thoại, số căn cước nếu không cần dùng.
  3. Tách câu, tách từ, gán nhãn: với tiếng Việt, đây là bước dễ sai nhất.
  4. Biểu diễn số: mỗi từ hoặc mẩu từ (token) thành vector. Cách cũ là đếm tần suất; cách hiện đại là embedding.
  5. Mô hình xử lý: trả về nhãn cảm xúc, nhóm văn bản, danh sách thực thể hoặc văn bản mới.
  6. Đánh giá, triển khai: đo độ chính xác trên dữ liệu thật, chuyển ca không chắc chắn cho người duyệt, theo dõi lỗi.

Ba cách tiếp cận: luật, học máy thống kê và học sâu

Cách tiếp cậnNguyên lýƯu điểmHạn chế
Dựa trên luật (rule-based)Chuyên gia viết từ điển, biểu thức chính quy, luật ngữ phápDễ giải thích, không cần dữ liệu huấn luyện, chạy nhanhGặp câu lạ là sai, tốn công bảo trì
Học máy thống kêHọc xác suất từ dữ liệu đã gán nhãnLinh hoạt hơn luật, chi phí tính toán thấpPhải thiết kế đặc trưng thủ công, hiểu ngữ cảnh kém
Học sâu (deep learning)Mạng nơ-ron, đặc biệt Transformer, tự học biểu diễnHiểu ngữ cảnh tốt, làm được tóm tắt, hỏi đápCần nhiều dữ liệu và GPU, khó giải thích kết quả

Doanh nghiệp hay kết hợp cả ba. Ví dụ minh hoạ: hệ thống đọc hoá đơn dùng luật để bắt mã số thuế có định dạng cố định, dùng mô hình học sâu để hiểu phần mô tả hàng hoá.

NLU và NLG khác nhau ra sao?

NLP thường chia thành hai nửa: hiểu ngôn ngữ (NLU, Natural Language Understanding) và tạo ngôn ngữ (NLG, Natural Language Generation). Một hệ thống trả lời khách hàng cần cả hai.

Tiêu chíNLU – hiểu ngôn ngữNLG – tạo ngôn ngữ
Đầu raCấu trúc máy hiểu: ý định, thực thể, nhãn cảm xúcCâu chữ tự nhiên cho người đọc
Tác vụ tiêu biểuPhân loại ý định, NER, phân tích cảm xúcTóm tắt, viết email trả lời, sinh báo cáo từ số liệu
Ví dụ minh hoạ“Tôi muốn đổi size áo” → ý định: đổi hàng; thực thể: áoTừ dữ liệu đơn hàng → “Đơn của bạn đã được đổi sang size M”
Rủi ro chínhHiểu sai câu mỉa mai, viết tắtViết trôi chảy nhưng sai sự thật (ảo giác)

Chatbot đời đầu mạnh ở NLU rồi trả lời bằng câu soạn sẵn; chatbot dùng LLM làm được cả hai phần trong một mô hình. Khác biệt giữa các thế hệ này có trong bài chatbot AI hoạt động thế nào.

Vì sao NLP tiếng Việt khó hơn tiếng Anh?

Mô hình đa ngôn ngữ ngày nay đọc tiếng Việt khá tốt, nhưng khi cần độ chính xác cao, NLP tiếng Việt vẫn có những cái bẫy riêng.

Dấu cách tách âm tiết, không tách từ

Trong tiếng Anh, khoảng trắng gần như là ranh giới từ. Trong tiếng Việt, khoảng trắng tách âm tiết, còn nhiều từ gồm hai, ba âm tiết như “máy tính”, “bảo hiểm xã hội”. Câu kinh điển “học sinh học sinh học” phải tách thành “học_sinh | học | sinh_học”. Tách sai một từ là từ loại, thực thể, cảm xúc phía sau sai theo.

Vì vậy có các công cụ tách từ chuyên dụng như RDRsegmenter (LREC 2018). Trang chính thức của PhoBERT ghi rõ văn bản đầu vào phải được tách từ trước, và khuyến nghị dùng RDRsegmenter của VnCoreNLP như lúc tiền huấn luyện. Bỏ qua bước này, kết quả giảm mà không báo lỗi.

Dấu thanh và chuẩn mã hoá

Dấu sắc, huyền, hỏi, ngã, nặng đổi hẳn nghĩa: “bán” và “bàn”, “mua” và “múa”. Văn bản thực tế lại đủ kiểu:

  • Gõ không dấu: “toi muon doi hang” phải hiểu là “tôi muốn đổi hàng”.
  • Hai cách mã hoá Unicode (dựng sẵn và tổ hợp) trông giống hệt nhau nhưng máy coi là khác. Không chuẩn hoá thì tìm “Hà Nội” có thể sót tài liệu.
  • Tài liệu cũ dùng bảng mã TCVN3, VNI dễ thành ký tự lỗi; vị trí dấu không thống nhất như “hoà” và “hòa”.

Từ địa phương, viết tắt và teencode

Người miền Bắc nói “bát”, miền Nam nói “chén”; “ốm” ở Bắc là bệnh, ở Nam là gầy. Bình luận mạng còn có “ko”, “dc”, emoji và từ mượn tiếng Anh. Mô hình học từ báo chí thường xử lý kém các văn bản này, nên hãy đưa dữ liệu thật của bạn vào bộ đánh giá ngay từ đầu.

Ít dữ liệu gán nhãn

Bộ dữ liệu tiếng Việt đã gán nhãn còn ít, nhất là theo ngành như bảo hiểm, y tế, pháp lý. Doanh nghiệp thường phải tự gán nhãn dữ liệu nội bộ để đạt độ chính xác mong muốn.

Công cụ và dữ liệu NLP tiếng Việt có những gì?

Bảng dưới chỉ liệt kê công cụ và dữ liệu đã được đối chiếu với công bố gốc hoặc trang chính thức.

TênLoạiĐơn vị, công bốLàm được gì
VnCoreNLPBộ công cụThanh Vu, Dat Quoc Nguyen và cộng sự, NAACL 2018Tách từ, gán nhãn từ loại, nhận dạng thực thể, phân tích phụ thuộc
RDRsegmenterCông cụ tách từDat Quoc Nguyen và cộng sự, LREC 2018Tách từ nhanh và chính xác hơn các công cụ trước đó theo đánh giá của tác giả
UndertheseaThư viện Python, giấy phép Apache 2.0Cộng đồng nguồn mởTách câu, chuẩn hoá, tách từ, từ loại, NER, phân loại, cảm xúc, dịch
PhoBERTMô hình ngôn ngữ (base, large)VinAI, Findings of EMNLP 2020Tiền huấn luyện trên 20GB văn bản Wikipedia và tin tức; nền cho phân loại, NER
PhoGPTMô hình sinh văn bảnVinAI, công bố tháng 11/20233,7 tỷ tham số, tiền huấn luyện trên 102 tỷ token tiếng Việt
UIT-VSFCBộ dữ liệuTrường ĐH Công nghệ Thông tin, ĐHQG TP.HCM, KSE 2018Hơn 16.000 câu phản hồi của sinh viên, gán nhãn cảm xúc và chủ đề
UIT-ViQuADBộ dữ liệuTrường ĐH Công nghệ Thông tin, ĐHQG TP.HCMHơn 23.000 cặp hỏi – đáp cho bài toán đọc hiểu

VLSP (Association for Vietnamese Language and Speech Processing) là chi hội thuộc Hội Tin học Việt Nam, tổ chức hội thảo và các cuộc thi đánh giá (shared task) thường niên về xử lý ngôn ngữ và tiếng nói tiếng Việt. Theo trang chính thức, năm 2025 là kỳ thứ 11 và VLSP 2026 có tám bài toán thi.

Kiểm tra giấy phép trước khi dùng thương mại. PhoBERT base và large dùng giấy phép MIT, nhưng bản phobert-base-v2 dùng GNU AGPL v3, ràng buộc chặt hơn khi tích hợp vào sản phẩm.

Ứng dụng NLP trong doanh nghiệp là gì?

Phần lớn thông tin doanh nghiệp nằm ở dạng chữ. Đây là những ứng dụng NLP mang lại giá trị rõ nhất.

Chăm sóc khách hàng

NLP đọc email, tin nhắn đến, phân loại theo chủ đề (đổi trả, thanh toán, kỹ thuật), đánh giá mức khẩn cấp rồi chuyển đúng bộ phận. Trợ lý ảo trả lời câu hỏi lặp lại, nhân viên xử lý ca khó. Ở tổng đài, NLP kết hợp nhận dạng giọng nói để phân tích cuộc gọi, xem thêm bài về tổng đài AI.

Phân tích phản hồi khách hàng

Thay vì đọc tay hàng nghìn đánh giá, NLP phân tích cảm xúc theo từng khía cạnh: khen giá, chê giao hàng, phàn nàn thái độ. Bạn nhận bảng số liệu theo tuần để thấy vấn đề nào đang tăng.

Xử lý hợp đồng và hồ sơ

NLP trích xuất bên ký, giá trị, thời hạn, điều khoản phạt; so với mẫu chuẩn để cảnh báo điều khoản lạ. Với hồ sơ bảo hiểm, tín dụng, nhân sự, NLP đọc và điền dữ liệu vào hệ thống, giảm nhập liệu thủ công. Vẫn cần người duyệt các trường mô hình không chắc chắn.

Tìm kiếm nội bộ theo ngữ nghĩa

Tìm kiếm từ khoá gõ “nghỉ phép” sẽ không ra tài liệu viết “ngày nghỉ hằng năm”. Tìm kiếm ngữ nghĩa (semantic search) dùng embedding để tìm theo ý. Kết hợp LLM, nhân viên hỏi bằng câu tự nhiên và nhận câu trả lời trích từ quy chế, kèm vị trí tài liệu gốc.

NLP có hạn chế và rủi ro gì?

  • Mơ hồ, mỉa mai: “giao nhanh ghê, đợi có hai tuần” dễ bị gán nhãn tích cực.
  • Thiên lệch dữ liệu: mô hình mang định kiến của dữ liệu huấn luyện, ví dụ xử lý kém giọng văn vùng miền ít xuất hiện.
  • Ảo giác: mô hình sinh văn bản có thể viết sai sự thật một cách tự tin, nguy hiểm khi tóm tắt hợp đồng hay hồ sơ y tế.
  • Trôi dữ liệu: sản phẩm mới, từ lóng mới khiến độ chính xác giảm dần nếu không theo dõi.
  • Lộ dữ liệu: đưa văn bản chứa thông tin khách hàng lên dịch vụ AI bên ngoài khi chưa có thoả thuận rõ ràng.

NLP và Luật Bảo vệ dữ liệu cá nhân 2025

Email, bản ghi cuộc gọi, hồ sơ khách hàng gần như luôn chứa dữ liệu cá nhân. Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 được thông qua ngày 26/06/2025, có hiệu lực từ 01/01/2026. Điều 2 định nghĩa dữ liệu cá nhân là dữ liệu số hoặc thông tin dạng khác xác định hoặc giúp xác định một con người cụ thể. Dự án NLP cần lưu ý:

  • Điều 30 quy định bảo vệ dữ liệu cá nhân khi xử lý bằng dữ liệu lớn, trí tuệ nhân tạo, chuỗi khối, vũ trụ ảo, điện toán đám mây: đúng mục đích, trong phạm vi cần thiết, kèm biện pháp bảo mật phù hợp.
  • Điều 20 coi việc dùng nền tảng ngoài lãnh thổ Việt Nam để xử lý dữ liệu cá nhân là chuyển dữ liệu xuyên biên giới; bên chuyển lập hồ sơ đánh giá tác động, gửi cơ quan chuyên trách trong 60 ngày kể từ ngày chuyển, trừ trường hợp được miễn. Gọi API dịch vụ NLP nước ngoài với dữ liệu khách hàng có thể rơi vào trường hợp này.
  • Luật định nghĩa khử nhận dạng là thay đổi hoặc xoá thông tin để tạo dữ liệu mới không xác định được một con người cụ thể. Che tên, số điện thoại, số căn cước trước khi đưa vào mô hình nên là mặc định.

Nếu NLP chạy trong chatbot trò chuyện với khách, khoản 1 Điều 11 Luật Trí tuệ nhân tạo số 134/2025/QH15 (thông qua ngày 10/12/2025, hiệu lực từ 01/03/2026) yêu cầu hệ thống AI tương tác trực tiếp với con người phải giúp người dùng nhận biết họ đang tương tác với AI, trừ trường hợp luật có quy định khác.

Phần pháp lý giúp bạn nhận diện rủi ro, không thay thế tư vấn pháp lý. Hãy đối chiếu văn bản gốc và Nghị định 356/2025/NĐ-CP hướng dẫn Luật Bảo vệ dữ liệu cá nhân trước khi triển khai.

Doanh nghiệp nên bắt đầu NLP từ đâu?

  1. Chọn một bài toán hẹp, đo được: “tự phân loại email hỗ trợ vào đúng 6 nhóm” tốt hơn “ứng dụng AI vào chăm sóc khách hàng”.
  2. Kiểm kê dữ liệu: văn bản nằm ở đâu, bao nhiêu mẫu, chứa dữ liệu cá nhân nào. Dữ liệu bẩn cho kết quả bẩn dù mô hình tốt đến đâu.
  3. Tạo bộ đánh giá: gán nhãn tay vài trăm mẫu thật, có cả viết tắt, không dấu, câu mỉa mai, để so sánh mọi giải pháp.
  4. Thử từ đơn giản đến phức tạp: luật và từ khoá, rồi mô hình nhỏ như PhoBERT tinh chỉnh, rồi mới đến LLM.
  5. Thiết kế người duyệt: dưới ngưỡng tin cậy thì chuyển người xử lý; lưu mọi chỉnh sửa để huấn luyện lại.
  6. Rà soát pháp lý, bảo mật: dữ liệu đi đâu, nhà cung cấp lưu bao lâu, có dùng dữ liệu của bạn để huấn luyện không.
  7. Theo dõi sau triển khai: đo lại độ chính xác định kỳ trên dữ liệu mới.

Những hiểu lầm phổ biến về NLP

  • “NLP chính là ChatGPT”: ChatGPT là sản phẩm dùng LLM, một thế hệ mô hình NLP. NLP còn gồm tách từ, NER, phân loại, tìm kiếm và nhiều hệ thống không sinh văn bản.
  • “Có LLM thì không cần NLP truyền thống”: với tác vụ khối lượng lớn như phân loại hàng triệu bình luận, mô hình nhỏ thường rẻ hơn, nhanh hơn, ổn định hơn và dễ kiểm soát dữ liệu hơn.
  • “Mô hình tiếng Anh dùng luôn cho tiếng Việt”: tách từ, dấu thanh, từ địa phương khiến kết quả giảm rõ nếu không đánh giá trên dữ liệu tiếng Việt thật.
  • “Độ chính xác 95% là đủ”: tuỳ việc. Phân loại bình luận sai 5% có thể chấp nhận; trích sai 5% số tiền trong hợp đồng thì không.

Câu hỏi thường gặp

NLP viết tắt của từ gì?

Trong công nghệ, NLP là Natural Language Processing, nghĩa là xử lý ngôn ngữ tự nhiên, không phải Neuro-Linguistic Programming trong tâm lý học.

NLP khác gì LLM?

NLP là cả một lĩnh vực. LLM là một loại mô hình trong lĩnh vực đó, rất nhiều tham số, huấn luyện trên lượng văn bản khổng lồ và làm được nhiều tác vụ NLP cùng lúc.

NLP và machine learning có giống nhau không?

Không. Học máy là phương pháp học từ dữ liệu, dùng cho cả ảnh, số liệu, âm thanh. NLP là lĩnh vực về ngôn ngữ, ngày nay chủ yếu dùng học máy để giải quyết bài toán.

Ứng dụng NLP phổ biến nhất là gì?

Lọc thư rác, dịch máy, gợi ý từ khi gõ phím, trợ lý ảo, chatbot chăm sóc khách hàng, công cụ tìm kiếm và phân tích đánh giá sản phẩm.

NLP tiếng Việt nên dùng công cụ nào?

VnCoreNLP và Underthesea phù hợp cho tách từ, từ loại, NER. PhoBERT phù hợp khi cần tinh chỉnh mô hình phân loại hoặc trích xuất. Với sinh văn bản, có thể thử LLM hỗ trợ tiếng Việt, nhưng luôn đánh giá trên dữ liệu của chính bạn.

Học NLP cần nền tảng gì?

Python, xác suất thống kê cơ bản, học máy và hiểu biết ngôn ngữ học. Có thể bắt đầu bằng bài toán phân loại cảm xúc với bộ dữ liệu công khai UIT-VSFC.

Dùng dịch vụ NLP nước ngoài để xử lý email khách hàng có vi phạm luật không?

Không mặc nhiên vi phạm, nhưng theo Điều 20 Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15, đây có thể là chuyển dữ liệu cá nhân xuyên biên giới và phải lập hồ sơ đánh giá tác động. Hãy khử nhận dạng dữ liệu trước khi gửi và rà soát hợp đồng với nhà cung cấp.