AI hallucination là gì? Ảo giác AI: nguyên nhân, cách giảm

Trả lời nhanh: AI hallucination (ảo giác AI) là hiện tượng mô hình AI, nhất là mô hình ngôn ngữ lớn, tạo ra thông tin nghe hợp lý, trình bày tự tin nhưng sai sự thật, bịa ra hoặc không có căn cứ trong nguồn, ví dụ trích dẫn một bản án, bài báo hay con số không hề tồn tại.

Điểm chính

  • Ảo giác không phải lỗi ngẫu nhiên. Nó bắt nguồn từ cách mô hình học đoán từ kế tiếp và từ cách chấm điểm khiến mô hình “đoán còn hơn bỏ trống”.
  • Có hai nhóm lớn: sai so với sự thật của thế giới và sai so với tài liệu, chỉ dẫn được cung cấp. Bịa nguồn, bịa trích dẫn là dạng gây hậu quả nặng nhất.
  • Chưa có cách loại bỏ hoàn toàn. Grounding, RAG, prompt tốt, công cụ tra cứu và người kiểm duyệt giảm rõ rệt, nhưng phải đo bằng bộ câu hỏi thật của chính doanh nghiệp.
  • Luật Trí tuệ nhân tạo số 134/2025/QH15 (hiệu lực 01/03/2026) nêu nguyên tắc AI không thay thế thẩm quyền và trách nhiệm của con người.
  • Các vụ Mata v. Avianca (2023), Air Canada (2024) và báo cáo của Deloitte tại Úc (2025) cho thấy cái giá của việc dùng kết quả AI mà không kiểm chứng.
Mục lục
  1. AI hallucination là gì?
  2. Có những loại ảo giác AI nào?
  3. Vì sao AI bị ảo giác? Nguyên nhân kỹ thuật
  4. Những ví dụ ảo giác AI có thật
  5. Đo tỷ lệ ảo giác AI bằng cách nào?
  6. Làm sao giảm ảo giác AI?
  7. Quy trình kiểm soát ảo giác AI trong doanh nghiệp
  8. Ai chịu trách nhiệm khi AI đưa thông tin sai?
  9. Những hiểu lầm phổ biến về ảo giác AI
  10. Câu hỏi thường gặp

AI hallucination là gì?

AI hallucination, tiếng Việt thường gọi là ảo giác AI, là khi một hệ thống AI tạo sinh đưa ra nội dung sai hoặc không có căn cứ nhưng trình bày như thể đó là sự thật. Câu văn trôi chảy, giọng điệu chắc chắn, đôi khi kèm cả số liệu và nguồn dẫn. Chính vẻ “đáng tin” đó làm ảo giác nguy hiểm hơn một câu trả lời sai lộ liễu.

Trong bài nghiên cứu công bố ngày 05/09/2025, OpenAI mô tả ảo giác là những phát biểu nghe hợp lý nhưng sai do mô hình ngôn ngữ tạo ra. Bài viết nêu một ví dụ: khi được hỏi tên luận án tiến sĩ của chính một tác giả nghiên cứu, một chatbot phổ biến tự tin đưa ra ba đáp án khác nhau, không đáp án nào đúng. Hỏi ngày sinh của người này, nó cũng trả lời ba ngày khác nhau và đều sai.

Viện Tiêu chuẩn và Công nghệ Quốc gia Hoa Kỳ (NIST), trong tài liệu NIST AI 600-1 ngày 26/07/2024 về quản lý rủi ro AI tạo sinh, dùng thuật ngữ “confabulation” (bịa chuyện): hệ thống tạo ra và tự tin trình bày nội dung sai hoặc nhầm lẫn. NIST cũng ghi nhận ý kiến cho rằng từ “hallucination” vô tình nhân cách hoá AI. Mô hình không “nhìn thấy” gì cả. Nó chỉ sinh chuỗi chữ có xác suất cao mà không có cơ chế tự biết chuỗi đó đúng hay sai.

Ảo giác xuất hiện ở mọi loại AI tạo sinh: chatbot trả lời câu hỏi, công cụ tóm tắt tài liệu, trợ lý viết mã, mô hình đọc ảnh, mô hình chuyển giọng nói thành văn bản. Nhưng nó được bàn nhiều nhất ở các mô hình ngôn ngữ lớn (LLM) vì đây là loại mô hình đang được doanh nghiệp dùng rộng rãi nhất.

Ảo giác khác các lỗi AI khác thế nào?

  • Kiến thức lỗi thời: mô hình trả lời đúng theo dữ liệu tới thời điểm huấn luyện nhưng thực tế đã thay đổi, ví dụ một văn bản pháp luật đã bị thay thế. Đây là một nguyên nhân dẫn tới ảo giác, nhưng có thể khắc phục bằng cách cấp dữ liệu mới.
  • Thiên kiến (bias): câu trả lời có thể đúng về dữ kiện nhưng lệch về cách đánh giá, đối xử thiếu công bằng với một nhóm người.
  • Nội dung giả mạo có chủ đích: deepfake là con người cố ý dùng AI để tạo nội dung giả. Ảo giác thì không ai chủ đích; mô hình “tin” vào câu trả lời của chính nó.
  • Lỗi đầu vào: người dùng hỏi mơ hồ hoặc tài liệu cung cấp sai. Lỗi đầu vào làm ảo giác dễ xảy ra hơn, nhưng mô hình vẫn có thể bịa ngay cả khi câu hỏi rõ ràng.

Có những loại ảo giác AI nào?

Các nhà nghiên cứu phân loại ảo giác theo hai trục chính. Bài tổng quan của Lei Huang và cộng sự (đăng trên tạp chí ACM Transactions on Information Systems năm 2024) chia thành:

  • Ảo giác về tính xác thực (factuality hallucination): nội dung mâu thuẫn với sự thật của thế giới hoặc là điều bịa ra, không kiểm chứng được.
  • Ảo giác về tính trung thành (faithfulness hallucination): nội dung lệch khỏi chỉ dẫn của người dùng, khỏi tài liệu được cung cấp, hoặc tự mâu thuẫn trong lập luận.

Một bài tổng quan khác của Ziwei Ji và cộng sự trên ACM Computing Surveys dùng cặp khái niệm ảo giác nội tại (intrinsic: mâu thuẫn trực tiếp với nguồn) và ngoại tại (extrinsic: thêm thông tin mà nguồn không xác nhận cũng không bác bỏ). Với người dùng doanh nghiệp, cách chia theo biểu hiện dưới đây dễ áp dụng hơn.

Loại ảo giácBiểu hiệnVí dụ
Sai sự thật (factual error)Sai tên, ngày, con số, quan hệ giữa các đối tượngChatbot Bard nói kính viễn vọng James Webb chụp bức ảnh đầu tiên về hành tinh ngoài hệ Mặt Trời (có thật, năm 2023)
Bịa đặt thực thể, sự kiện (fabrication)Người, công ty, sự kiện, văn bản không tồn tại; khẳng định quá mứcNêu một thông tư với số hiệu không có thật để trả lời câu hỏi về thuế (ví dụ minh hoạ)
Bịa nguồn, bịa trích dẫn (fabricated citation)Án lệ, bài báo khoa học, đường dẫn, câu trích nguyên văn giảSáu “án lệ” giả trong vụ Mata v. Avianca (có thật, năm 2023)
Sai suy luận (logical inconsistency)Phép tính sai, các bước lập luận mâu thuẫn, kết luận không theo tiền đềCộng các khoản trong bảng kê ra tổng khác với chính các con số vừa liệt kê (ví dụ minh hoạ)
Không bám chỉ dẫn (instruction inconsistency)Làm khác yêu cầuĐược yêu cầu dịch một câu hỏi thì lại trả lời câu hỏi đó (ví dụ minh hoạ)
Không bám tài liệu, ngữ cảnh (context inconsistency)Tóm tắt, trích xuất sai so với tài liệu được đưa vàoTóm tắt hợp đồng ghi thời hạn thanh toán 30 ngày trong khi hợp đồng ghi 45 ngày (ví dụ minh hoạ)
Ảo giác trong mã nguồnGọi thư viện, hàm, tham số API không tồn tạiGợi ý cài một gói phần mềm không có thật (đã được nghiên cứu, xem phần ví dụ)
Ảo giác đa phương thứcMô tả vật không có trong ảnh, đọc ra chữ không có trong tài liệu, chép thêm câu không ai nóiMô hình đọc hoá đơn tự “điền” một mã số thuế không có trên ảnh (ví dụ minh hoạ)

Trong doanh nghiệp, bịa nguồn và không bám tài liệu là hai dạng cần đề phòng nhất. Bịa nguồn khiến người đọc tưởng thông tin đã được kiểm chứng. Không bám tài liệu xảy ra ngay cả khi bạn đã đưa đúng tài liệu cho AI, nên nhiều người chủ quan bỏ qua.

Vì sao AI bị ảo giác? Nguyên nhân kỹ thuật

Ảo giác không đến từ một lỗi duy nhất. Nó có mặt ở mọi khâu, từ dữ liệu, huấn luyện, cách sinh câu trả lời đến cách đánh giá mô hình.

Ảo giác AI sinh ra ở đâu trong vòng đời mô hình? 1. Dữ liệu Training data Có thông tin sai, lỗi thời; dữ kiện hiếm chỉ xuất hiện một vài lần nên mô hình không nhớ chắc 2. Huấn luyện Training Học đoán từ kế tiếp, không có nhãn đúng hay sai; tinh chỉnh theo ý người dùng dễ sinh thói chiều lòng 3. Sinh câu trả lời Inference Lấy mẫu ngẫu nhiên, tự tin quá mức, bỏ sót ngữ cảnh, suy luận nhiều bước bị đứt; tài liệu truy xuất sai 4. Đánh giá Evaluation Bảng điểm chỉ chấm đúng hay sai; nói “không biết” bị 0 điểm nên mô hình được khuyến khích đoán Kết quả: câu trả lời trôi chảy, tự tin nhưng sai hoặc không có căn cứ
Ảo giác không đến từ một lỗi duy nhất. Mỗi khâu góp một phần, nên cách giảm cũng phải đánh vào nhiều khâu.

1. Mô hình học đoán từ kế tiếp, không học đúng hay sai

Ở giai đoạn tiền huấn luyện (pretraining), LLM đọc lượng văn bản khổng lồ và học dự đoán từ tiếp theo. Dữ liệu này không có nhãn “đúng” hay “sai”. Theo giải thích của OpenAI, những quy luật nhất quán như chính tả, dấu ngoặc được học rất tốt khi mô hình lớn lên. Nhưng các dữ kiện tuỳ ý, ít xuất hiện, như ngày sinh của một người bình thường, không thể suy ra từ quy luật. Khi gặp câu hỏi loại này, mô hình vẫn sinh ra một đáp án “có hình dạng đúng”, tức một ngày tháng hợp lệ, nhưng nội dung là đoán.

2. Cách chấm điểm thưởng cho việc đoán

Bài báo “Why Language Models Hallucinate” của Adam Tauman Kalai, Ofir Nachum, Santosh Vempala và Edwin Zhang (công bố ngày 04/09/2025) lập luận rằng phần lớn bảng xếp hạng chỉ chấm đúng hoặc sai. Trả lời “tôi không biết” bị 0 điểm, đoán bừa thì vẫn có cơ hội ghi điểm. Giống học sinh làm trắc nghiệm, mô hình được tối ưu để “đoán khi không chắc”. Số liệu OpenAI công bố trên bộ câu hỏi SimpleQA minh hoạ rõ điều này:

Chỉ số trên SimpleQAgpt-5-thinking-minio4-mini
Tỷ lệ từ chối trả lời (abstention)52%1%
Tỷ lệ trả lời đúng22%24%
Tỷ lệ trả lời sai26%75%

Mô hình cũ hơn có tỷ lệ đúng nhỉnh hơn một chút, nhưng sai gần gấp ba vì gần như không bao giờ từ chối. Nếu chỉ nhìn tỷ lệ đúng, bạn sẽ chọn nhầm mô hình ảo giác nhiều hơn. Các tác giả đề xuất sửa cách chấm: phạt nặng câu trả lời sai tự tin hơn câu trả lời thừa nhận không chắc chắn.

3. Dữ liệu huấn luyện sai, lỗi thời hoặc thiếu

Internet chứa nhiều thông tin sai, ngộ nhận và nội dung cũ. Mô hình học cả những điều đó. Bộ kiểm thử TruthfulQA (Stephanie Lin, Jacob Hilton, Owain Evans) gồm 817 câu hỏi thuộc 38 chủ đề như sức khoẻ, pháp luật, tài chính, được thiết kế để “gài” các ngộ nhận phổ biến. Khi công bố, mô hình tốt nhất chỉ trả lời trung thực 58% số câu, trong khi con người đạt 94%; các mô hình lớn nhất lại thường kém trung thực nhất vì chúng bắt chước ngộ nhận trong dữ liệu tốt hơn. Ngoài ra, mô hình không biết gì sau mốc dữ liệu huấn luyện và rất yếu với kiến thức hiếm, ví dụ quy định nội bộ của một công ty hay văn bản pháp luật địa phương.

4. Cách mô hình sinh câu trả lời

Khi sinh văn bản, mô hình chọn từng từ theo phân phối xác suất, có yếu tố ngẫu nhiên điều khiển bằng các tham số như nhiệt độ (temperature). Một từ chọn lệch ở đầu câu có thể kéo cả đoạn sau đi sai hướng, vì mỗi từ mới dựa trên các từ đã sinh. Với ngữ cảnh dài, mô hình có thể bỏ sót chi tiết ở giữa tài liệu. Với bài toán nhiều bước, một bước sai sẽ lan sang kết luận.

5. Thói chiều lòng người dùng (sycophancy)

Giai đoạn tinh chỉnh bằng phản hồi của con người (RLHF) giúp mô hình lịch sự, hữu ích hơn, nhưng cũng có thể dạy nó ưu tiên câu trả lời người dùng muốn nghe. Khi câu hỏi chứa tiền đề sai, chẳng hạn “Vì sao luật năm ngoái cấm doanh nghiệp dùng chatbot?”, mô hình dễ “giải thích” một quy định không tồn tại thay vì bác bỏ tiền đề.

6. Hệ thống xung quanh mô hình đưa dữ liệu sai

Trong ứng dụng thực tế, mô hình thường được nối với công cụ tìm kiếm, kho tài liệu, phần mềm đọc chữ (OCR). Nếu bước tìm kiếm lấy nhầm tài liệu, tài liệu cũ mâu thuẫn với tài liệu mới, hoặc OCR đọc sai một con số, mô hình sẽ trả lời sai nhưng vẫn “có nguồn”. Đây là dạng ảo giác khó phát hiện nhất vì người kiểm tra thấy có trích dẫn nên yên tâm.

Những ví dụ ảo giác AI có thật

Luật sư nộp án lệ giả do ChatGPT tạo (Mata v. Avianca, Mỹ, 2023)

Trong vụ kiện Mata v. Avianca tại Toà án Liên bang khu vực Nam New York, hai luật sư Steven Schwartz và Peter LoDuca của hãng Levidow, Levidow & Oberman nộp bản lập luận dẫn sáu bản án không hề tồn tại, kèm trích dẫn giả, do ChatGPT tạo ra. Ngày 22/06/2023, thẩm phán P. Kevin Castel ra quyết định phạt 5.000 USD. Theo quyết định, các luật sư đã “từ bỏ trách nhiệm” khi nộp các ý kiến pháp lý không tồn tại, cố tình phớt lờ dấu hiệu cho thấy trích dẫn là giả và có phát biểu gây hiểu lầm trước toà.

Vụ này không phải cá biệt. Cơ sở dữ liệu AI Hallucination Cases do nhà nghiên cứu Damien Charlotin duy trì, theo dõi các quyết định của toà án có đề cập việc dùng nội dung AI bịa, đến đầu tháng 10/2026 đã ghi nhận hơn 2.100 trường hợp trên nhiều quốc gia.

Chatbot của Air Canada hứa sai chính sách (Canada, 2024)

Một khách hàng hỏi chatbot AI trên website Air Canada về giá vé ưu đãi khi có người thân qua đời. Chatbot trả lời rằng có thể mua vé trước rồi xin hoàn phần chênh lệch sau, điều trái với chính sách thật của hãng. Hãng từ chối hoàn tiền và lập luận rằng chatbot là “một thực thể riêng” tự chịu trách nhiệm. Ngày 14/02/2024, Toà giải quyết tranh chấp dân sự British Columbia (vụ Moffatt v. Air Canada, 2024 BCCRT 149) bác lập luận này: hãng phải chịu trách nhiệm với mọi thông tin trên website của mình, dù thông tin đến từ trang tĩnh hay chatbot. Hãng phải trả tổng cộng 812,02 đô la Canada gồm bồi thường, lãi và phí.

Bard trả lời sai ngay trong quảng cáo ra mắt (2023)

Tháng 2/2023, trong đoạn giới thiệu chatbot Bard, Google cho thấy câu trả lời rằng kính viễn vọng James Webb chụp những bức ảnh đầu tiên về một hành tinh ngoài hệ Mặt Trời. Thực tế, bức ảnh đầu tiên như vậy được chụp năm 2004 bằng kính Very Large Telescope của Đài thiên văn Nam Âu. Theo Al Jazeera, cổ phiếu Alphabet giảm khoảng 8% trong ngày, vốn hoá mất hơn 100 tỷ USD.

Báo cáo 440.000 AUD có trích dẫn bịa (Deloitte tại Úc, 2025)

Theo hãng tin AP, một báo cáo dài 237 trang mà Deloitte thực hiện cho Bộ Việc làm và Quan hệ lao động Úc, giá trị hợp đồng 440.000 đô la Úc, chứa các tài liệu học thuật không tồn tại và một câu trích dẫn bịa gán cho thẩm phán liên bang. Một nhà nghiên cứu phát hiện khoảng 20 lỗi. Bản sửa đổi của báo cáo công bố có dùng Azure OpenAI trong quá trình soạn thảo, và tháng 10/2025 Deloitte đồng ý hoàn lại khoản thanh toán cuối của hợp đồng.

ChatGPT gán cáo buộc sai cho người thật (Walters v. OpenAI, Mỹ, 2025)

ChatGPT từng trả lời một người dùng rằng người dẫn chương trình phát thanh Mark Walters bị cáo buộc biển thủ trong một vụ kiện, trong khi ông không hề là đương sự của vụ đó. Ông kiện OpenAI tội phỉ báng. Ngày 19/05/2025, toà án bang Georgia ra phán quyết có lợi cho OpenAI, với lý do chính: người đọc hợp lý không coi nội dung đó là sự thật vì đã có cảnh báo về khả năng sai; nguyên đơn không chứng minh được OpenAI cẩu thả; và ông thừa nhận không bị thiệt hại. Kết quả này phụ thuộc nhiều vào tình tiết cụ thể, không có nghĩa doanh nghiệp được miễn trách nhiệm khi AI bịa thông tin về người khác.

Công cụ chuyên ngành cũng ảo giác

  • Pháp lý: nghiên cứu “Hallucination-Free?” của nhóm Stanford (Varun Magesh, Daniel E. Ho và cộng sự, công bố 30/05/2024) cho thấy các công cụ nghiên cứu pháp lý dùng AI của LexisNexis và Thomson Reuters, dù đã dùng kỹ thuật truy xuất tài liệu, vẫn ảo giác trong khoảng 17% đến 33% số câu hỏi kiểm thử.
  • Lập trình: nghiên cứu của Joseph Spracklen và cộng sự phân tích 576.000 đoạn mã do 16 mô hình sinh ra. Tỷ lệ gợi ý gói phần mềm không tồn tại là ít nhất 5,2% với mô hình thương mại và 21,7% với mô hình nguồn mở, tổng cộng 205.474 tên gói bịa khác nhau. Rủi ro là kẻ xấu có thể đăng ký đúng các tên gói “ảo” này để phát tán mã độc.

Đo tỷ lệ ảo giác AI bằng cách nào?

Không đo thì không quản lý được. Có ba cách tiếp cận, từ tham khảo chung tới đo trên dữ liệu của riêng bạn.

Bộ kiểm thử (benchmark) công khai

  • SimpleQA (OpenAI, 30/10/2024): 4.326 câu hỏi dữ kiện ngắn, mỗi câu trả lời được chấm là đúng, sai hoặc không trả lời. Điểm mạnh là tách được “sai” khỏi “từ chối”.
  • TruthfulQA: đo khả năng tránh lặp lại ngộ nhận phổ biến.
  • Bảng xếp hạng ảo giác của Vectara: cho các mô hình tóm tắt hơn 7.700 bài viết chỉ dựa trên nội dung được cung cấp, rồi dùng mô hình phát hiện HHEM để đo tỷ lệ tóm tắt có thêm thông tin không có trong nguồn. Bảng được cập nhật định kỳ, lần gần nhất ngày 11/05/2026.
  • FActScore (Sewon Min và cộng sự, EMNLP 2023): tách văn bản dài thành các dữ kiện nhỏ (atomic facts) rồi tính tỷ lệ dữ kiện được nguồn tin cậy xác nhận. Trên bài viết tiểu sử, ChatGPT khi đó chỉ đạt 58%.

Lưu ý: điểm benchmark chỉ để so sánh tương đối. Tỷ lệ ảo giác thay đổi rất mạnh theo loại câu hỏi, ngôn ngữ và việc có cấp tài liệu hay không. Một mô hình ít ảo giác khi tóm tắt tin tức tiếng Anh chưa chắc ít ảo giác khi trả lời về quy định thuế Việt Nam.

Kỹ thuật phát hiện ảo giác tự động

  • Kiểm tra độ nhất quán khi hỏi lại nhiều lần: phương pháp SelfCheckGPT (Potsawee Manakul và cộng sự, EMNLP 2023) dựa trên quan sát: nếu mô hình thật sự biết, các câu trả lời lấy mẫu nhiều lần sẽ giống nhau; nếu nó bịa, các câu trả lời sẽ mâu thuẫn nhau.
  • Entropy ngữ nghĩa (semantic entropy): nghiên cứu của Sebastian Farquhar và cộng sự đăng trên tạp chí Nature ngày 19/06/2024 đo độ không chắc chắn ở cấp ý nghĩa thay vì câu chữ, giúp phát hiện các câu trả lời bịa tuỳ tiện.
  • Đối chiếu với nguồn: dùng một mô hình khác hoặc quy tắc để kiểm tra từng câu trong câu trả lời có được tài liệu nguồn hỗ trợ không, và mọi trích dẫn có tồn tại thật không.

Chỉ số doanh nghiệp nên theo dõi

Chỉ sốCách tínhÝ nghĩa
Tỷ lệ trả lời đúngSố câu đúng / tổng số câu hỏi kiểm thửMức hữu ích chung
Tỷ lệ ảo giácSố câu sai hoặc bịa / số câu mô hình có trả lờiRủi ro khi người dùng tin câu trả lời
Tỷ lệ từ chối, chuyển ngườiSố câu mô hình nói không biết hoặc chuyển cho nhân viên / tổng số câuQuá thấp dễ đi kèm đoán bừa; quá cao làm hệ thống vô dụng
Độ trung thành với nguồn (faithfulness)Số nhận định được tài liệu truy xuất hỗ trợ / tổng số nhận định trong câu trả lời (cách tính của thư viện RAGAS)Dùng cho hệ thống RAG, chatbot nội bộ
Độ chính xác trích dẫnSố trích dẫn tồn tại và thật sự hỗ trợ nhận định / tổng số trích dẫnBắt lỗi bịa nguồn
Tỷ lệ lỗi nghiêm trọngSố câu sai gây hậu quả (sai giá, sai cam kết, sai pháp lý) / tổng số câuChỉ số quyết định có đưa vào vận hành hay không

Cách xây bộ kiểm thử của riêng bạn

  1. Gom vài trăm câu hỏi thật từ nhật ký tổng đài, email khách hàng, câu hỏi nội bộ.
  2. Viết đáp án chuẩn và ghi rõ đáp án lấy từ tài liệu nào.
  3. Thêm câu hỏi “bẫy”: câu có tiền đề sai, câu ngoài phạm vi, câu mà tài liệu không có đáp án. Câu trả lời đúng cho loại này là từ chối hoặc chuyển người.
  4. Chấm theo mức độ nghiêm trọng, không chỉ đúng hay sai.
  5. Chạy lại toàn bộ bộ kiểm thử mỗi khi đổi mô hình, đổi prompt hoặc cập nhật kho tài liệu.

Làm sao giảm ảo giác AI?

Không có biện pháp nào đủ một mình. Cách hiệu quả là xếp nhiều lớp kiểm soát độc lập, để lỗi lọt qua lớp này bị chặn ở lớp sau.

Bảy lớp kiểm soát ảo giác AI trong doanh nghiệp 1 Chọn đúng bài toán, giới hạn phạm vi Không giao việc cần chính xác tuyệt đối cho AI mà không có người duyệt 2 Grounding và RAG Cấp tài liệu nguồn đã kiểm duyệt, buộc câu trả lời bám vào đó 3 Prompt và cấu hình Cho phép nói không biết, yêu cầu trích dẫn, hạ độ ngẫu nhiên 4 Công cụ thay cho trí nhớ Tính toán, tra cơ sở dữ liệu, gọi API thay vì để mô hình tự nhớ 5 Kiểm tra tự động Đối chiếu trích dẫn với nguồn, quy tắc nghiệp vụ, điểm tin cậy 6 Người kiểm duyệt Mức duyệt tăng theo rủi ro; người duyệt mở nguồn gốc để đối chiếu 7 Giám sát và phản hồi Ghi nhật ký, nút báo sai, chạy lại bộ kiểm thử khi đổi mô hình Nguyên tắc: không lớp nào đủ một mình; lỗi lọt qua lớp này bị chặn ở lớp sau
Mô hình nhiều lớp: càng nhiều lớp độc lập, xác suất một câu trả lời bịa đến tay khách hàng càng thấp.

Grounding và RAG: bắt AI trả lời dựa trên nguồn

Grounding là gắn câu trả lời của mô hình với nguồn thông tin kiểm chứng được, như kết quả tìm kiếm web hay kho tài liệu doanh nghiệp. Google Cloud mô tả grounding đúng theo hướng này và cung cấp nhiều nguồn để “neo” câu trả lời, từ Google Search đến dữ liệu riêng qua RAG.

Cách phổ biến nhất là RAG (retrieval augmented generation): hệ thống tìm các đoạn tài liệu liên quan rồi đưa vào câu lệnh để mô hình trả lời dựa trên đó. RAG giảm mạnh ảo giác do thiếu kiến thức hoặc kiến thức lỗi thời. Nhưng như nghiên cứu Stanford cho thấy, RAG không xoá bỏ ảo giác: bước truy xuất có thể lấy nhầm đoạn, và mô hình vẫn có thể thêm chi tiết không có trong tài liệu. Vì vậy cần đo độ trung thành với nguồn như ở phần trên.

Viết prompt để giảm ảo giác

Tài liệu hướng dẫn chính thức của Anthropic về giảm ảo giác khuyến nghị một số kỹ thuật mà bạn áp dụng được với hầu hết mô hình:

  • Cho phép mô hình nói “tôi không biết” khi thông tin không đủ, thay vì ép phải trả lời.
  • Yêu cầu trích nguyên văn trước khi phân tích với tài liệu dài: trích câu gốc liên quan, rồi mới lập luận dựa trên câu trích.
  • Yêu cầu dẫn nguồn cho từng nhận định, sau đó tự rà lại và rút bỏ nhận định không tìm được câu trích hỗ trợ.
  • Giới hạn nguồn kiến thức: chỉ dùng tài liệu được cung cấp, không dùng hiểu biết chung.
  • So sánh nhiều lần chạy (best-of-N): chạy cùng câu lệnh vài lần; câu trả lời không nhất quán là dấu hiệu ảo giác.

Một câu lệnh minh hoạ cho chatbot chăm sóc khách hàng: “Chỉ trả lời dựa trên các đoạn chính sách bên dưới. Với mỗi ý, ghi số mục chính sách. Nếu chính sách không đề cập, trả lời: Tôi chưa có thông tin này, tôi sẽ chuyển bạn tới nhân viên.” Các kỹ thuật khác như chia nhỏ yêu cầu, đưa ví dụ mẫu được trình bày chi tiết trong bài prompt engineering. Cần nhớ prompt chỉ giảm, không loại bỏ ảo giác.

Chỉnh tham số và định dạng đầu ra

  • Dùng nhiệt độ thấp cho tác vụ cần chính xác như trích xuất dữ liệu, trả lời chính sách. Nhiệt độ thấp làm câu trả lời ổn định hơn, nhưng mô hình vẫn có thể ổn định sai.
  • Yêu cầu đầu ra có cấu trúc (bảng, các trường cố định) để dễ kiểm tra tự động từng trường.
  • Giới hạn độ dài: câu trả lời càng dài, càng nhiều chỗ để bịa.

Cho AI dùng công cụ thay vì “nhớ”

Đừng bắt mô hình nhớ giá sản phẩm, số dư tài khoản hay tỷ giá. Hãy cho nó gọi công cụ: truy vấn cơ sở dữ liệu, gọi API hệ thống bán hàng, dùng máy tính cho phép tính. Mô hình chỉ làm phần nó giỏi là hiểu câu hỏi và diễn đạt câu trả lời; dữ kiện lấy từ hệ thống gốc.

Fine-tuning có giúp giảm ảo giác không?

Fine-tuning (tinh chỉnh mô hình) hữu ích để dạy mô hình định dạng, giọng văn, thuật ngữ chuyên ngành và cách từ chối đúng lúc. Tuy nhiên, nó thường không phải cách hiệu quả để nạp kiến thức mới hoặc hay thay đổi; với loại kiến thức đó, RAG phù hợp hơn vì cập nhật tài liệu dễ và truy được nguồn.

Kiểm chứng của con người (human-in-the-loop)

Với nội dung có hậu quả, người có chuyên môn phải là lớp cuối cùng. Một danh sách kiểm tra gọn cho người duyệt:

  • Mọi con số, ngày tháng, tên riêng, số hiệu văn bản đều được đối chiếu với nguồn gốc.
  • Mọi trích dẫn được mở ra xem: nguồn có tồn tại không, có nói đúng điều được trích không.
  • Kết luận có theo đúng dữ kiện, phép tính có khớp không.
  • Có cam kết, lời hứa nào với khách hàng mà chính sách không cho phép không.
Biện phápGiảm tốt loại ảo giác nàoHạn chế
Grounding, RAGThiếu kiến thức, kiến thức lỗi thời, kiến thức nội bộTruy xuất sai đoạn; mô hình vẫn có thể thêm chi tiết
Prompt (cho phép từ chối, buộc trích dẫn)Bịa khi thiếu thông tin, bịa nguồnPhụ thuộc mô hình tuân thủ; không đảm bảo
Nhiệt độ thấp, đầu ra có cấu trúcSai do ngẫu nhiên khi sinhKhông sửa được kiến thức sai
Gọi công cụ, cơ sở dữ liệuSai số liệu, phép tính, dữ liệu thời gian thựcCần tích hợp hệ thống, phân quyền
Fine-tuningKhông bám định dạng, không biết từ chốiTốn dữ liệu; không phù hợp để nạp kiến thức thay đổi
Kiểm tra tự độngBịa trích dẫn, sai so với nguồnBộ kiểm tra cũng có thể sai
Người kiểm duyệtMọi loại, nhất là lỗi nghiêm trọngTốn thời gian; người duyệt dễ chủ quan nếu AI thường đúng

Quy trình kiểm soát ảo giác AI trong doanh nghiệp

Kỹ thuật chỉ là một nửa. Nửa còn lại là quy trình, để biết ai chịu trách nhiệm kiểm tra gì và khi nào.

Bước 1: Phân mức rủi ro theo từng tình huống sử dụng

Cùng một mô hình, rủi ro rất khác nhau tuỳ cách dùng. Bảng dưới là cách phân mức nội bộ gợi ý; nó không thay thế việc phân loại rủi ro hệ thống AI theo quy định pháp luật (xem phần trách nhiệm pháp lý).

MứcVí dụ tình huốngKiểm soát tối thiểu
ThấpGợi ý ý tưởng, viết nháp nội bộ, tóm tắt cuộc họp cho chính mìnhNgười dùng tự đọc lại; không dùng làm nguồn dữ kiện
Trung bìnhChatbot trả lời khách về sản phẩm, trợ lý tra cứu quy trình nội bộRAG trên tài liệu đã duyệt, giới hạn phạm vi, chuyển người khi không chắc, kiểm tra mẫu định kỳ
CaoNội dung pháp lý, y tế, tài chính, số liệu báo cáo, cam kết giá hay bồi thường với kháchNgười có chuyên môn duyệt 100% trước khi dùng, lưu vết nguồn và người duyệt

Bước 2: Chọn kiến trúc phù hợp

Tình huống cần dữ kiện chính xác thì dùng RAG hoặc gọi công cụ, không để mô hình trả lời từ trí nhớ. Kho tài liệu phải có người chịu trách nhiệm cập nhật và gỡ bản cũ.

Bước 3: Đặt ngưỡng chấp nhận trước khi chạy thật

Dùng bộ kiểm thử riêng và thống nhất ngưỡng, ví dụ tỷ lệ lỗi nghiêm trọng phải bằng 0 trên bộ câu hỏi bẫy. Không đạt thì chưa đưa vào vận hành.

Bước 4: Thiết kế giao diện minh bạch

Hiển thị nguồn cho từng câu trả lời, cho biết người dùng đang nói chuyện với AI, có nút “báo câu trả lời sai” và đường chuyển sang nhân viên. Đừng để chatbot tự đưa ra cam kết về giá, hoàn tiền, bồi thường; vụ Air Canada cho thấy doanh nghiệp có thể phải chịu theo đúng lời chatbot.

Bước 5: Quy định kiểm duyệt và lưu vết

Ghi lại câu hỏi, tài liệu được truy xuất, câu trả lời, phiên bản mô hình và người duyệt. Nhật ký giúp điều tra khi có sự cố và chứng minh doanh nghiệp đã kiểm soát hợp lý.

Bước 6: Giám sát, xử lý sự cố

Theo dõi tỷ lệ báo sai, rà ngẫu nhiên hội thoại hằng tuần, chạy lại bộ kiểm thử khi nhà cung cấp cập nhật mô hình. Khi phát hiện ảo giác gây thiệt hại, có quy trình gỡ nội dung, thông báo người bị ảnh hưởng và sửa nguyên nhân gốc.

Bước 7: Ban hành chính sách và đào tạo nhân viên

Chính sách sử dụng AI nên nêu rõ: không dùng trích dẫn, số liệu do AI đưa ra khi chưa mở nguồn kiểm tra; người ký tên trên tài liệu chịu trách nhiệm với nội dung dù AI soạn; tình huống nào bắt buộc người duyệt. Nhân viên cần được cho xem ví dụ ảo giác thật để hiểu rằng câu văn trôi chảy không có nghĩa là đúng.

Ai chịu trách nhiệm khi AI đưa thông tin sai?

Theo pháp luật Việt Nam

Luật Trí tuệ nhân tạo số 134/2025/QH15 được Quốc hội thông qua ngày 10/12/2025, có hiệu lực từ 01/03/2026. Một số quy định liên quan trực tiếp tới ảo giác AI:

  • Điều 4 khoản 2: trí tuệ nhân tạo phục vụ con người, không thay thế thẩm quyền và trách nhiệm của con người; phải duy trì sự kiểm soát và khả năng can thiệp của con người với quyết định của hệ thống.
  • Điều 3: phân biệt nhà phát triển, nhà cung cấp, bên triển khai (tổ chức dùng hệ thống AI trong hoạt động nghề nghiệp, thương mại, dịch vụ) và người sử dụng. Doanh nghiệp đưa chatbot của bên thứ ba vào phục vụ khách hàng thường đóng vai bên triển khai; nếu đưa ra thị trường dưới thương hiệu của mình thì còn là nhà cung cấp.
  • Điều 9: chia hệ thống AI thành ba mức rủi ro cao, trung bình, thấp. Với hệ thống rủi ro cao, Điều 14 yêu cầu quản trị dữ liệu, lưu hồ sơ kỹ thuật và nhật ký hoạt động, bảo đảm khả năng giám sát và can thiệp của con người.
  • Điều 12: các bên có trách nhiệm bảo đảm độ tin cậy, kịp thời phát hiện và khắc phục sự cố; khi có sự cố nghiêm trọng phải xử lý và thông báo theo quy định.
  • Điều 29: vi phạm có thể bị xử phạt hành chính hoặc truy cứu trách nhiệm hình sự, gây thiệt hại thì bồi thường theo pháp luật dân sự. Với hệ thống rủi ro cao, kể cả khi vận hành đúng quy định mà vẫn gây thiệt hại, bên triển khai phải bồi thường cho người bị thiệt hại rồi mới yêu cầu nhà cung cấp, nhà phát triển hoàn trả nếu có thoả thuận.
  • Điều 35: hệ thống AI đã hoạt động trước ngày luật có hiệu lực có 18 tháng để tuân thủ nếu thuộc lĩnh vực y tế, giáo dục, tài chính và 12 tháng với lĩnh vực khác.

Nghị định 142/2026/NĐ-CP ngày 30/04/2026 (hiệu lực 01/05/2026) quy định chi tiết thi hành luật này, trong đó có việc tiếp nhận báo cáo sự cố qua cổng thông tin điện tử một cửa về trí tuệ nhân tạo.

Ngoài luật chuyên ngành, Bộ luật Dân sự 2015 vẫn áp dụng. Điều 597 quy định pháp nhân phải bồi thường thiệt hại do người của mình gây ra khi thực hiện nhiệm vụ được giao. Điều 34 khẳng định danh dự, nhân phẩm, uy tín của cá nhân là bất khả xâm phạm, nên việc đăng lại nội dung AI bịa đặt về một người thật là rủi ro pháp lý đáng kể.

Bài học từ các vụ việc nước ngoài

Các vụ việc ở phần ví dụ cho thấy một xu hướng nhất quán: người dùng chuyên nghiệp chịu trách nhiệm với sản phẩm của mình (luật sư trong vụ Mata v. Avianca bị phạt, không phải công cụ AI); doanh nghiệp chịu trách nhiệm với thông tin trên kênh của mình (Air Canada); khách hàng có thể đòi lại phí dịch vụ khi sản phẩm chứa nội dung bịa (Deloitte). Cảnh báo về khả năng sai có giá trị, như trong vụ Walters, nhưng không phải lá chắn tuyệt đối.

Lưu ý: phần pháp lý trên mang tính thông tin chung, cập nhật đến tháng 10/2026, không phải tư vấn pháp lý. Với hệ thống AI trong lĩnh vực y tế, tài chính, giáo dục hoặc có khả năng thuộc nhóm rủi ro cao, doanh nghiệp nên tham vấn luật sư về phân loại rủi ro, điều khoản hợp đồng với nhà cung cấp và bảo hiểm trách nhiệm (Điều 14 khoản 5 Luật Trí tuệ nhân tạo khuyến khích tham gia bảo hiểm trách nhiệm dân sự).

Những hiểu lầm phổ biến về ảo giác AI

  1. “Mô hình mới nhất không còn ảo giác.” Mô hình mới thường ít ảo giác hơn ở nhiều bài kiểm thử, nhưng chưa nhà cung cấp nào tuyên bố đã loại bỏ hoàn toàn. Số liệu SimpleQA ở trên cho thấy một mô hình có thể đúng nhiều hơn mà vẫn sai nhiều hơn.
  2. “Có RAG là hết bịa.” RAG giảm ảo giác do thiếu kiến thức, nhưng truy xuất sai hoặc mô hình thêm thắt vẫn xảy ra, như nghiên cứu về công cụ pháp lý cho thấy.
  3. “AI có ghi nguồn tức là đúng.” Nguồn có thể không tồn tại, hoặc tồn tại nhưng không nói điều được trích. Phải mở nguồn ra đọc.
  4. “Hạ nhiệt độ về 0 là hết ảo giác.” Nhiệt độ thấp chỉ làm câu trả lời ổn định hơn. Nếu mô hình không biết, nó có thể đưa cùng một đáp án sai mỗi lần.
  5. “AI sai thì lỗi của AI.” Về pháp lý và trong thực tế, người hoặc tổ chức dùng kết quả AI để ra quyết định, gửi khách hàng hay nộp cơ quan nhà nước mới là bên chịu trách nhiệm.

Câu hỏi thường gặp

Ảo giác AI là gì, nói đơn giản?

Là khi AI “nói chắc như đinh đóng cột” một điều sai hoặc tự bịa ra, như một người trả lời phỏng vấn không biết đáp án nhưng vẫn ứng biến cho trôi chảy.

Vì sao gọi là “ảo giác”?

Thuật ngữ mượn từ tâm lý học, chỉ việc thấy điều không có thật. Nhiều chuyên gia, trong đó có NIST, cho rằng từ “confabulation” (bịa chuyện) chính xác hơn vì AI không có tri giác; nhưng “hallucination” đã trở thành cách gọi phổ biến.

ChatGPT, Gemini, Claude có bị ảo giác không?

Có. Mọi mô hình ngôn ngữ lớn hiện nay đều có thể ảo giác. Mức độ khác nhau theo mô hình, phiên bản, loại câu hỏi và việc có cấp tài liệu nguồn hay không. Chính các nhà phát triển đều khuyến nghị người dùng kiểm tra thông tin quan trọng.

Tỷ lệ ảo giác của AI là bao nhiêu?

Không có một con số chung. Trên bài tóm tắt có cấp sẵn tài liệu, tỷ lệ có thể thấp; với câu hỏi dữ kiện hiếm không có tài liệu, tỷ lệ sai có thể rất cao, như o4-mini trả lời sai 75% số câu hỏi trên SimpleQA. Cách duy nhất đáng tin là đo trên bộ câu hỏi của chính bạn.

Làm sao tự kiểm tra một câu trả lời có bị ảo giác không?

Yêu cầu AI chỉ rõ nguồn rồi mở nguồn đó ra đọc; đối chiếu số liệu, tên, ngày với trang chính thức; hỏi lại cùng câu theo cách khác hoặc ở phiên mới để xem câu trả lời có nhất quán; cảnh giác với chi tiết quá cụ thể mà bạn chưa từng nghe tới.

Có thể loại bỏ hoàn toàn ảo giác AI không?

Với công nghệ hiện tại thì chưa. Mục tiêu thực tế là giảm tỷ lệ ảo giác xuống mức chấp nhận được cho từng tình huống và có lớp kiểm soát để lỗi còn sót không gây hậu quả.