LLM là gì? Mô hình ngôn ngữ lớn hoạt động ra sao

Trả lời nhanh: LLM (Large Language Model), tức mô hình ngôn ngữ lớn, là mô hình AI có hàng tỷ tham số, được huấn luyện trên lượng văn bản rất lớn để dự đoán từ tiếp theo. Nhờ đó nó viết, tóm tắt, dịch, trả lời câu hỏi và viết mã. ChatGPT, Claude, Gemini đều chạy trên LLM.

Điểm chính

  • LLM không tra cứu sự thật. Nó tính xác suất của token (mẩu chữ) tiếp theo, nên có thể trả lời trôi chảy nhưng sai, gọi là ảo giác.
  • Gần như mọi LLM hiện nay dựa trên kiến trúc Transformer, công bố năm 2017.
  • Trợ lý như ChatGPT ra đời qua ba giai đoạn: tiền huấn luyện, tinh chỉnh có giám sát và RLHF (học tăng cường từ phản hồi con người).
  • Doanh nghiệp có bốn cách dùng chính: gọi API, RAG, tinh chỉnh và tự triển khai mô hình trọng số mở.
  • Luật Trí tuệ nhân tạo số 134/2025/QH15, hiệu lực từ 01/03/2026, đặt nghĩa vụ minh bạch và ưu tiên phát triển LLM tiếng Việt.
Mục lục
  1. LLM là gì?
  2. LLM ra đời từ khi nào? Các mốc chính
  3. LLM hoạt động như thế nào?
  4. LLM được huấn luyện ra sao? Từ mô hình nền tới trợ lý AI
  5. Những khái niệm nào cần biết khi dùng LLM?
  6. Các LLM phổ biến hiện nay gồm những mô hình nào?
  7. Có LLM tiếng Việt nào do Việt Nam phát triển?
  8. LLM, chatbot và AI agent khác nhau thế nào?
  9. Doanh nghiệp dùng LLM theo những cách nào?
  10. Dùng LLM có rủi ro gì về bảo mật và pháp lý?
  11. Làm sao đánh giá và chọn LLM phù hợp?
  12. Những hiểu lầm phổ biến về LLM
  13. Câu hỏi thường gặp

LLM là gì?

LLM (Large Language Model) là mô hình ngôn ngữ lớn: một mạng nơ-ron học sâu có từ hàng tỷ tham số, học từ lượng văn bản rất lớn để đoán phần chữ tiếp theo của một đoạn văn. Khi khả năng “đoán tiếp” đủ tốt, mô hình làm được nhiều việc ngôn ngữ mà không cần lập trình riêng cho từng việc.

Ví dụ: bạn gõ “Viết email xin dời lịch họp sang thứ Năm, giọng lịch sự”. LLM không có sẵn mẫu email đó. Nó sinh từng mẩu chữ, mỗi lần chọn mẩu hợp lý nhất theo những gì đã học, cho tới khi ra bức email hoàn chỉnh.

Vậy mô hình ngôn ngữ lớn là gì trong bức tranh chung? LLM là một nhánh của trí tuệ nhân tạo, thuộc mảng xử lý ngôn ngữ tự nhiên, xây bằng kỹ thuật học sâu (deep learning) và là động cơ chính của AI tạo sinh dạng văn bản. Chữ “lớn” nói về hai thứ: số tham số và khối lượng dữ liệu huấn luyện.

LLM ra đời từ khi nào? Các mốc chính

Để trả lời đầy đủ câu hỏi LLM là gì, cần nhìn lại vài mốc đã định hình công nghệ này. Các mốc dưới đây được đối chiếu với công bố gốc.

  • 12/06/2017: nhóm nghiên cứu của Google công bố bài báo “Attention Is All You Need”, giới thiệu kiến trúc Transformer. Kiến trúc này chỉ dựa vào cơ chế chú ý (attention), bỏ hẳn mạng hồi quy và tích chập, nên huấn luyện song song được.
  • 11/06/2018: OpenAI công bố GPT đầu tiên: tiền huấn luyện sinh (generative pre-training) trên văn bản chưa gán nhãn, rồi tinh chỉnh cho từng tác vụ.
  • 11/10/2018: Google công bố BERT, mô hình đọc ngữ cảnh cả hai phía trái và phải, mạnh cho tìm kiếm và phân loại văn bản.
  • 05/2020: nhóm của Patrick Lewis công bố kỹ thuật RAG (22/05). Bài báo GPT-3 với 175 tỷ tham số (28/05) cho thấy mô hình đủ lớn làm được tác vụ mới chỉ từ vài ví dụ trong câu lệnh.
  • 04/03/2022: OpenAI công bố InstructGPT, dùng RLHF để mô hình làm theo chỉ dẫn tốt hơn.
  • 30/11/2022: ChatGPT ra mắt, đưa LLM tới người dùng phổ thông.
  • 2023: Meta công bố LLaMA (24/02) và Llama 2 (18/07); Anthropic giới thiệu Claude (14/03); Google công bố Gemini (06/12).
  • Tháng 11/2023: VinAI công bố PhoGPT; Zalo AI cùng Viện Khoa học và Công nghệ Tiên tiến Nhật Bản (JAIST) ra mắt bộ đánh giá VMLU cho LLM tiếng Việt.
  • 22/01/2025: DeepSeek phát hành DeepSeek-R1 với trọng số mở theo giấy phép MIT.

LLM hoạt động như thế nào?

Để hiểu LLM hoạt động như thế nào, hãy theo một câu hỏi đi qua mô hình. Có bốn khái niệm cần nắm: token, embedding, attention và dự đoán token tiếp theo.

LLM sinh câu trả lời từng token một Đầu vào: “Thủ đô của Việt Nam là” 1. Tách token Tokenization Cắt câu thành các mẩu chữ (token), mỗi token có một mã số trong bộ từ vựng 2. Embedding Biểu diễn vectơ Đổi mỗi token thành một dãy số (vectơ); từ gần nghĩa có vectơ gần nhau 3. Lớp Transformer Attention Hàng chục lớp xử lý; mỗi token “chú ý” tới các token khác để hiểu ngữ cảnh 4. Tính xác suất Token tiếp theo Chấm điểm mọi token trong bộ từ vựng, ví dụ minh hoạ: “Hà” cao nhất, “thành” thấp hơn 5. Chọn token Theo nhiệt độ Lấy một token, nối vào cuối chuỗi rồi đưa cả chuỗi mới quay lại bước 1 Đầu ra: “Hà Nội.” khi gặp token kết thúc hoặc chạm giới hạn độ dài
Vòng lặp nét đứt: mỗi token mới sinh ra lại trở thành đầu vào cho bước kế tiếp. Xác suất ở bước 4 chỉ là ví dụ minh hoạ.

Token: đơn vị chữ mà LLM đọc

LLM không đọc theo từ mà theo token. Token có thể là một từ, một phần của từ, dấu câu hoặc khoảng trắng. Theo hướng dẫn của OpenAI, với tiếng Anh, 100 token xấp xỉ 75 từ; các ngôn ngữ khác có tỷ lệ khác. Với tiếng Việt, hãy dùng công cụ đếm token của chính nhà cung cấp, vì phí API và giới hạn độ dài đều tính bằng token.

Embedding: biến chữ thành số

Mỗi token được đổi thành một vectơ, tức một dãy dài các con số. Qua huấn luyện, các token có nghĩa hoặc cách dùng gần nhau sẽ có vectơ nằm gần nhau. Đây cũng là nền tảng của tìm kiếm ngữ nghĩa trong RAG.

Attention: hiểu từ theo ngữ cảnh

Cơ chế chú ý cho phép mỗi token “nhìn” sang các token khác và quyết định nên dựa vào token nào. Trong câu “Con cá này ngon, nó được nướng than”, attention giúp mô hình hiểu “nó” là “con cá”.

Dự đoán token tiếp theo

Ở lớp cuối, mô hình chấm điểm xác suất cho mọi token trong bộ từ vựng, chọn một token, nối vào câu rồi lặp lại. Đây là lý do LLM viết trôi chảy nhưng vẫn có thể sai: mục tiêu của nó là chuỗi chữ hợp lý, không phải chuỗi chữ đã kiểm chứng.

LLM được huấn luyện ra sao? Từ mô hình nền tới trợ lý AI

Mô hình chỉ biết đoán chữ chưa phải trợ lý hữu ích. Theo mô tả chính thức của OpenAI về ChatGPT và InstructGPT, quy trình phổ biến gồm ba giai đoạn.

Ba giai đoạn tạo ra một trợ lý dựa trên LLM 1. Tiền huấn luyện Pre-training Dữ liệu: khối văn bản rất lớn, chưa gán nhãn Việc học: đoán token tiếp theo, hàng tỷ lần Kết quả: mô hình nền (base model) 2. Tinh chỉnh Supervised fine-tuning Dữ liệu: câu hỏi kèm câu trả lời mẫu do người viết Việc học: bắt chước cách trả lời mẫu Kết quả: mô hình biết làm theo chỉ dẫn 3. RLHF Học tăng cường từ phản hồi của con người 3a. Người đánh giá xếp hạng nhiều câu trả lời 3b. Huấn luyện mô hình thưởng (reward model) 3c. Tối ưu mô hình theo điểm thưởng (PPO) Kết quả: trợ lý hội thoại hữu ích hơn, ít nội dung độc hại hơn
Giai đoạn 1 tốn nhiều tài nguyên tính toán nhất; giai đoạn 2 và 3 cần nhiều công sức con người viết mẫu và chấm điểm.

Giai đoạn 1: Tiền huấn luyện (pre-training)

Mô hình đọc lượng văn bản khổng lồ từ web, sách, mã nguồn và tự học bằng cách đoán token tiếp theo. Đây là giai đoạn tốn kém nhất về tài nguyên tính toán. Kết quả là mô hình nền: biết nhiều về ngôn ngữ nhưng chưa biết trò chuyện.

Giai đoạn 2: Tinh chỉnh có giám sát (supervised fine-tuning)

Người viết các cặp câu hỏi và câu trả lời mẫu; mô hình học bắt chước cách trả lời đúng trọng tâm, có cấu trúc. Chất lượng giai đoạn này phụ thuộc trực tiếp vào dữ liệu mẫu, tức công việc gán nhãn dữ liệu ở quy mô lớn.

Giai đoạn 3: RLHF (Reinforcement Learning from Human Feedback)

Người đánh giá xếp hạng nhiều câu trả lời cho cùng một câu hỏi. Dữ liệu xếp hạng dùng để huấn luyện mô hình thưởng, tức mô hình chấm điểm thay con người. Sau đó LLM được tối ưu bằng học tăng cường để tạo câu trả lời đạt điểm cao; OpenAI cho biết ChatGPT dùng thuật toán PPO cho bước này.

Hiệu quả khá rõ. Trong bài báo InstructGPT, người đánh giá ưa chuộng câu trả lời của mô hình 1,3 tỷ tham số đã qua RLHF hơn mô hình GPT-3 175 tỷ tham số, dù nhỏ hơn khoảng 100 lần. To hơn chưa chắc tốt hơn.

Những khái niệm nào cần biết khi dùng LLM?

Thuật ngữÝ nghĩaTác động thực tế
Tham số (parameters)Các con số mô hình học được, lưu “kiến thức” của nó. GPT-3 có 175 tỷ tham số.Nhiều tham số thường mạnh hơn nhưng cần phần cứng đắt hơn, chạy chậm hơn.
TokenMẩu chữ nhỏ nhất mô hình xử lý.Phí API, tốc độ và giới hạn độ dài đều tính bằng token.
Cửa sổ ngữ cảnh (context window)Tổng số token mô hình xem được trong một lượt, gồm câu lệnh, lịch sử hội thoại, tài liệu và cả câu trả lời.Quyết định đưa được bao nhiêu tài liệu vào một lần hỏi. Tài liệu của Anthropic ghi các mô hình Claude có cửa sổ 200.000 hoặc 1 triệu token tuỳ mô hình.
Nhiệt độ (temperature)Tham số điều chỉnh độ ngẫu nhiên khi chọn token.Theo tài liệu Gemini API, nhiệt độ thấp hợp với câu trả lời cần ổn định; nhiệt độ cao cho kết quả đa dạng, sáng tạo hơn.
Câu lệnh (prompt)Nội dung gửi cho mô hình; câu lệnh hệ thống (system prompt) đặt vai trò và luật chung.Nêu rõ mục tiêu, ngữ cảnh, định dạng đầu ra giúp giảm sai.
Ảo giác (hallucination)Thông tin nghe hợp lý nhưng sai hoặc bịa.Mọi số liệu, trích dẫn, điều luật do LLM đưa ra cần kiểm tra lại.
Trọng số mở (open-weight)Nhà phát triển cho tải về tham số của mô hình.Tự chạy trên máy chủ riêng được, nhưng phải đọc kỹ giấy phép.

Các LLM phổ biến hiện nay gồm những mô hình nào?

Các LLM phổ biến chia làm hai nhóm: nhóm đóng chỉ dùng qua ứng dụng hoặc API của nhà cung cấp, nhóm trọng số mở cho tải mô hình về tự chạy. Bảng dưới mô tả trung lập theo trang chính thức, không xếp hạng. Phiên bản thay đổi rất nhanh.

Dòng mô hìnhĐơn vị phát triểnNhómĐiểm cần biết
GPTOpenAI (Mỹ)ĐóngNền tảng của ChatGPT; dùng qua ứng dụng và API.
ClaudeAnthropic (Mỹ)ĐóngGiới thiệu ngày 14/03/2023; cửa sổ ngữ cảnh 200.000 tới 1 triệu token tuỳ mô hình.
GeminiGoogle (Mỹ)ĐóngCông bố ngày 06/12/2023, thiết kế đa phương thức (hiểu văn bản, ảnh, âm thanh, video) ngay từ đầu.
GemmaGoogleTrọng số mởGoogle mô tả là các mô hình mở, gọn nhẹ, xây từ cùng công nghệ với Gemini.
LlamaMeta (Mỹ)Trọng số mởLLaMA (02/2023) chỉ cho nghiên cứu; từ Llama 2 (07/2023) được dùng cả nghiên cứu lẫn thương mại theo giấy phép của Meta.
MistralMistral AI (Pháp)Cả haiCó mô hình trọng số mở giấy phép Apache 2.0 và mô hình thương mại hạng “Premier”.
QwenAlibaba Cloud (Trung Quốc)Trọng số mởMô hình mở dùng giấy phép Apache 2.0; Qwen3 công bố hỗ trợ hơn 100 ngôn ngữ và phương ngữ.
DeepSeekDeepSeek (Trung Quốc)Trọng số mởDeepSeek-R1 phát hành theo giấy phép MIT, cho phép dùng thương mại.

Lưu ý: “trọng số mở” khác “nguồn mở” đầy đủ. Nhiều hãng không công bố dữ liệu huấn luyện, và giấy phép có thể kèm điều kiện.

Có LLM tiếng Việt nào do Việt Nam phát triển?

Có. Tiếng Việt có ít dữ liệu huấn luyện hơn tiếng Anh, nên nhiều nhóm trong nước đầu tư mô hình riêng. Các thông tin dưới đây đều có công bố chính thức hoặc báo chí đưa tin.

  • PhoGPT (VinAI Research): công bố tháng 11/2023, khoảng 3,7 tỷ tham số, tiền huấn luyện trên 102 tỷ token tiếng Việt, cửa sổ ngữ cảnh 8.192 token; có bản nền và bản trò chuyện.
  • KiLM (Zalo): theo Zalo, bản 7 tỷ tham số ra mắt cuối năm 2023, bản 13 tỷ tham số năm 2024, đều huấn luyện từ đầu thay vì tinh chỉnh mô hình có sẵn.
  • VT-Super-120B-A12B (Viettel AI): theo báo chí ngày 04/06/2026, mô hình 120 tỷ tham số phát triển trên kiến trúc mở NVIDIA Nemotron 3 Super, tiếp tục tiền huấn luyện bằng dữ liệu tiếng Việt rồi tinh chỉnh và học tăng cường.
  • Liên minh AI Âu Lạc: ra mắt tháng 6/2025, hơn 20 doanh nghiệp, viện, trường như FPT, MobiFone, VNPT, CMC, MISA, BKAV, Zalo; mục tiêu xây dựng LLM tiếng Việt.
  • Bộ đánh giá VMLU: gồm 10.880 câu trắc nghiệm thuộc 58 môn, từ tiểu học tới trình độ chuyên môn; bài báo về bộ công cụ được trình bày tại hội nghị ACL 2025.

Về chính sách, Luật Trí tuệ nhân tạo số 134/2025/QH15 nhắc trực tiếp tới LLM tiếng Việt. Điều 16 đưa “mô hình ngôn ngữ lớn tiếng Việt và tiếng dân tộc thiểu số” vào hạ tầng AI quốc gia do Nhà nước đầu tư. Điều 18 ưu tiên nguồn lực nghiên cứu các mô hình này. Điều 25 cho phép doanh nghiệp khởi nghiệp sáng tạo, doanh nghiệp nhỏ và vừa dùng phiếu hỗ trợ để thuê hạ tầng tính toán và LLM tiếng Việt.

Lưu ý: điểm benchmark thường do chính nhà phát triển công bố và chỉ để tham khảo. Mô hình điểm cao trên VMLU chưa chắc tốt nhất cho hợp đồng, chăm sóc khách hàng hay mã nguồn của bạn.

LLM, chatbot và AI agent khác nhau thế nào?

LLM là bộ não ngôn ngữ, chatbot là giao diện trò chuyện, còn AI agent là hệ thống biết tự lập kế hoạch và hành động.

Tiêu chíLLMChatbotAI agent
Bản chấtMô hình sinh văn bảnỨng dụng hội thoại với người dùngHệ thống tự làm nhiệm vụ nhiều bước
Có cần LLM?Chính là LLMKhông bắt buộc; chatbot kịch bản cũ chạy theo cây quy tắcThường dùng LLM để lập kế hoạch, suy luận
Hành động bên ngoàiKhông, chỉ trả về chữHạn chế, chủ yếu trả lờiGọi công cụ, API, đọc ghi dữ liệu, gửi email
Ví dụGPT, Claude, Gemini, PhoGPTÔ chat hỗ trợ trên websiteTrợ lý tự đặt lịch, đối soát hoá đơn, tạo ticket
Rủi ro chínhẢo giác, thiên lệchTrả lời sai chính sách công tyLàm sai hành động, bị lợi dụng quyền hạn

Doanh nghiệp dùng LLM theo những cách nào?

Có bốn cách chính, từ dễ tới khó. Nên bắt đầu từ cách đầu tiên và chỉ đi tiếp khi có lý do rõ ràng.

Cách dùngMô tảƯu điểmNhược điểmPhù hợp khi
Gọi API, dùng ứng dụng có sẵnDùng mô hình của nhà cung cấp, viết câu lệnh tốtNhanh, không cần hạ tầng, có ngay mô hình mạnhDữ liệu đi ra ngoài; phụ thuộc giá và chính sách nhà cung cấpSoạn thảo, tóm tắt, dịch, thử ý tưởng
RAG (truy xuất tăng cường)Tìm đoạn tài liệu nội bộ liên quan rồi đưa vào câu lệnh để LLM trả lời dựa trên đóDùng được dữ liệu mới, có trích nguồn, giảm ảo giác, không cần huấn luyện lạiPhụ thuộc chất lượng tìm kiếm và độ sạch tài liệuHỏi đáp quy trình, chính sách, tài liệu sản phẩm
Tinh chỉnh (fine-tuning)Huấn luyện thêm mô hình bằng ví dụ của doanh nghiệpGiữ đúng giọng văn, định dạng, thuật ngữ ngànhCần dữ liệu gán nhãn tốt, tốn chi phí; kiến thức vẫn dừng ở thời điểm huấn luyệnTác vụ lặp lại, định dạng cố định, khối lượng lớn
Triển khai nội bộ (self-host)Chạy mô hình trọng số mở trên máy chủ riêngDữ liệu không rời hệ thống; chủ động phiên bảnCần GPU, đội vận hành, bảo mật; mô hình mở có thể yếu hơn mô hình đóng lớnNgân hàng, y tế, dữ liệu nhạy cảm

Ví dụ minh hoạ: một công ty phân phối muốn trợ lý trả lời nhân viên về chính sách đổi trả. Cách hợp lý thường là RAG: đưa tài liệu chính sách vào kho tìm kiếm, mỗi câu hỏi lấy ra vài đoạn liên quan, yêu cầu LLM chỉ trả lời dựa trên các đoạn đó và ghi rõ trích từ mục nào.

Dù chọn cách nào, chất lượng dữ liệu đầu vào vẫn quyết định kết quả. Tài liệu trùng lặp, lỗi thời, mâu thuẫn sẽ cho ra câu trả lời sai, đúng nguyên tắc “rác vào, rác ra”.

Dùng LLM có rủi ro gì về bảo mật và pháp lý?

Ảo giác và thông tin sai

Ngày 22/06/2023, thẩm phán liên bang P. Kevin Castel tại New York phạt 5.000 USD hai luật sư vì nộp bản luận cứ trích dẫn các bản án không tồn tại do ChatGPT tạo ra.

Rò rỉ dữ liệu

Tháng 5/2023, theo Bloomberg, Samsung cấm nhân viên một bộ phận lớn dùng ChatGPT và công cụ AI tạo sinh sau khi có người tải mã nguồn nội bộ lên. Doanh nghiệp cần quy định loại dữ liệu nào được đưa vào công cụ nào, và kiểm tra điều khoản: dữ liệu có bị dùng để huấn luyện không, lưu ở đâu, lưu bao lâu.

Tấn công chèn lệnh (prompt injection)

Đây là rủi ro số một (LLM01) trong danh sách OWASP Top 10 cho ứng dụng LLM năm 2025. Kẻ xấu cài câu lệnh ẩn vào email, trang web hay tài liệu; khi LLM đọc nội dung đó, nó có thể làm theo lệnh lạ. Rủi ro tăng khi LLM được cấp quyền gửi email hay đọc cơ sở dữ liệu, điều OWASP gọi là quyền tự chủ quá mức (excessive agency).

Thiên lệch và bản quyền

LLM có thể mang định kiến từ dữ liệu huấn luyện, và nội dung sinh ra có thể giống tác phẩm có bản quyền. Việc nhạy cảm như tuyển dụng, tín dụng cần người duyệt cuối.

Khung pháp lý tại Việt Nam

Luật Trí tuệ nhân tạo số 134/2025/QH15 được Quốc hội thông qua ngày 10/12/2025, có hiệu lực từ 01/03/2026. Những điểm doanh nghiệp dùng LLM cần biết:

  • Phân loại rủi ro (Điều 9): ba mức cao, trung bình, thấp. Mức trung bình gồm hệ thống có thể gây nhầm lẫn, tác động hoặc thao túng người dùng vì họ không nhận biết đang tương tác với AI hoặc nội dung do AI tạo ra.
  • Minh bạch (Điều 11): nhà cung cấp phải bảo đảm người dùng nhận biết khi đang tương tác với hệ thống AI. Bên triển khai phải thông báo rõ khi đưa ra công chúng nội dung tạo hoặc sửa bằng AI nếu nội dung đó có thể gây nhầm lẫn về tính xác thực của sự kiện, nhân vật.
  • Hành vi bị cấm (Điều 7): có việc thu thập, xử lý dữ liệu để huấn luyện hay vận hành hệ thống AI trái quy định về dữ liệu, dữ liệu cá nhân, sở hữu trí tuệ và an ninh mạng.
  • Chuyển tiếp (Điều 35): hệ thống đã hoạt động trước 01/03/2026 có 18 tháng để tuân thủ nếu thuộc y tế, giáo dục, tài chính; lĩnh vực khác có 12 tháng.

Nghị định 142/2026/NĐ-CP ngày 30/04/2026, hiệu lực từ 01/05/2026, quy định chi tiết thi hành luật này. Nếu đưa dữ liệu khách hàng, nhân viên vào LLM, bạn còn phải tuân thủ Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15, hiệu lực từ 01/01/2026.

Lưu ý: phần pháp lý trên chỉ để định hướng. Hệ thống cụ thể thuộc mức rủi ro nào và cần làm thủ tục gì phải đối chiếu văn bản gốc và hỏi chuyên gia pháp lý.

Làm sao đánh giá và chọn LLM phù hợp?

Không có LLM tốt nhất cho mọi việc. Hãy chọn theo bài toán và kiểm thử bằng dữ liệu của chính bạn.

  1. Xác định tác vụ: tóm tắt biên bản, trả lời khách, trích thông tin hợp đồng hay viết mã.
  2. Thử tiếng Việt thật: văn bản có từ địa phương, thuật ngữ ngành, viết tắt nội bộ.
  3. Lập bộ kiểm thử riêng: 50 đến 200 câu hỏi thật kèm đáp án, có cả câu mô hình nên trả lời “không biết”.
  4. Đo tỷ lệ ảo giác: nhất là con số, ngày tháng, điều luật.
  5. Cửa sổ ngữ cảnh đủ cho độ dài tài liệu cần xử lý.
  6. Chi phí mỗi tác vụ: tính theo token đầu vào và đầu ra thực tế.
  7. Độ trễ phù hợp với kênh sử dụng.
  8. Bảo mật, nơi lưu dữ liệu và giấy phép phù hợp quy định nội bộ và pháp luật.
  9. Khả năng thay thế: thiết kế để đổi mô hình mà không viết lại toàn bộ hệ thống.

Những hiểu lầm phổ biến về LLM

  1. “LLM biết hết mọi thứ.” Kiến thức dừng ở thời điểm huấn luyện, trừ khi được nối với công cụ tìm kiếm hoặc tài liệu bên ngoài.
  2. “LLM hiểu như con người.” LLM mô hình hoá xác suất chuỗi chữ. Nó có thể giải bài khó nhưng sai ở câu hỏi mẹo đơn giản.
  3. “Trả lời tự tin là trả lời đúng.” Ảo giác thường được trình bày rất thuyết phục.
  4. “Muốn LLM biết dữ liệu công ty thì phải tinh chỉnh.” Với kiến thức hay thay đổi, RAG thường hợp hơn; tinh chỉnh hợp với dạy giọng văn và định dạng.
  5. “Trọng số mở là miễn phí hoàn toàn.” Không mất phí bản quyền, nhưng vẫn tốn GPU, vận hành, bảo mật và phải tuân thủ giấy phép.

Muốn đi sâu nền tảng kỹ thuật, bạn có thể đọc thêm về học máy (machine learning), lớp kiến thức nằm bên dưới mọi LLM.

Câu hỏi thường gặp

LLM là viết tắt của từ gì?

LLM là viết tắt của Large Language Model, dịch là mô hình ngôn ngữ lớn. Nói ngắn gọn, LLM là gì? Là mô hình AI học từ lượng văn bản rất lớn để hiểu và sinh ngôn ngữ.

ChatGPT có phải là LLM không?

ChatGPT là ứng dụng trò chuyện chạy trên các LLM dòng GPT của OpenAI. GPT là mô hình; ChatGPT là sản phẩm gồm giao diện, bộ lọc an toàn và công cụ đi kèm.

LLM khác AI tạo sinh như thế nào?

AI tạo sinh gồm mọi mô hình tạo nội dung mới: văn bản, ảnh, âm thanh, video. LLM là phần chuyên về ngôn ngữ trong nhóm đó; mô hình tạo ảnh không phải LLM.

Vì sao LLM bị ảo giác?

Vì mục tiêu huấn luyện là sinh chuỗi chữ có xác suất cao, không phải kiểm chứng sự thật. RAG, yêu cầu trích nguồn và kiểm tra lại giúp giảm nhưng không loại bỏ hoàn toàn.

LLM có hiểu tiếng Việt tốt không?

Các mô hình lớn xử lý tiếng Việt khá tốt cho tác vụ phổ thông. Với thuật ngữ chuyên ngành, văn bản hành chính, từ địa phương, chất lượng chênh lệch giữa các mô hình. PhoGPT, KiLM là các mô hình huấn luyện tập trung vào tiếng Việt.

Có thể chạy LLM trên máy tính cá nhân không?

Có, với mô hình trọng số mở cỡ nhỏ. Google cho biết các mô hình Gemma chạy được từ máy chủ đám mây tới máy tính xách tay và điện thoại. Mô hình càng lớn càng cần nhiều bộ nhớ GPU.

Doanh nghiệp nhỏ nên bắt đầu dùng LLM thế nào?

Chọn một việc lặp lại như soạn email trả lời khách hay tóm tắt biên bản, dùng công cụ có sẵn, cấm đưa dữ liệu nhạy cảm vào, đo thời gian tiết kiệm được rồi mới tính tới RAG hay tự triển khai.

Dùng chatbot LLM cho khách hàng có phải báo cho họ biết không?

Theo khoản 1 Điều 11 Luật Trí tuệ nhân tạo số 134/2025/QH15, hệ thống AI tương tác trực tiếp với con người phải được thiết kế để người dùng nhận biết đang tương tác với AI, trừ trường hợp pháp luật có quy định khác. Cách đơn giản là ghi rõ trong khung chat đây là trợ lý AI.