Supervised learning là gì? Học có giám sát và ví dụ dễ hiểu

Trả lời nhanh: Supervised learning (học có giám sát) là cách dạy máy bằng các ví dụ đã có sẵn đáp án, gọi là dữ liệu có nhãn. Mô hình so dự đoán với đáp án, tự chỉnh sai số qua nhiều vòng, rồi dự đoán cho dữ liệu mới. Hai nhóm bài toán chính là phân loại và hồi quy.

Điểm chính

  • Học có giám sát cần cặp dữ liệu: đầu vào (đặc trưng) và đầu ra đúng (nhãn). “Giám sát” nghĩa là có đáp án để đối chiếu, không phải có người ngồi canh máy.
  • Phân loại dự đoán một nhóm (spam hay không, khách có rời bỏ hay không). Hồi quy dự đoán một con số (doanh số tuần tới, giá nhà).
  • Chất lượng nhãn quyết định trần chất lượng mô hình. Nghiên cứu năm 2021 ước tính tập kiểm định của ImageNet có ít nhất 6% nhãn sai.
  • Accuracy dễ đánh lừa khi dữ liệu lệch lớp. Hãy xem thêm precision, recall, F1 cho phân loại và MAE, RMSE cho hồi quy.
  • Từ 2026, huấn luyện mô hình trên dữ liệu cá nhân tại Việt Nam phải tuân thủ Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15 và Luật Trí tuệ nhân tạo 134/2025/QH15.
Mục lục
  1. Supervised learning là gì?
  2. Học có giám sát hoạt động như thế nào?
  3. Phân loại và hồi quy khác nhau thế nào?
  4. Ví dụ học có giám sát trong thực tế
  5. Quy trình xây dựng mô hình học có giám sát gồm những bước nào?
  6. Thuật toán học có giám sát phổ biến là gì?
  7. Đánh giá mô hình học có giám sát bằng chỉ số nào?
  8. Vì sao gán nhãn dữ liệu quyết định chất lượng học có giám sát?
  9. Học có giám sát và không giám sát khác nhau thế nào?
  10. Ưu và nhược điểm của học có giám sát
  11. Doanh nghiệp nên bắt đầu học có giám sát từ đâu?
  12. Huấn luyện mô hình trên dữ liệu cá nhân cần lưu ý pháp lý gì?
  13. Câu hỏi thường gặp

Supervised learning là gì?

Supervised learning, dịch là học có giám sát hoặc học máy có giám sát, là một nhánh của học máy (machine learning). Ở nhánh này, thuật toán học từ một tập ví dụ mà mỗi ví dụ đều kèm “đáp án đúng”. Học xong, mô hình tự dự đoán cho đầu vào mới chưa có đáp án.

Hãy hình dung học sinh luyện đề có lời giải. Em làm bài, so với đáp án, sai ở đâu thì sửa cách nghĩ. Lời giải chính là “người giám sát”. Trong học máy, vai trò này thuộc về nhãn (label) gắn với từng dòng dữ liệu.

Bốn thuật ngữ bạn sẽ gặp liên tục:

  • Đặc trưng (feature): thông tin đầu vào, ký hiệu X. Ví dụ: diện tích căn hộ, số phòng ngủ, quận.
  • Nhãn (label, target): giá trị cần dự đoán, ký hiệu y. Ví dụ: giá bán thực tế.
  • Mô hình (model): một hàm f có các tham số. Mục tiêu là tìm tham số sao cho f(X) gần y nhất.
  • Huấn luyện (training): quá trình chỉnh tham số dựa trên sai lệch giữa dự đoán và nhãn.

Dữ liệu có nhãn trông như thế nào?

Dữ liệu có nhãn thường là một bảng: mỗi hàng là một ví dụ, các cột đầu là đặc trưng, cột cuối là nhãn. Bảng sau là ví dụ minh hoạ cho bài toán phân loại đánh giá khách hàng của một cửa hàng trực tuyến:

Nội dung đánh giáSố saoCó ảnh kèmNhãn (y)
Giao nhanh, đóng gói kỹ, sẽ ủng hộ tiếp5CóTích cực
Áo bị lỗi đường may, nhắn shop không trả lời1CóTiêu cực
Hàng tạm được, màu hơi khác ảnh3KhôngTrung tính
Đặt size M giao size L, đổi mất cả tuần2KhôngTiêu cực

Với ảnh, nhãn là tên hoặc khung bao quanh vật thể. Với âm thanh, nhãn là đoạn văn bản tương ứng. Với dữ liệu kinh doanh, nhãn thường đã nằm sẵn trong hệ thống: khách có trả nợ đúng hạn không, đơn có bị hoàn không.

Bộ dữ liệu có nhãn kinh điển là MNIST: ảnh chữ số viết tay 0–9, kích thước 28×28 điểm ảnh, gồm 60.000 ảnh huấn luyện và 10.000 ảnh kiểm tra (theo danh mục TensorFlow Datasets). Lớn hơn nhiều là ImageNet: trang chính thức của dự án cho biết bộ dữ liệu có hơn 14,1 triệu ảnh, sắp xếp theo hệ phân cấp WordNet và do con người chú thích.

Học có giám sát hoạt động như thế nào?

Mọi thuật toán học có giám sát đều đi theo cùng một vòng lặp, từ hồi quy tuyến tính đến mạng nơ-ron hàng tỷ tham số:

  1. Khởi tạo: tham số ban đầu ngẫu nhiên, nên dự đoán gần như đoán mò.
  2. Dự đoán thử: đưa một nhóm ví dụ huấn luyện vào, mô hình trả về dự đoán.
  3. Đo sai số: so dự đoán với nhãn bằng hàm mất mát (loss function). Hồi quy hay dùng sai số bình phương; phân loại hay dùng cross-entropy, phạt nặng khi mô hình tự tin mà sai.
  4. Chỉnh tham số: thuật toán tối ưu, phổ biến nhất là gradient descent (giảm theo độ dốc), dịch tham số theo hướng làm sai số nhỏ đi.
  5. Lặp lại cho tới khi sai số trên dữ liệu kiểm định không giảm nữa.

Huấn luyện xong, mô hình chuyển sang giai đoạn suy luận (inference): nhận dữ liệu mới chỉ có đầu vào và trả kết quả.

Giai đoạn 1: Huấn luyện (có đáp án) Dữ liệu có nhãn đầu vào X + nhãn y vd: email + spam? Thuật toán học dự đoán thử trên từng ví dụ Mô hình đã học hàm f ánh xạ X → y với tham số đã chỉnh Vòng lặp: so dự đoán với nhãn đúng, tính sai số (loss), chỉnh tham số Giai đoạn 2: Dự đoán (chưa có đáp án) Dữ liệu mới chỉ có đầu vào X vd: email vừa đến Mô hình áp dụng hàm f đã học ở giai đoạn 1 Kết quả dự đoán nhãn (phân loại) hoặc con số (hồi quy) triển khai Mô hình chỉ tốt bằng chất lượng nhãn mà nó được học.
Hình 1. Học có giám sát gồm hai giai đoạn: huấn luyện trên dữ liệu có đáp án, rồi dùng mô hình để dự đoán cho dữ liệu mới.

Mô hình không “hiểu” vấn đề như con người. Nó chỉ tìm mẫu thống kê nối đầu vào với nhãn. Nếu nhãn sai có hệ thống, mô hình sẽ học đúng cái sai đó.

Phân loại và hồi quy khác nhau thế nào?

Gần như mọi bài toán học có giám sát rơi vào một trong hai nhóm. Cách phân biệt nằm ở kiểu của nhãn, không nằm ở thuật toán.

Tiêu chíPhân loại (classification)Hồi quy (regression)
Nhãn là gìMột nhóm rời rạc: có/không, A/B/CMột con số liên tục
Câu hỏi điển hình“Thuộc loại nào?”“Bao nhiêu?”
Ví dụEmail spam, giao dịch gian lận, ảnh sản phẩm lỗiDoanh số tuần tới, giá nhà, thời gian giao hàng
Đầu ra mô hìnhNhãn kèm xác suất, ví dụ 92% là spamMột giá trị, ví dụ 3,2 tỷ đồng
Chỉ số đánh giáAccuracy, precision, recall, F1, AUCMAE, RMSE, R²

Các dạng bài toán phân loại

  • Nhị phân (binary): hai lớp. Ví dụ: khách có rời bỏ dịch vụ trong 30 ngày tới không.
  • Đa lớp (multi-class): mỗi mẫu thuộc đúng một trong nhiều lớp. Ví dụ: phiếu hỗ trợ thuộc “thanh toán”, “giao hàng”, “kỹ thuật” hay “khác”.
  • Đa nhãn (multi-label): một mẫu mang nhiều nhãn cùng lúc. Ví dụ: bài báo vừa thuộc “kinh tế” vừa thuộc “công nghệ”.

Với hồi quy, dạng hay gặp trong doanh nghiệp là dự báo chuỗi thời gian, ví dụ dự báo lượng đơn theo giờ để xếp ca kho.

Dễ nhầm: hồi quy logistic (logistic regression) tuy có chữ “hồi quy” nhưng là thuật toán phân loại. Nó cho ra xác suất từ 0 đến 1, rồi so với một ngưỡng để chọn lớp.

Một bài toán có thể đặt theo cả hai cách: “doanh số tuần tới bao nhiêu” là hồi quy, “có vượt chỉ tiêu không” là phân loại.

Ví dụ học có giám sát trong thực tế

Bảng dưới gom các ứng dụng phổ biến, kèm đầu vào và nhãn cụ thể để bạn thấy dữ liệu cần chuẩn bị. Đây là ví dụ minh hoạ theo cách làm phổ biến, không gắn với doanh nghiệp cụ thể.

Lĩnh vựcBài toánĐầu vào (X)Nhãn (y)Dạng
Ngân hàngChấm điểm tín dụngThu nhập, lịch sử trả nợ, dư nợCó quá hạn trên 90 ngày hay khôngPhân loại
Thanh toánPhát hiện gian lậnSố tiền, thiết bị, vị trí, giờ giao dịchGian lận / hợp lệ (đã xác minh)Phân loại
Bán lẻDự báo nhu cầuDoanh số các tuần trước, khuyến mãi, ngày lễSố lượng bán thực tếHồi quy
Dịch vụDự đoán khách rời bỏ (churn)Tần suất dùng, khiếu nại, gói cướcĐã huỷ dịch vụ hay chưaPhân loại
Sản xuấtKiểm tra lỗi ngoại quanẢnh sản phẩm trên băng chuyềnĐạt / lỗi, loại lỗiPhân loại
LogisticsƯớc tính thời gian giao hàngKhoảng cách, khung giờ, thời tiếtSố phút giao thực tếHồi quy

Điểm chung: doanh nghiệp đã có lịch sử kết quả thật. Đơn nào bị hoàn, khoản vay nào quá hạn, đơn giao mất bao lâu đều nằm trong hệ thống.

Học có giám sát trong các mô hình ngôn ngữ lớn

Chatbot thế hệ mới cũng dùng học có giám sát ở một bước quan trọng. Trong bài báo InstructGPT công bố ngày 04/03/2022, OpenAI mô tả việc thu thập câu trả lời mẫu do người gán nhãn viết, rồi dùng chúng để tinh chỉnh GPT-3 bằng học có giám sát (supervised fine-tuning). Sau đó nhóm thu thập thứ hạng do con người chấm cho các câu trả lời và tinh chỉnh tiếp bằng học tăng cường từ phản hồi con người (RLHF). Theo bài báo, người đánh giá ưa chuộng đầu ra của InstructGPT 1,3 tỷ tham số hơn GPT-3 175 tỷ tham số. Bước này được giải thích kỹ trong bài fine-tuning là gì.

Quy trình xây dựng mô hình học có giám sát gồm những bước nào?

Phần lớn công sức của dự án nằm ở dữ liệu và cách đặt bài toán, không phải ở việc chọn thuật toán.

  1. Xác định quyết định cần hỗ trợ. Ví dụ: “mỗi tuần gọi điện giữ chân 500 khách có nguy cơ rời bỏ cao nhất”. Câu này quyết định nhãn, khung thời gian và chỉ số đánh giá.
  2. Định nghĩa nhãn chính xác. “Rời bỏ” là không mua trong 60 hay 90 ngày? “Gian lận” là bị khiếu nại hay đã xác minh? Nhãn mơ hồ thì mô hình cũng mơ hồ.
  3. Thu thập dữ liệu từ CRM, ERP, nhật ký giao dịch, kho ảnh. Chỉ dùng thông tin có sẵn tại thời điểm cần dự đoán. Dùng cột “lý do huỷ” để dự đoán khách có huỷ không là lỗi rò rỉ dữ liệu (data leakage): điểm đẹp trên giấy, vô dụng khi chạy thật.
  4. Gán nhãn hoặc đối soát nhãn. Ảnh, văn bản, âm thanh thường cần người gán nhãn theo hướng dẫn chung; dữ liệu kinh doanh cần đối soát nhãn có sẵn.
  5. Tiền xử lý và tạo đặc trưng: xử lý giá trị thiếu, chuẩn hoá đơn vị, tạo đặc trưng có ý nghĩa như “số lần khiếu nại trong 30 ngày”.
  6. Chia dữ liệu thành tập huấn luyện (train), tập kiểm định (validation) để chọn mô hình và tập kiểm tra (test) chỉ dùng một lần ở cuối. Dữ liệu theo thời gian nên chia theo mốc thời gian, không chia ngẫu nhiên.
  7. Huấn luyện và đánh giá. Luôn bắt đầu bằng một mô hình mốc (baseline) rất đơn giản, ví dụ “dự đoán bằng trung bình tuần trước”.
  8. Triển khai và giám sát độ trôi dữ liệu (data drift) khi hành vi khách hàng, giá cả, chính sách thay đổi; huấn luyện lại khi chỉ số giảm.

Lưu ý: tập kiểm tra phải được “niêm phong”. Nếu bạn xem kết quả trên tập kiểm tra rồi quay lại chỉnh mô hình nhiều lần, con số cuối cùng sẽ lạc quan hơn thực tế.

Thuật toán học có giám sát phổ biến là gì?

Không có thuật toán tốt nhất cho mọi bài toán. Bảng dưới giúp bạn biết khi nào nên nghĩ tới thuật toán nào; cách hoạt động chi tiết đã có trong bài machine learning nêu ở đầu.

Thuật toánDùng choĐiểm mạnhĐiểm yếu
Hồi quy tuyến tínhHồi quyNhanh, dễ giải thích từng hệ sốChỉ bắt được quan hệ gần tuyến tính
Hồi quy logisticPhân loạiCho xác suất, dễ giải thích, làm mốc tốtYếu với quan hệ phức tạp
Naive BayesPhân loại văn bảnRất nhanh, cần ít dữ liệuGiả định các đặc trưng độc lập
Cây quyết địnhCả haiTrực quan, đọc được luậtDễ học thuộc lòng (overfitting)
Rừng ngẫu nhiên (random forest)Cả haiỔn định, ít phải tinh chỉnhKhó giải thích hơn một cây
Gradient boosting (XGBoost, LightGBM)Cả haiThường mạnh nhất với dữ liệu dạng bảngNhiều siêu tham số, dễ overfit nếu chỉnh ẩu
Mạng nơ-ron sâuCả haiVượt trội với ảnh, âm thanh, văn bảnCần nhiều dữ liệu, GPU, khó giải thích

Quy tắc chọn nhanh: dữ liệu dạng bảng từ hệ thống kinh doanh thì thử hồi quy logistic làm mốc rồi tới gradient boosting. Dữ liệu ảnh, âm thanh, văn bản thì nghĩ tới học sâu (deep learning), thường bằng cách tinh chỉnh một mô hình đã huấn luyện sẵn trên dữ liệu của bạn.

Đánh giá mô hình học có giám sát bằng chỉ số nào?

Đây là phần nhiều bài viết bỏ qua, nhưng lại quyết định mô hình có dùng được không.

Ma trận nhầm lẫn

Với phân loại nhị phân, mọi dự đoán rơi vào một trong bốn ô của ma trận nhầm lẫn (confusion matrix):

  • TP (true positive): thực tế dương, đoán dương. Spam bị chặn đúng.
  • FN (false negative): thực tế dương, đoán âm. Spam lọt vào hộp thư.
  • FP (false positive): thực tế âm, đoán dương. Thư thật bị chặn nhầm.
  • TN (true negative): thực tế âm, đoán âm. Thư thật đi đúng chỗ.
Ma trận nhầm lẫn: bộ lọc spam trên 1.000 email (ví dụ minh hoạ) Dự đoán: spam Dự đoán: thường Thực tế: spam (100 email) Thực tế: thường (900 email) TP = 80 bắt đúng spam FN = 20 spam lọt vào hộp thư FP = 10 chặn nhầm thư thật TN = 890 thư thật đi đúng Accuracy 97% Precision 88,9% Recall 80% F1 84,2% Precision = 80 / (80 + 10) = 88,9%Recall = 80 / (80 + 20) = 80% Accuracy = (80 + 890) / 1.000 = 97%F1 = 2 × 80 / (160 + 10 + 20) = 84,2% Mô hình “đoán mọi email là thường” vẫn đạt accuracy 90%, nhưng recall bằng 0.
Hình 2. Ma trận nhầm lẫn giúp thấy rõ mô hình sai ở đâu; accuracy cao chưa chắc mô hình đã hữu ích khi dữ liệu lệch lớp.

Accuracy, precision, recall và F1

Công thức dưới đây theo định nghĩa trong khoá Machine Learning Crash Course của Google:

  • Accuracy (độ chính xác tổng): (TP + TN) / tổng số mẫu.
  • Precision (độ chuẩn xác): TP / (TP + FP). Trong những lần mô hình nói “dương”, bao nhiêu lần đúng.
  • Recall (độ phủ, độ nhạy): TP / (TP + FN). Trong tất cả trường hợp dương thật, mô hình bắt được bao nhiêu.
  • F1: trung bình điều hoà của precision và recall, bằng 2TP / (2TP + FP + FN).

Tài liệu của Google nêu một ví dụ đáng nhớ: nếu lớp dương chỉ chiếm khoảng 1% dữ liệu, mô hình luôn đoán “âm” vẫn đạt accuracy 99% dù hoàn toàn vô dụng. Vì vậy bài toán gian lận, bệnh hiếm, lỗi sản phẩm không nên chỉ nhìn accuracy.

Ưu tiên precision hay recall?

Hai chỉ số này thường kéo ngược nhau: nâng ngưỡng xác suất để kết luận “dương” thì precision thường tăng, recall giảm. Câu hỏi đúng là sai kiểu nào tốn kém hơn.

Tình huốngSai kiểu nào đắt hơnNên ưu tiên
Sàng lọc giao dịch nghi gian lận để người kiểm tra lạiBỏ lọt gian lận (FN)Recall
Tự động khoá tài khoản kháchKhoá nhầm khách thật (FP)Precision
Phát hiện sản phẩm lỗi trước khi xuất xưởngLỗi lọt ra thị trường (FN)Recall

Chỉ số cho bài toán hồi quy

  • MAE (sai số tuyệt đối trung bình): dễ giải thích với người kinh doanh, kiểu “trung bình lệch 8 đơn hàng”.
  • RMSE (căn bậc hai sai số bình phương trung bình): phạt nặng các lần lệch lớn.
  • R² (hệ số xác định): mô hình giải thích được bao nhiêu phần biến động so với việc chỉ đoán bằng trung bình.

Ví dụ minh hoạ. Doanh số thực tế 3 ngày là 100, 120, 80 đơn; mô hình dự đoán 110, 115, 90. Độ lệch tuyệt đối là 10, 5, 10, nên MAE = 25 / 3 ≈ 8,3 đơn. Bình phương độ lệch là 100, 25, 100, trung bình 75, nên RMSE = √75 ≈ 8,7 đơn. RMSE càng vượt xa MAE thì càng có nhiều ngày mô hình lệch mạnh.

Overfitting, underfitting và kiểm định chéo

Overfitting (quá khớp) là khi mô hình học thuộc lòng dữ liệu huấn luyện, kể cả nhiễu: điểm huấn luyện rất cao nhưng tụt mạnh trên dữ liệu mới. Underfitting (chưa khớp) là khi mô hình quá đơn giản, sai nhiều trên cả hai tập.

Khoảng cách lớn giữa điểm huấn luyện và điểm kiểm định là dấu hiệu overfitting. Cách xử lý gồm thêm dữ liệu, bỏ đặc trưng nhiễu, điều chuẩn (regularization), giới hạn độ sâu cây, dừng sớm (early stopping). Kiểm định chéo k lần (k-fold cross-validation) lần lượt lấy mỗi phần dữ liệu làm tập kiểm định, cho ước lượng ổn định hơn khi dữ liệu ít.

Vì sao gán nhãn dữ liệu quyết định chất lượng học có giám sát?

Thuật toán chỉ học được những gì nhãn dạy nó. Nhãn sai, thiếu nhất quán hoặc lệch về một nhóm sẽ thành giới hạn trên của mô hình.

Ngay cả bộ dữ liệu nổi tiếng cũng không hoàn hảo. Nghiên cứu của Curtis Northcutt, Anish Athalye và Jonas Mueller (công bố năm 2021, trình bày tại NeurIPS 2021) ước tính trung bình ít nhất 3,3% nhãn trong tập kiểm tra của 10 bộ dữ liệu phổ biến bị sai; riêng tập kiểm định ImageNet có ít nhất 6%. Khi đánh giá trên nhãn đã sửa, mô hình nhỏ ResNet-18 có thể vượt ResNet-50 nếu tỷ lệ mẫu bị gán sai ban đầu tăng thêm chỉ 6%. Nhãn sai có thể khiến bạn chọn nhầm mô hình.

Ba việc giúp nhãn tốt hơn: viết hướng dẫn gán nhãn có ví dụ đúng, sai và trường hợp khó; đo độ đồng thuận giữa nhiều người gán nhãn trên cùng mẫu; rà lại các mẫu mà mô hình tự tin cao nhưng mâu thuẫn với nhãn. Quy trình, công cụ và nghề gán nhãn được trình bày trong bài data annotation và gán nhãn dữ liệu; nguyên tắc “rác vào, rác ra” trong chất lượng dữ liệu cũng đáng đọc thêm.

Học có giám sát và không giám sát khác nhau thế nào?

Khác biệt cốt lõi là có nhãn hay không. Học có giám sát trả lời câu hỏi đã biết trước dạng đáp án. Học không giám sát (unsupervised learning) tự tìm cấu trúc trong dữ liệu không nhãn, ví dụ chia khách hàng thành nhóm có hành vi giống nhau, hoặc tìm mặt hàng hay được mua cùng nhau. Các kỹ thuật phân cụm, luật kết hợp này được bàn kỹ trong bài khai phá dữ liệu (data mining).

Tiêu chíCó giám sátKhông giám sátBán giám sátTự giám sátHọc tăng cường
Dữ liệuCó nhãn đầy đủKhông nhãnÍt nhãn, nhiều dữ liệu không nhãnNhãn tự sinh từ chính dữ liệuPhần thưởng từ môi trường
Mục tiêuDự đoán nhãn, con sốTìm nhóm, mẫu, bất thườngDự đoán với ít nhãnHọc biểu diễn tổng quátHọc chuỗi hành động tối ưu
Ví dụChấm điểm tín dụngPhân khúc khách hàngPhân loại tài liệu khi chỉ gán nhãn một phần nhỏLLM đoán từ tiếp theoRobot, chơi game, điều phối

Trong thực tế, các cách học thường kết hợp: dùng phân cụm để khám phá dữ liệu, gán nhãn một phần nhỏ, rồi huấn luyện mô hình có giám sát. Mô hình ngôn ngữ lớn được tiền huấn luyện tự giám sát, rồi tinh chỉnh có giám sát và học tăng cường như ví dụ InstructGPT ở trên.

Ưu và nhược điểm của học có giám sát

Ưu điểmNhược điểm
Mục tiêu rõ, đo được bằng chỉ số cụ thểCần nhiều dữ liệu có nhãn, gán nhãn tốn thời gian và chi phí
Thường cho độ chính xác cao nhất khi nhãn tốtChỉ dự đoán được những gì có trong nhãn, không phát hiện loại mới
Thuật toán, thư viện, công cụ trưởng thànhKế thừa thiên lệch trong nhãn và dữ liệu lịch sử
Dễ kiểm tra, dễ giải thích với ban lãnh đạoGiảm chất lượng khi hành vi, thị trường thay đổi (drift)

Doanh nghiệp nên bắt đầu học có giám sát từ đâu?

Trả lời 4 câu trước khi đầu tư:

  1. Có quyết định nào lặp lại hằng ngày hoặc hằng tuần không?
  2. Kết quả thật của quyết định đó có được ghi lại làm nhãn không? Nếu chưa, hãy sửa quy trình ghi nhận trước.
  3. Mỗi loại sai tốn bao nhiêu? Câu trả lời quyết định ưu tiên precision hay recall.
  4. Kết quả được dùng ở đâu? Mô hình không gắn vào CRM, ERP hay quy trình làm việc thì không tạo giá trị.

Lộ trình gọn nhất: chọn một bài toán nhỏ, làm mô hình mốc, chạy thử song song với cách làm hiện tại vài tuần, so kết quả rồi mới mở rộng.

Huấn luyện mô hình trên dữ liệu cá nhân cần lưu ý pháp lý gì?

Nhiều bài toán học có giám sát dùng dữ liệu khách hàng, nhân sự, bệnh nhân. Tại Việt Nam, hai văn bản cần nắm:

  • Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15, thông qua ngày 26/06/2025, hiệu lực từ 01/01/2026. Điều 30 yêu cầu dữ liệu cá nhân dùng trong trí tuệ nhân tạo được xử lý đúng mục đích, giới hạn trong phạm vi cần thiết, có biện pháp bảo mật, xác thực, phân quyền; việc xử lý bằng trí tuệ nhân tạo phải phân loại theo mức độ rủi ro.
  • Luật Trí tuệ nhân tạo số 134/2025/QH15, thông qua ngày 10/12/2025, hiệu lực từ 01/03/2026. Khoản 3 Điều 7 cấm thu thập, xử lý, sử dụng dữ liệu để phát triển, huấn luyện, vận hành AI trái pháp luật về dữ liệu, bảo vệ dữ liệu cá nhân, sở hữu trí tuệ, an ninh mạng. Với hệ thống rủi ro cao, điểm b khoản 1 Điều 14 yêu cầu nhà cung cấp quản trị dữ liệu huấn luyện, kiểm thử và vận hành để bảo đảm chất lượng.

Trong thực tế, hãy khử nhận dạng dữ liệu trước khi gửi đi gán nhãn, chỉ giữ các cột thật sự cần, ký thoả thuận xử lý dữ liệu với bên gán nhãn thuê ngoài và lưu hồ sơ nguồn gốc tập huấn luyện. Nghĩa vụ theo từng mức rủi ro được phân tích trong bài Luật Trí tuệ nhân tạo 2025.

Câu hỏi thường gặp

Supervised learning tiếng Việt là gì?

Supervised learning thường được dịch là học có giám sát hoặc học máy có giám sát: huấn luyện mô hình bằng dữ liệu đã có đáp án đúng (nhãn) để dự đoán cho dữ liệu mới.

Ví dụ học có giám sát đơn giản nhất là gì?

Bộ lọc thư rác. Bạn cung cấp hàng nghìn email đã đánh dấu “spam” hoặc “không spam”. Mô hình học dấu hiệu phân biệt rồi tự phân loại email mới đến.

Phân loại và hồi quy khác nhau ở điểm nào?

Phân loại dự đoán một nhóm rời rạc, ví dụ có gian lận hay không. Hồi quy dự đoán một con số liên tục, ví dụ doanh số tuần tới.

Cần bao nhiêu dữ liệu có nhãn để huấn luyện?

Không có con số cố định. Bài toán ảnh, văn bản thường cần nhiều hơn dữ liệu dạng bảng, nhưng có thể giảm đáng kể nhờ tinh chỉnh mô hình đã huấn luyện sẵn.

Học có giám sát và học không giám sát, cái nào tốt hơn?

Không có cái nào tốt hơn tuyệt đối. Có nhãn và mục tiêu rõ thì học có giám sát cho kết quả đo được. Chưa có nhãn, cần khám phá dữ liệu thì học không giám sát phù hợp hơn. Nhiều dự án dùng cả hai.

“Giám sát” có nghĩa là có người theo dõi mô hình không?

Không. “Giám sát” chỉ việc dữ liệu huấn luyện có đáp án. Việc con người kiểm soát mô hình khi vận hành là yêu cầu quản trị, áp dụng cho mọi loại mô hình.