Trả lời nhanh: Machine learning (học máy) là nhánh của trí tuệ nhân tạo, trong đó máy tính tự rút ra quy luật từ dữ liệu thay vì được lập trình từng quy tắc. Ví dụ: bộ lọc thư rác học từ hàng nghìn email đã gắn nhãn “rác” hoặc “không rác”, rồi tự nhận diện thư rác mới.
Điểm chính
- Học máy thay “viết luật bằng tay” bằng “học luật từ ví dụ”. Chất lượng dữ liệu quyết định phần lớn chất lượng mô hình.
- Có 4 nhóm chính: học có giám sát, không giám sát, bán giám sát và học tăng cường. Mỗi nhóm hợp với một dạng dữ liệu và bài toán.
- Một dự án học máy là vòng lặp 6 bước: bài toán, dữ liệu, đặc trưng, huấn luyện, đánh giá, triển khai và giám sát.
- Độ chính xác (accuracy) cao chưa chắc là mô hình tốt. Với dữ liệu lệch như gian lận, cần xem thêm precision và recall.
- Tại Việt Nam, học máy đã chạy thật trong chấm điểm tín dụng, chống gian lận giao dịch và hỗ trợ chẩn đoán hình ảnh y tế.
Mục lục
- Machine learning là gì?
- Machine learning ra đời từ khi nào?
- Machine learning và AI khác nhau thế nào?
- Machine learning hoạt động như thế nào?
- Các loại machine learning gồm những gì?
- Thuật toán machine learning phổ biến hoạt động ra sao?
- Làm sao biết mô hình machine learning tốt hay dở?
- Ứng dụng machine learning trong doanh nghiệp là gì?
- Công cụ machine learning phổ biến là gì?
- Nên bắt đầu học và ứng dụng machine learning từ đâu?
- Những hiểu lầm phổ biến về machine learning
- Câu hỏi thường gặp
Machine learning là gì?
Machine learning (ML), tiếng Việt gọi là học máy, là cách để máy tính tự học quy luật từ dữ liệu, rồi dùng quy luật đó để dự đoán hoặc ra quyết định với dữ liệu mới.
Nói gọn, học máy là gì? Là dạy máy bằng ví dụ thay vì bằng sổ tay quy định. Muốn dự đoán giá căn hộ, bạn không tự đặt công thức mà đưa vào vài nghìn căn đã bán kèm diện tích, vị trí, số phòng và giá thật. Thuật toán tự tìm mức ảnh hưởng của từng yếu tố.
Định nghĩa học thuật hay được dẫn là của Tom Mitchell trong sách “Machine Learning” (McGraw Hill, 1997): một chương trình được coi là học từ kinh nghiệm E đối với nhóm nhiệm vụ T và thước đo P, nếu hiệu quả của nó ở T, đo bằng P, tăng lên nhờ E. Áp vào bộ lọc thư rác: T là phân loại email, E là kho email đã gắn nhãn, P là tỷ lệ phân loại đúng.
| Tiêu chí | Lập trình truyền thống | Học máy |
|---|---|---|
| Đầu vào | Dữ liệu + quy tắc do người viết | Dữ liệu + kết quả mong muốn (ví dụ mẫu) |
| Đầu ra | Kết quả | Mô hình (bộ quy tắc học được) |
| Khi điều kiện thay đổi | Phải sửa code bằng tay | Huấn luyện lại bằng dữ liệu mới |
| Phù hợp khi | Luật rõ ràng, ít ngoại lệ (tính thuế, tính lương) | Luật quá phức tạp để viết tay (nhận diện ảnh, đoán khách rời bỏ) |
| Giải thích kết quả | Dễ, vì luật do người viết | Tuỳ mô hình, có loại rất khó giải thích |
Machine learning ra đời từ khi nào?
Các mốc chính đã được kiểm chứng:
- Tháng 7/1959: Arthur L. Samuel, nhà nghiên cứu của IBM, công bố bài “Some Studies in Machine Learning Using the Game of Checkers” trên IBM Journal (tập 3, số 3). Ông cho thấy máy tính có thể được lập trình để học chơi cờ đam giỏi hơn chính người viết chương trình, chỉ sau khoảng 8 đến 10 giờ máy tự chơi. Cụm từ “machine learning” xuất hiện ngay trong tiêu đề bài báo.
- Năm 1995: Corinna Cortes và Vladimir Vapnik công bố “Support-vector networks” trên tạp chí Machine Learning, đặt nền cho thuật toán SVM.
- Tháng 10/2001: Leo Breiman công bố “Random Forests” trên tạp chí Machine Learning (tập 45).
- Tháng 3/2016: AlphaGo của DeepMind thắng kỳ thủ Lee Sedol 4–1 tại Seoul. Hệ thống học từ ván cờ của người rồi tự chơi với chính nó, một dạng học tăng cường.
Câu “học máy là lĩnh vực giúp máy tính có khả năng học mà không cần được lập trình tường minh” thường được trích như lời Samuel năm 1959. Tuy vậy, ý gần nhất trong bài báo gốc là: lập trình cho máy tính học từ kinh nghiệm sẽ dần loại bỏ nhu cầu lập trình chi tiết.
Machine learning và AI khác nhau thế nào?
Hiểu ngắn gọn: AI là mục tiêu lớn, học máy là một cách để đạt mục tiêu đó. AI gồm mọi kỹ thuật giúp máy làm việc cần trí thông minh, kể cả hệ chuyên gia viết luật bằng tay; học máy là nhánh nơi máy học từ dữ liệu. Bức tranh tổng thể có trong bài trí tuệ nhân tạo là gì.
Đi sâu hơn một tầng là học sâu (deep learning): học máy dùng mạng nơ-ron nhiều lớp, mạnh với ảnh, âm thanh và văn bản. Chi tiết có trong bài deep learning là gì. Các mô hình như AI tạo sinh hay mô hình ngôn ngữ lớn đều là sản phẩm của học sâu, tức vẫn nằm trong học máy.
Tóm lại, machine learning và AI khác nhau ở phạm vi: mọi hệ thống học máy đều là AI, nhưng không phải AI nào cũng dùng học máy.
Machine learning hoạt động như thế nào?
Bên dưới mọi mô hình học máy là cùng một ý tưởng: có một hàm số với nhiều tham số chưa biết. Thuật toán đưa dữ liệu vào, so sánh kết quả dự đoán với đáp án thật, đo độ sai bằng một hàm mất mát (loss function), rồi chỉnh tham số để sai ít đi. Lặp lại rất nhiều lần, mô hình dần “học” được quy luật.
Để hiểu machine learning là gì trong thực tế, hãy nhìn cả quy trình: thuật toán chỉ là một khâu của vòng lặp 6 bước.
- Bài toán: xác định cần dự đoán gì và đo thành công bằng chỉ số nào. “Dùng AI để tăng doanh số” chưa phải bài toán; “dự đoán khách nào sắp ngừng mua trong 60 ngày tới để gửi ưu đãi” mới là bài toán học máy.
- Dữ liệu: bước tốn công nhất. Dữ liệu được gom từ CRM, ERP, website rồi làm sạch. Với học có giám sát, mỗi mẫu cần nhãn đúng, nên khâu gán nhãn dữ liệu là nền móng. Nhãn sai thì mô hình học sai, đúng nguyên tắc rác vào, rác ra.
- Đặc trưng (feature): các biến đầu vào mô hình nhìn thấy. Từ ngày mua thô, bạn tạo ra “số ngày kể từ lần mua cuối” hay “số đơn trong 90 ngày”. Đặc trưng tốt thường giúp mô hình đơn giản thắng mô hình phức tạp.
- Huấn luyện (training): chạy thuật toán trên tập huấn luyện để tìm tham số. Kết quả là một mô hình (model) sẵn sàng dự đoán.
- Đánh giá: đo trên dữ liệu mô hình chưa từng thấy và so với mô hình cơ sở (baseline), ví dụ luật đơn giản đang dùng. Không vượt được baseline thì chưa nên triển khai.
- Triển khai và giám sát: đưa mô hình vào phần mềm thật, rồi theo dõi liên tục. Hành vi khách, giá cả, mùa vụ thay đổi làm dữ liệu “trôi” (data drift) và độ chính xác giảm dần. Khi đó cần huấn luyện lại.
Các loại machine learning gồm những gì?
Các loại machine learning được chia theo cách dữ liệu được cung cấp và cách mô hình nhận phản hồi.
| Loại | Dữ liệu | Mục tiêu | Ví dụ doanh nghiệp | Thuật toán tiêu biểu |
|---|---|---|---|---|
| Học có giám sát (supervised) | Có nhãn (đáp án) | Dự đoán nhãn hoặc con số | Phân loại email rác, dự báo doanh thu, chấm điểm tín dụng | Hồi quy, cây quyết định, random forest, SVM |
| Học không giám sát (unsupervised) | Không nhãn | Tìm cấu trúc, nhóm, điểm bất thường | Phân khúc khách hàng, phát hiện giao dịch lạ | K-means, phân cụm phân cấp, PCA |
| Học bán giám sát (semi-supervised) | Ít có nhãn, nhiều không nhãn | Tận dụng dữ liệu chưa gán nhãn | Phân loại tài liệu khi chỉ gán nhãn được một phần nhỏ | Tự huấn luyện (self-training), lan truyền nhãn |
| Học tăng cường (reinforcement) | Phần thưởng/phạt từ môi trường | Học chuỗi hành động tối ưu | Điều khiển robot, tối ưu giá động, chơi game | Q-learning, policy gradient |
Học có giám sát
Nhóm phổ biến nhất trong doanh nghiệp, học từ các cặp “đầu vào – đáp án”. Có hai dạng: phân loại (classification) khi đáp án là một nhóm, ví dụ “gian lận / không gian lận”; và hồi quy (regression) khi đáp án là con số, ví dụ doanh số tuần sau. Điểm yếu là cần nhiều dữ liệu có nhãn.
Học không giám sát
Dữ liệu không có đáp án. Mô hình tự tìm các nhóm giống nhau hoặc điểm khác thường. Ví dụ minh hoạ: chuỗi bán lẻ phân cụm lịch sử mua và nhận về các nhóm như “chỉ mua khi khuyến mãi”. Con người vẫn phải diễn giải các nhóm này.
Học bán giám sát
Có ít dữ liệu đã gán nhãn và nhiều dữ liệu chưa gán. Mô hình học từ phần có nhãn, tự gán nhãn tạm cho phần còn lại rồi học tiếp. Hữu ích khi gán nhãn đắt, như ảnh y tế cần bác sĩ đọc.
Học tăng cường
Mô hình (gọi là tác tử, agent) hành động trong một môi trường, nhận điểm thưởng hoặc bị trừ điểm, và học cách tối đa hoá tổng điểm về lâu dài. AlphaGo là ví dụ nổi tiếng. Nhóm này khó áp dụng trong doanh nghiệp hơn vì cần môi trường an toàn để thử sai.
Ngoài ra còn có học tự giám sát (self-supervised): mô hình tự tạo nhãn từ chính dữ liệu, ví dụ che một từ rồi đoán từ đó. Đây là cách các mô hình ngôn ngữ lớn được tiền huấn luyện trên lượng văn bản khổng lồ.
Thuật toán machine learning phổ biến hoạt động ra sao?
Dưới đây là ý tưởng của các thuật toán machine learning hay gặp nhất, không cần công thức.
Hồi quy tuyến tính (linear regression)
Tìm đường thẳng (hoặc mặt phẳng) khớp nhất với dữ liệu. Ví dụ: giá nhà bằng hệ số nhân diện tích cộng hệ số nhân số phòng. Đơn giản, dễ giải thích, thường là mô hình cơ sở đầu tiên.
Hồi quy logistic (logistic regression)
Dù tên là “hồi quy”, đây là thuật toán phân loại. Nó trả về xác suất từ 0 đến 1, ví dụ xác suất khách rời bỏ là 0,72. Dễ giải thích từng yếu tố nên hợp với tài chính, bảo hiểm.
Cây quyết định (decision tree)
Một chuỗi câu hỏi có/không như sơ đồ: “Thu nhập trên 15 triệu? Có nợ quá hạn? Thời gian làm việc trên 2 năm?”. Rất dễ đọc nhưng dễ “học thuộc” dữ liệu huấn luyện nếu cây quá sâu.
Rừng ngẫu nhiên (random forest)
Theo Leo Breiman, rừng ngẫu nhiên là tổ hợp nhiều cây quyết định, mỗi cây được xây trên một phần dữ liệu và đặc trưng chọn ngẫu nhiên. Kết quả cuối là “bỏ phiếu” của cả rừng. Cách này giảm lỗi học thuộc của từng cây đơn lẻ.
Gradient boosting
Cũng ghép nhiều cây, nhưng theo kiểu nối tiếp: cây sau tập trung sửa lỗi của các cây trước. Các thư viện như XGBoost, LightGBM thường cho kết quả mạnh với dữ liệu dạng bảng.
Máy vector hỗ trợ (SVM)
Tìm “đường ranh giới” tách hai nhóm dữ liệu sao cho khoảng cách tới các điểm gần nhất là lớn nhất. Khi không tách được bằng đường thẳng, SVM ánh xạ dữ liệu lên không gian nhiều chiều hơn để tách.
K láng giềng gần nhất (k-NN)
Muốn dự đoán một điểm mới, thuật toán nhìn k điểm giống nó nhất trong dữ liệu cũ và lấy kết quả số đông.
K-means
Thuật toán phân cụm không giám sát. Bạn chọn số nhóm k, thuật toán đặt k tâm, gán mỗi điểm vào tâm gần nhất, dời tâm về giữa nhóm, rồi lặp lại tới khi ổn định. Dùng nhiều để phân khúc khách hàng.
Mạng nơ-ron (neural network)
Gồm nhiều lớp “nơ-ron” nối với nhau, mỗi kết nối có một trọng số được học. Mạng nhiều lớp chính là học sâu, mạnh nhất với ảnh, giọng nói và ngôn ngữ, nhưng cần nhiều dữ liệu và sức tính toán.
Quy tắc chọn nhanh: dữ liệu bảng thì thử hồi quy hoặc cây trước, rồi tới random forest, gradient boosting; cần giải thích cho kiểm toán thì ưu tiên hồi quy logistic, cây quyết định; ảnh, âm thanh, văn bản thì dùng học sâu.
Làm sao biết mô hình machine learning tốt hay dở?
Đánh giá là bước dễ làm sai. Bạn cần nắm 3 khái niệm sau.
Chia tập huấn luyện, kiểm định và kiểm tra
Không đánh giá mô hình trên chính dữ liệu đã huấn luyện, vì giống cho học sinh làm lại đề đã có đáp án. Khoá học Machine Learning Crash Course của Google minh hoạ một cách chia phổ biến: 70% huấn luyện (training set), 15% kiểm định (validation set) để chọn mô hình và tinh chỉnh, 15% kiểm tra (test set) để chấm điểm cuối cùng. Với dữ liệu ít, người ta dùng kiểm định chéo (cross-validation): chia thành nhiều phần và luân phiên dùng từng phần để kiểm tra.
Overfitting và underfitting
Quá khớp (overfitting) là khi mô hình “học thuộc” tập huấn luyện đến mức dự đoán sai trên dữ liệu mới. Dấu hiệu: điểm trên tập huấn luyện rất cao, trên tập kiểm tra thấp hẳn. Chưa khớp (underfitting) là khi mô hình dự đoán kém ngay cả trên dữ liệu huấn luyện, thường do mô hình quá đơn giản hoặc thiếu đặc trưng tốt. Mục tiêu là khả năng tổng quát hoá (generalization): dự đoán tốt trên dữ liệu chưa từng thấy.
Accuracy, precision, recall
Với bài toán phân loại, mọi chỉ số đều dựa trên ma trận nhầm lẫn (confusion matrix) gồm 4 ô.
- Accuracy (độ chính xác tổng thể): tỷ lệ dự đoán đúng trên tất cả trường hợp.
- Precision (độ chuẩn xác): trong các trường hợp mô hình báo “gian lận”, bao nhiêu là gian lận thật.
- Recall (độ nhạy, độ phủ): trong các vụ gian lận thật, mô hình bắt được bao nhiêu.
- F1: trung bình điều hoà của precision và recall, dùng khi cần cân bằng cả hai.
Vì sao accuracy dễ đánh lừa? Ví dụ minh hoạ: nếu chỉ 1% giao dịch là gian lận, một mô hình “lười” đoán mọi giao dịch đều bình thường vẫn đạt accuracy 99% nhưng recall bằng 0. Tài liệu của Google khuyến nghị không dùng riêng accuracy với dữ liệu mất cân bằng. Bỏ sót tốn kém (như sàng lọc bệnh) thì ưu tiên recall. Báo động nhầm tốn kém thì ưu tiên precision.
Trong y tế, recall thường được gọi là độ nhạy. Theo sách trắng VinBrain công bố ngày 04/06/2021 cùng tổ chức FIT, mô hình hỗ trợ sàng lọc lao qua ảnh X-quang đạt độ nhạy 86% và độ đặc hiệu 96,1%.
Ứng dụng machine learning trong doanh nghiệp là gì?
Ứng dụng machine learning trải khắp các phòng ban. Bảng dưới là các bài toán điển hình (ví dụ minh hoạ, không gắn với doanh nghiệp cụ thể).
| Bộ phận | Bài toán học máy | Loại học |
|---|---|---|
| Bán hàng, marketing | Dự đoán khách rời bỏ, chấm điểm khách tiềm năng, gợi ý sản phẩm | Có giám sát |
| Chăm sóc khách hàng | Phân loại yêu cầu tự động, phân tích cảm xúc phản hồi | Có giám sát |
| Tài chính, rủi ro | Chấm điểm tín dụng, phát hiện giao dịch bất thường | Có giám sát, không giám sát |
| Chuỗi cung ứng | Dự báo nhu cầu, tối ưu tồn kho | Có giám sát (chuỗi thời gian) |
| Sản xuất | Bảo trì dự đoán, kiểm tra lỗi sản phẩm bằng ảnh | Có giám sát, học sâu |
| Nhân sự | Phân loại hồ sơ, dự báo nghỉ việc | Có giám sát (cần kiểm soát thiên lệch) |
Ví dụ thực tế tại Việt Nam
- Ví điện tử MoMo: theo báo Đại biểu Nhân dân ngày 30/09/2025, MoMo ứng dụng các thuật toán machine learning kết hợp phân tích big data để chấm điểm tín dụng, dùng dữ liệu thay thế như lịch sử thanh toán hoá đơn, hành vi tiêu dùng, thông tin xác thực thay vì chỉ dựa vào tài sản thế chấp hay giấy tờ chứng minh thu nhập. Trung bình mỗi giao dịch có 6–7 mô hình AI tham gia, trong đó có mô hình chống gian lận.
- Ngân hàng: theo Tạp chí Thị trường Tài chính Tiền tệ ngày 13/09/2025, VPBank cho phép xét duyệt khoản vay online trong vòng 5 phút nhờ hệ thống AI; Vietcombank ứng dụng AI phân tích rủi ro tín dụng, phát hiện giao dịch bất thường; VietinBank ứng dụng học sâu để nhận diện và ngăn chặn gian lận thẻ. Xem thêm bức tranh số hoá ngành ngân hàng.
- Y tế: để làm mô hình sàng lọc lao nêu ở trên, VinBrain thu thập hơn 500.000 ảnh X-quang, trong đó 185.486 ảnh đã làm sạch được dùng để huấn luyện, đánh giá và kiểm thử. Đây là học có giám sát trên dữ liệu ảnh.
Điểm chung: dữ liệu lịch sử lớn, mục tiêu đo được, quyết định lặp lại hàng triệu lần. Đó là dấu hiệu một bài toán đáng làm bằng học máy.
Công cụ machine learning phổ biến là gì?
Ba thư viện mã nguồn mở dưới đây được dùng rộng rãi. Mô tả dựa theo trang chính thức của từng dự án.
| Công cụ | Mô tả chính thức | Mạnh nhất cho |
|---|---|---|
| scikit-learn | Thư viện Python, “công cụ đơn giản và hiệu quả cho phân tích dữ liệu dự đoán”, xây trên NumPy, SciPy, matplotlib, giấy phép BSD | Học máy cổ điển: phân loại, hồi quy, phân cụm, tiền xử lý |
| TensorFlow | “Nền tảng học máy mã nguồn mở đầu cuối” do Google phát triển; có Keras, LiteRT cho thiết bị di động, TensorFlow.js cho trình duyệt | Học sâu, triển khai trên nhiều nền tảng |
| PyTorch | Framework học sâu mã nguồn mở, do PyTorch Foundation thuộc Linux Foundation quản lý | Nghiên cứu và sản phẩm học sâu |
Đi kèm thường có pandas để xử lý bảng và Jupyter Notebook để thử nghiệm. Người mới nên bắt đầu với scikit-learn, chỉ chuyển sang TensorFlow hoặc PyTorch khi bài toán thật sự cần học sâu.
Nên bắt đầu học và ứng dụng machine learning từ đâu?
Với cá nhân muốn học
- Nền tảng toán vừa đủ: đại số tuyến tính (vector, ma trận), xác suất thống kê cơ bản, khái niệm đạo hàm. Có thể học song song.
- Python và xử lý dữ liệu: làm quen pandas, vẽ biểu đồ, làm sạch dữ liệu.
- Học máy cổ điển với scikit-learn: tự làm các bài hồi quy, phân loại, phân cụm trên bộ dữ liệu công khai.
- Dự án thật nhỏ: chọn một bài toán ở nơi làm việc, như dự đoán đơn hàng huỷ, và làm trọn vòng đời.
- Sau đó mới tới học sâu: mạng nơ-ron, xử lý ảnh, xử lý ngôn ngữ, rồi tới mô hình ngôn ngữ lớn.
Với doanh nghiệp muốn ứng dụng
Hướng dẫn “Rules of Machine Learning” của Martin Zinkevich trên trang Google for Developers đưa ra ba quy tắc đầu tiên rất thực tế: đừng ngại ra mắt sản phẩm khi chưa có học máy; trước hết hãy thiết kế và đo lường chỉ số; chọn học máy thay cho một bộ luật thủ công đã trở nên quá phức tạp. Checklist gợi ý:
- Chọn một bài toán có chỉ số kinh doanh rõ, lặp lại thường xuyên, đang được xử lý bằng luật thủ công hoặc cảm tính.
- Kiểm kê dữ liệu: đủ lịch sử chưa, có nhãn chưa, nằm ở hệ thống nào. Dữ liệu còn trên giấy thì phải số hoá trước.
- Dựng mô hình cơ sở đơn giản, so với cách đang làm.
- Thử trên nhóm nhỏ, lên kế hoạch giám sát và huấn luyện lại ngay từ đầu.
- Rà soát pháp lý: dữ liệu khách hàng thuộc phạm vi Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 (hiệu lực từ 01/01/2026); hệ thống AI chịu điều chỉnh của Luật Trí tuệ nhân tạo số 134/2025/QH15 (hiệu lực từ 01/03/2026).
Những hiểu lầm phổ biến về machine learning
“Càng nhiều dữ liệu càng tốt”
Dữ liệu nhiều mà sai nhãn, lệch hoặc không liên quan bài toán thì mô hình chỉ học sai nhanh hơn. Một tập nhỏ sạch, đúng nhãn thường tốt hơn tập lớn bẩn.
“Accuracy 99% là mô hình rất tốt”
Như ví dụ gian lận ở trên, accuracy cao có thể đi cùng việc bỏ sót toàn bộ trường hợp quan trọng. Luôn hỏi: precision và recall là bao nhiêu, so với baseline thế nào.
“Máy học khách quan, không thiên vị”
Mô hình học cả định kiến có sẵn trong dữ liệu. Theo Reuters (tháng 10/2018), Amazon từng phải dừng một công cụ chấm điểm hồ sơ ứng viên. Công cụ học từ hồ sơ nộp trong khoảng 10 năm, chủ yếu của nam giới, nên hạ điểm các hồ sơ có từ “women’s”.
“Triển khai xong là xong”
Thị trường thay đổi, dữ liệu trôi, mô hình xuống cấp âm thầm. Cần đặt cảnh báo khi chỉ số giảm.
“Bài toán nào cũng cần học sâu”
Với dữ liệu dạng bảng như giao dịch hay khách hàng, mô hình cây như random forest hay gradient boosting thường đủ mạnh, rẻ và dễ giải thích hơn. Học sâu toả sáng ở ảnh, âm thanh và văn bản.
Câu hỏi thường gặp
Machine learning và học máy có khác nhau không?
Không. “Học máy” là tên tiếng Việt của machine learning. Một số tài liệu dịch là “máy học”, cùng một nghĩa.
Muốn học machine learning có cần giỏi toán không?
Để dùng thư viện và làm dự án cơ bản, bạn cần toán ở mức đại số tuyến tính, xác suất thống kê và đạo hàm cơ bản. Nghiên cứu thuật toán mới thì cần sâu hơn nhiều.
Machine learning khác data science thế nào?
Khoa học dữ liệu (data science) rộng hơn: gồm thu thập, phân tích, trực quan hoá và kể chuyện bằng dữ liệu. Học máy là một bộ công cụ trong đó, chuyên về xây mô hình dự đoán.
Cần bao nhiêu dữ liệu để làm machine learning?
Không có con số chung. Nó phụ thuộc độ khó bài toán, số đặc trưng và loại mô hình. Học sâu cho ảnh thường cần nhiều dữ liệu hơn hẳn mô hình cổ điển, trừ khi tận dụng mô hình đã huấn luyện sẵn.
ChatGPT có phải là machine learning không?
Có. ChatGPT dựa trên mô hình ngôn ngữ lớn, được huấn luyện bằng học sâu, một nhánh của học máy. Theo OpenAI, ChatGPT ra mắt ngày 30/11/2022, được tinh chỉnh bằng học có giám sát và học tăng cường từ phản hồi của con người (RLHF).
Doanh nghiệp nhỏ có ứng dụng machine learning được không?
Có. Hãy bắt đầu với tính năng dự báo, gợi ý, phân loại có sẵn trong phần mềm bán hàng, CRM hoặc dịch vụ đám mây trước khi tự xây mô hình.
Python có bắt buộc khi học machine learning không?
Không bắt buộc, nhưng Python là lựa chọn phổ biến nhất vì scikit-learn, TensorFlow và PyTorch đều hỗ trợ Python tốt. Ngoài ra vẫn có R, JavaScript (TensorFlow.js) và công cụ kéo thả.