Trả lời nhanh: Neural network (mạng nơ-ron nhân tạo, viết tắt ANN) là mô hình tính toán gồm nhiều “nơ-ron” đơn giản nối với nhau theo lớp. Mỗi kết nối có một trọng số. Mạng tự điều chỉnh các trọng số từ dữ liệu mẫu để học cách nhận ra quy luật, ví dụ phân biệt thư rác với thư thường.
Điểm chính
- Mỗi nơ-ron nhân tạo chỉ làm ba việc: nhân đầu vào với trọng số, cộng thêm bias, rồi đưa qua hàm kích hoạt.
- Mạng học qua vòng lặp: lan truyền thuận, tính loss, lan truyền ngược, cập nhật trọng số bằng gradient descent.
- Ý tưởng có từ năm 1943, qua perceptron 1958, “mùa đông” sau 1969 và hồi sinh nhờ lan truyền ngược năm 1986.
- Các họ mạng chính: MLP, CNN, RNN/LSTM, Transformer, GAN, GNN, mỗi loại hợp một kiểu dữ liệu.
- Hạn chế lớn: hộp đen khó giải thích, cần nhiều dữ liệu có nhãn, tốn điện năng.
Mục lục
- Neural network là gì?
- Mạng nơ-ron nhân tạo lấy cảm hứng từ não người như thế nào?
- Cấu tạo của một mạng nơ-ron gồm những gì?
- Mạng nơ-ron học như thế nào?
- Perceptron là gì và vì sao bài toán XOR quan trọng?
- Lịch sử neural network: từ năm 1943 đến nay
- Các loại mạng nơ-ron phổ biến hiện nay
- Neural network và deep learning có quan hệ gì?
- Ứng dụng neural network trong thực tế
- Hạn chế của mạng nơ-ron là gì?
- Khi nào nên và không nên dùng neural network?
- Câu hỏi thường gặp
Neural network là gì?
Neural network là gì? Đó là một chương trình máy tính gồm nhiều đơn vị tính toán nhỏ gọi là nơ-ron (neuron), xếp thành lớp và nối với nhau. Mỗi đường nối mang một con số gọi là trọng số (weight). Dữ liệu đi qua mạng, được nhân, cộng, biến đổi, rồi cho ra kết quả ở lớp cuối.
Khác với phần mềm truyền thống, không ai viết sẵn luật “nếu A thì B”. Bạn đưa cho mạng hàng nghìn ví dụ có đáp án, mạng tự chỉnh trọng số cho tới khi trả lời gần đúng. Bộ trọng số sau huấn luyện chính là “kiến thức” mạng đã học.
Mạng neural, mạng nơ-ron, mạng thần kinh nhân tạo hay ANN (Artificial Neural Network) đều chỉ cùng một khái niệm. Chữ “nhân tạo” để phân biệt với mạng nơ-ron sinh học trong não.
Ví dụ đời thường (ví dụ minh hoạ): hộp thư tự chuyển thư quảng cáo vào mục spam. Bộ lọc không có danh sách cứng mọi câu chào mời. Nó đã “xem” rất nhiều thư được đánh dấu spam hoặc không, học ra dấu hiệu chung, rồi chấm cho thư mới một điểm, chẳng hạn 0,93, tức khả năng cao là spam.
Mạng nơ-ron là một nhánh của học máy, vốn lại thuộc trí tuệ nhân tạo. Phần lớn hệ thống AI nổi bật hiện nay đều có mạng nơ-ron ở lõi.
Mạng nơ-ron nhân tạo lấy cảm hứng từ não người như thế nào?
Não người là mạng lưới tế bào thần kinh khổng lồ. Theo nghiên cứu của Azevedo và cộng sự đăng trên Journal of Comparative Neurology năm 2009, não người trưởng thành có khoảng 86 tỷ nơ-ron. Mỗi nơ-ron nhận tín hiệu qua sợi nhánh (dendrite), tổng hợp ở thân tế bào, và nếu đủ mạnh thì phát tín hiệu qua sợi trục (axon) tới khớp thần kinh (synapse) của nơ-ron khác.
Năm 1949, Donald Hebb đưa ra giả thuyết trong cuốn The Organization of Behavior: khi tế bào A liên tục góp phần kích hoạt tế bào B, kết nối giữa chúng mạnh lên. Đây là gốc rễ của ý tưởng “học bằng cách thay đổi độ mạnh kết nối”, tức thay đổi trọng số.
| Nơ-ron sinh học | Nơ-ron nhân tạo |
|---|---|
| Sợi nhánh | Các đầu vào x1, x2, x3… |
| Độ mạnh khớp thần kinh | Trọng số w |
| Thân tế bào | Phép cộng có trọng số và bias |
| Ngưỡng phát xung | Hàm kích hoạt |
| Sợi trục | Đầu ra a |
Lưu ý: não chỉ là nguồn cảm hứng. Mạng nơ-ron nhân tạo là mô hình toán học đơn giản hoá rất nhiều, không có ý thức và không “suy nghĩ” như người.
Cấu tạo của một mạng nơ-ron gồm những gì?
Dù nhỏ hay lớn, mọi mạng nơ-ron đều ghép từ cùng vài “viên gạch”. Sơ đồ dưới cho thấy toàn mạng và bên trong một nơ-ron.
Nơ-ron nhân tạo: một phép tính nhỏ
Mỗi nơ-ron nhận vài con số đầu vào x1, x2, x3. Nó nhân từng số với trọng số tương ứng, cộng tất cả lại, cộng thêm bias b, được giá trị z. Sau đó z đi qua hàm kích hoạt f để thành đầu ra a. Toàn bộ chỉ có vậy: z = w1·x1 + w2·x2 + w3·x3 + b, rồi a = f(z).
Trọng số và bias khác nhau thế nào?
Trọng số cho biết đầu vào nào quan trọng: dương và lớn thì đẩy kết quả lên mạnh, âm thì kéo xuống, gần 0 thì gần như bị bỏ qua.
Bias (độ lệch) là con số cộng thêm, giống ngưỡng “dễ tính” hay “khó tính” của nơ-ron. Trọng số và bias gọi chung là tham số (parameter). Mô hình “7 tỷ tham số” nghĩa là có khoảng 7 tỷ con số như vậy cần học.
Hàm kích hoạt để làm gì?
Nếu chỉ có nhân và cộng, xếp bao nhiêu lớp thì cả mạng vẫn tương đương một phép biến đổi tuyến tính, chỉ vẽ được “đường thẳng” phân chia dữ liệu. Hàm kích hoạt (activation function) thêm tính phi tuyến để mạng học được ranh giới cong, phức tạp.
| Hàm kích hoạt | Cách hoạt động | Khoảng giá trị đầu ra | Thường dùng ở đâu |
|---|---|---|---|
| Bước nhảy (step) | z ≥ 0 thì ra 1, ngược lại ra 0 | 0 hoặc 1 | Perceptron cổ điển |
| Sigmoid | Nén mọi số về khoảng 0 đến 1 theo đường cong chữ S | (0; 1) | Lớp ra của bài toán có/không |
| Tanh | Giống sigmoid nhưng đối xứng quanh 0 | (−1; 1) | Một số mạng hồi quy |
| ReLU | Giữ nguyên nếu z dương, về 0 nếu z âm | [0; +∞) | Lớp ẩn của đa số mạng hiện đại |
| Softmax | Biến một dãy điểm số thành xác suất có tổng bằng 1 | (0; 1), tổng = 1 | Lớp ra khi phân loại nhiều nhóm |
Lớp vào, lớp ẩn và lớp ra
- Lớp vào (input layer): nhận dữ liệu đã số hoá. Ảnh 28×28 điểm ảnh cho 784 giá trị đầu vào.
- Lớp ẩn (hidden layer): nơi diễn ra phần lớn việc “học”. Lớp đầu bắt đặc trưng đơn giản, lớp sau ghép thành đặc trưng phức tạp hơn.
- Lớp ra (output layer): cho kết quả cuối. Một nơ-ron nếu cần một con số (giá nhà), nhiều nơ-ron nếu phân loại nhiều nhóm.
Mạng trong Hình 1 có 3×4 + 4×2 = 20 trọng số và 4 + 2 = 6 bias, tổng 26 tham số. Mỗi tham số là một con số phải lưu và tính, nên mô hình lớn cần nhiều bộ nhớ.
Ví dụ tính tay một nơ-ron
Ví dụ minh hoạ: một nơ-ron quyết định có nên mang ô khi ra ngoài. Hai đầu vào: x1 = 0,8 (khả năng mưa theo dự báo) và x2 = 0,5 (quãng đường đi bộ, đã quy về thang 0–1). Giả sử mạng đã học được w1 = 2,0, w2 = 1,0 và b = −1,5.
- Tổng có trọng số: z = 2,0 × 0,8 + 1,0 × 0,5 + (−1,5) = 1,6 + 0,5 − 1,5 = 0,6.
- Qua hàm sigmoid: a = 1 / (1 + e mũ −0,6) ≈ 0,65.
- Diễn giải: khoảng 65% “nên mang ô”. Nếu ngưỡng quyết định là 0,5 thì câu trả lời là có.
Nếu trời quang, x1 = 0,1, thì z = −0,8 và a ≈ 0,31: không cần mang ô. Trọng số w1 gấp đôi w2 cho thấy mạng coi khả năng mưa quan trọng hơn quãng đường.
Mạng nơ-ron học như thế nào?
Ví dụ trên giả định trọng số đã “đúng”. Thực tế, trọng số ban đầu là ngẫu nhiên và mạng gần như đoán mò. Huấn luyện (training) lặp một vòng bốn bước để sửa dần chúng.
Bước 1: Lan truyền thuận (forward propagation)
Dữ liệu đi một chiều từ lớp vào, qua các lớp ẩn, tới lớp ra. Mỗi nơ-ron làm phép tính nhỏ như trên. Kết quả ở lớp ra là dự đoán ŷ (đọc là “y mũ”).
Bước 2: Hàm mất mát (loss function)
Hàm mất mát đo khoảng cách giữa dự đoán ŷ và đáp án đúng y; càng lớn thì càng sai. Khi dự đoán một con số, người ta hay dùng sai số bình phương trung bình (MSE). Khi phân loại, cross-entropy phổ biến hơn vì nó phạt nặng trường hợp “tự tin mà sai”. Mục tiêu huấn luyện là tìm bộ trọng số làm loss nhỏ nhất.
Bước 3: Lan truyền ngược (backpropagation)
Mạng đã sai, nhưng sai vì trọng số nào? Lan truyền ngược trả lời câu hỏi đó. Thuật toán đi ngược từ lớp ra về lớp vào, dùng quy tắc đạo hàm của hàm hợp (chain rule) để tính gradient cho từng trọng số. Gradient cho biết hai điều: nếu tăng trọng số này một chút thì loss tăng hay giảm, và tăng giảm nhiều hay ít.
Giống như lần ngược một dây chuyền ra sản phẩm lỗi để xem mỗi công đoạn góp bao nhiêu phần, lan truyền ngược làm việc đó cho hàng triệu trọng số chỉ trong một lượt tính.
Bước 4: Gradient descent, xuống dốc từng bước
Có gradient, mạng chỉnh mỗi trọng số theo hướng ngược lại: w mới = w cũ − tốc độ học × gradient. Tốc độ học (learning rate) là độ dài mỗi bước. Giống người xuống núi trong sương mù: không thấy đáy, chỉ dò độ dốc dưới chân rồi bước về phía thấp hơn.
Ví dụ số: một trọng số học từ sai số
Ví dụ minh hoạ: mạng siêu nhỏ chỉ có một trọng số, dự đoán ŷ = w × x. Dữ liệu có x = 2 và đáp án đúng y = 10, nên trọng số lý tưởng là 5. Ban đầu w = 3. Hàm mất mát L = (ŷ − y)². Gradient theo w là 2 × (ŷ − y) × x. Tốc độ học chọn 0,05.
| Vòng | w | Dự đoán ŷ = w × 2 | Loss (ŷ − 10)² | Gradient | w mới = w − 0,05 × gradient |
|---|---|---|---|---|---|
| 1 | 3 | 6 | 16 | 2 × (−4) × 2 = −16 | 3 + 0,8 = 3,8 |
| 2 | 3,8 | 7,6 | 5,76 | 2 × (−2,4) × 2 = −9,6 | 3,8 + 0,48 = 4,28 |
| 3 | 4,28 | 8,56 | ≈ 2,07 | 2 × (−1,44) × 2 = −5,76 | 4,28 + 0,288 ≈ 4,57 |
| 4 | ≈ 4,57 | ≈ 9,14 | ≈ 0,75 | … | tiếp tục tiến về 5 |
Sau ba lần cập nhật, loss giảm từ 16 xuống khoảng 0,75. Gradient âm nghĩa là “tăng w thì loss giảm”, nên w được đẩy lên. Càng gần đáp án, bước càng ngắn.
Nếu tốc độ học là 0,5, w nhảy từ 3 lên 11, dự đoán thành 22 và loss vọt lên 144: bước quá dài làm mạng “nhảy qua” thung lũng. Vì vậy chọn tốc độ học là việc quan trọng.
Mạng thật học từ hàng nghìn tới hàng tỷ ví dụ, chia thành từng lô (batch); một lượt đi hết dữ liệu gọi là một epoch. Nguy cơ thường gặp là quá khớp (overfitting): mạng thuộc lòng dữ liệu huấn luyện nhưng làm kém với dữ liệu mới, nên luôn cần giữ riêng một phần dữ liệu để kiểm tra.
Perceptron là gì và vì sao bài toán XOR quan trọng?
Perceptron là mạng nơ-ron đơn giản nhất: một nơ-ron với hàm kích hoạt bước nhảy, cho ra 0 hoặc 1. Frank Rosenblatt mô tả nó trong bài báo “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain” đăng trên tạp chí Psychological Review, tập 65, năm 1958. Theo Đại học Cornell, tháng 7/1958 ông trình diễn perceptron trên máy IBM 704 cho Văn phòng Nghiên cứu Hải quân Mỹ: sau 50 lần thử, máy tự học phân biệt thẻ đánh dấu bên trái với bên phải.
Perceptron làm được phép logic đơn giản. Ví dụ minh hoạ với hai đầu vào 0 hoặc 1, w1 = w2 = 1:
- b = −1,5: chỉ khi cả hai đầu vào bằng 1 thì z dương, ra 1. Đó là AND.
- b = −0,5: chỉ cần một đầu vào bằng 1 là ra 1. Đó là OR.
Nhưng perceptron một lớp không làm được XOR (ra 1 khi đúng một đầu vào bằng 1). Vẽ bốn điểm (0,0), (0,1), (1,0), (1,1) lên mặt phẳng, không đường thẳng nào tách được hai điểm cho kết quả 1 khỏi hai điểm cho kết quả 0.
Lời giải là thêm một lớp ẩn. Nơ-ron ẩn h1 làm OR, nơ-ron ẩn h2 làm AND. Nơ-ron đầu ra tính h1 − h2 − 0,5 rồi qua hàm bước. Thử lại: (0,0) cho −0,5, ra 0; (1,0) cho 0,5, ra 1; (1,1) cho −0,5, ra 0. Bài học: lớp ẩn và tính phi tuyến làm nên sức mạnh của mạng nơ-ron. Năm 1989, George Cybenko chứng minh trên tạp chí Mathematics of Control, Signals and Systems rằng mạng một lớp ẩn dùng hàm sigmoid, nếu đủ nhiều nơ-ron, xấp xỉ được bất kỳ hàm liên tục nào trên miền giới hạn.
Lịch sử neural network: từ năm 1943 đến nay
Hơn 80 năm, mạng nơ-ron trải qua những giai đoạn kỳ vọng và thất vọng xen kẽ. Các mốc dưới đây đã được đối chiếu với bài báo gốc hoặc nguồn chính thức.
| Năm | Sự kiện | Ý nghĩa |
|---|---|---|
| 1943 | Warren McCulloch và Walter Pitts công bố “A logical calculus of the ideas immanent in nervous activity” trên Bulletin of Mathematical Biophysics, tập 5 | Mô hình toán học đầu tiên của nơ-ron, hoạt động kiểu “tất cả hoặc không” |
| 1949 | Donald Hebb xuất bản The Organization of Behavior | Ý tưởng học bằng cách làm mạnh kết nối giữa các nơ-ron |
| 1958 | Frank Rosenblatt công bố perceptron và trình diễn trên IBM 704 | Một trong những mạng nơ-ron đầu tiên tự học từ dữ liệu |
| 1969 | Marvin Minsky và Seymour Papert xuất bản sách Perceptrons (MIT Press) | Chỉ ra giới hạn của perceptron một lớp; kinh phí cho mạng nơ-ron bị cắt giảm, mở đầu “mùa đông AI” |
| 1982 | John Hopfield đăng bài trên PNAS, tập 79 (15/04/1982) | Mạng Hopfield làm bộ nhớ liên kết, khơi lại quan tâm |
| 1986 | Rumelhart, Hinton và Williams công bố “Learning representations by back-propagating errors” trên Nature, tập 323 (09/10/1986) | Phổ biến lan truyền ngược cho mạng nhiều lớp |
| 1989 | Yann LeCun và cộng sự nhận dạng mã bưu chính viết tay của Bưu điện Mỹ (Neural Computation, tập 1) | Ứng dụng thực tế sớm, tiền thân của CNN |
| 1997 | Hochreiter và Schmidhuber công bố LSTM (Neural Computation, tập 9) | Giúp mạng hồi quy nhớ được chuỗi dài |
| 2009 | Scarselli và cộng sự công bố “The Graph Neural Network Model” (IEEE Transactions on Neural Networks, tập 20) | Đưa mạng nơ-ron vào dữ liệu dạng đồ thị |
| 2012 | AlexNet thắng cuộc thi ImageNet ILSVRC-2012 với lỗi top-5 15,3%, so với 26,2% của đội thứ hai | Mở đầu làn sóng học sâu |
| 2014 | Goodfellow và cộng sự giới thiệu GAN | Mạng nơ-ron bắt đầu tạo ra ảnh mới |
| 2017 | Bài báo “Attention Is All You Need” giới thiệu Transformer | Nền móng của các mô hình ngôn ngữ lớn |
| 2024 | Nobel Vật lý trao cho John Hopfield và Geoffrey Hinton | Cho các phát hiện nền tảng về học máy với mạng nơ-ron nhân tạo |
Các loại mạng nơ-ron phổ biến hiện nay
Các loại mạng nơ-ron khác nhau chủ yếu ở cách nối nơ-ron, mỗi cách hợp với một “hình dạng” dữ liệu: bảng số, ảnh, chuỗi, đồ thị.
| Loại mạng | Ý tưởng chính | Dữ liệu phù hợp | Ví dụ ứng dụng | Điểm yếu |
|---|---|---|---|---|
| MLP (mạng truyền thẳng nhiều lớp) | Mọi nơ-ron lớp trước nối với mọi nơ-ron lớp sau, dữ liệu đi một chiều | Dữ liệu dạng bảng, vector đặc trưng | Chấm điểm rủi ro, dự báo đơn giản | Không tận dụng cấu trúc không gian hay thứ tự |
| CNN (mạng tích chập) | Bộ lọc nhỏ trượt trên ảnh, dùng chung trọng số để tìm nét, góc, hoa văn | Ảnh, video, tín hiệu | Nhận diện khuôn mặt, đọc X-quang, đọc chữ | Kém hiệu quả với chuỗi dài, văn bản |
| RNN và LSTM (mạng hồi quy) | Có vòng lặp mang “trí nhớ” từ bước trước sang bước sau | Chuỗi thời gian, giọng nói, văn bản | Dự báo nhu cầu, nhận dạng giọng nói | Khó song song hoá; RNN thường quên thông tin xa |
| Transformer | Cơ chế chú ý (attention) cho mỗi phần tử “nhìn” mọi phần tử khác cùng lúc | Văn bản, cả ảnh và âm thanh | Dịch máy, chatbot, mô hình ngôn ngữ lớn | Chi phí tính toán tăng nhanh theo độ dài đầu vào |
| GAN (mạng đối nghịch tạo sinh) | Hai mạng thi đấu: một mạng tạo dữ liệu giả, một mạng bắt lỗi | Ảnh, dữ liệu tổng hợp | Tạo ảnh, tăng độ phân giải | Huấn luyện kém ổn định, có rủi ro deepfake |
| GNN (mạng nơ-ron đồ thị) | Mỗi nút tổng hợp thông tin từ các nút láng giềng | Đồ thị: mạng xã hội, phân tử, giao dịch | Phát hiện gian lận, gợi ý, nghiên cứu thuốc | Khó mở rộng với đồ thị cực lớn |
- CNN là xương sống của thị giác máy tính: bộ lọc dùng chung trọng số giúp nhận ra con mèo dù nó nằm ở góc nào của ảnh.
- Transformer nhanh chóng thay RNN trong xử lý ngôn ngữ và là kiến trúc đứng sau các mô hình ngôn ngữ lớn như GPT, Gemini hay Claude.
- GNN hữu ích khi quan hệ giữa các đối tượng quan trọng hơn bản thân đối tượng. Biến thể phổ biến là mạng tích chập đồ thị (GCN) của Kipf và Welling, trình bày tại ICLR 2017.
- Ngoài ra còn có autoencoder (nén rồi tái tạo dữ liệu, dùng phát hiện bất thường) và mô hình khuếch tán (diffusion) để tạo ảnh.
Neural network và deep learning có quan hệ gì?
Deep learning (học sâu) là dùng mạng nơ-ron có nhiều lớp ẩn. Mọi mô hình học sâu đều là mạng nơ-ron, nhưng mạng vài lớp như ví dụ XOR chưa được gọi là “sâu”. Học sâu bùng nổ từ khoảng năm 2012 nhờ dữ liệu lớn và GPU. Nếu bạn muốn hiểu vì sao “sâu” lại mạnh hơn và học sâu khác học máy truyền thống ra sao, hãy đọc bài giải thích học sâu và các kiến trúc mạng sâu.
Hình dung như vòng tròn lồng nhau: AI chứa học máy, học máy chứa mạng nơ-ron, mạng nơ-ron chứa học sâu.
Ứng dụng neural network trong thực tế
Bạn dùng mạng nơ-ron hằng ngày mà không để ý:
- Hình ảnh: mở khoá điện thoại bằng khuôn mặt, camera nhận biển số.
- Giọng nói: trợ lý ảo, phụ đề tự động, chuyển ghi âm thành văn bản.
- Ngôn ngữ: dịch máy, chatbot, tóm tắt văn bản.
- Gợi ý: sàn thương mại điện tử, ứng dụng nhạc, phim đề xuất theo hành vi.
- Tài chính: phát hiện giao dịch bất thường, chấm điểm tín dụng.
- Y tế: hỗ trợ đọc phim chụp. Tại Việt Nam, bộ dữ liệu VinDr-CXR công bố trên Scientific Data ngày 20/07/2022 gồm 18.000 phim X-quang ngực từ Bệnh viện 108 và Bệnh viện Đại học Y Hà Nội, do 17 bác sĩ chẩn đoán hình ảnh gán nhãn, phục vụ huấn luyện mô hình.
- Khoa học: dự đoán cấu trúc protein. Một nửa giải Nobel Hoá học 2024 được trao cho Demis Hassabis và John Jumper vì dự đoán cấu trúc protein bằng mô hình AI AlphaFold2.
- Doanh nghiệp: đọc chứng từ bằng nhận dạng ký tự quang học, phân loại email, dự báo nhu cầu.
Hạn chế của mạng nơ-ron là gì?
Hộp đen: khó giải thích vì sao ra kết quả
Mạng hàng triệu trọng số không cho lý do dễ đọc như “từ chối vì thu nhập dưới X”, gây khó trong tín dụng, y tế, tuyển dụng. Các kỹ thuật AI giải thích được (explainable AI) chỉ mới cho gợi ý. Khi Luật Trí tuệ nhân tạo số 134/2025/QH15 đã có hiệu lực từ 01/03/2026, doanh nghiệp càng nên ghi chép rõ dữ liệu, cách huấn luyện và cách kiểm tra mô hình.
Cần nhiều dữ liệu có nhãn, và dữ liệu phải sạch
Dữ liệu thiếu, lệch hoặc gán nhãn sai cho ra mô hình sai một cách tự tin. Vì vậy khâu gán nhãn dữ liệu chiếm nhiều công sức trong dự án AI. Dữ liệu chủ yếu từ một nhóm người có thể khiến mạng kém chính xác với nhóm khác.
Tốn tài nguyên tính toán và điện năng
Huấn luyện mạng lớn cần cụm GPU chạy nhiều tuần. Theo báo cáo Energy and AI của Cơ quan Năng lượng Quốc tế (IEA), trung tâm dữ liệu dùng khoảng 415 TWh điện năm 2024, khoảng 1,5% điện năng toàn cầu, và có thể tăng lên khoảng 945 TWh vào năm 2030 với AI là động lực chính.
Dễ sai khi gặp tình huống lạ
Mạng có thể sai nặng với dữ liệu khác hẳn những gì đã thấy. Thay đổi rất nhỏ mắt người không nhận ra đôi khi cũng đủ làm mạng đổi kết quả, nên hệ thống quan trọng cần người giám sát.
Khi nào nên và không nên dùng neural network?
- Nên dùng khi dữ liệu là ảnh, âm thanh, văn bản; quy luật quá phức tạp để viết tay; có nhiều dữ liệu.
- Cân nhắc phương pháp khác khi dữ liệu là bảng nhỏ vài nghìn dòng: hồi quy, cây quyết định hay gradient boosting thường cho kết quả tương đương mà dễ giải thích hơn.
- Không nên dùng một mình khi quyết định cần giải trình pháp lý hoặc lỗi sai gây hậu quả nghiêm trọng.
- Tận dụng mô hình có sẵn và tinh chỉnh với dữ liệu riêng trước khi tự huấn luyện từ đầu.
Câu hỏi thường gặp
Mạng nơ-ron nhân tạo là gì, nói đơn giản nhất?
Đó là chương trình gồm nhiều phép tính nhỏ nối theo lớp, mỗi kết nối có một trọng số. Mạng xem nhiều ví dụ có đáp án, tự chỉnh trọng số tới khi trả lời đúng phần lớn, rồi dùng bộ trọng số đó cho dữ liệu mới. ANN là viết tắt của Artificial Neural Network.
Perceptron khác mạng nơ-ron nhiều lớp thế nào?
Perceptron chỉ có một nơ-ron với hàm bước, nên chỉ phân tách được dữ liệu bằng một đường thẳng. Mạng nhiều lớp (MLP) có lớp ẩn và hàm kích hoạt phi tuyến, nên giải được những bài như XOR mà perceptron không làm được.
Mạng nơ-ron có hoạt động giống não người không?
Không. Mạng chỉ mượn ý tưởng kết nối và độ mạnh kết nối từ não. Cách học, cấu trúc và cơ chế năng lượng đều khác xa não sinh học.
Cần bao nhiêu dữ liệu để huấn luyện một mạng nơ-ron?
Không có con số cố định. Bài toán đơn giản có thể chỉ cần vài nghìn ví dụ; mô hình ảnh hay ngôn ngữ huấn luyện từ đầu cần hàng triệu tới hàng tỷ. Tinh chỉnh mô hình có sẵn cần ít hơn nhiều.
Muốn học neural network cần biết những gì?
Nên nắm đại số tuyến tính cơ bản, đạo hàm, xác suất thống kê nhập môn và Python, rồi thực hành với PyTorch, TensorFlow hoặc Keras, bắt đầu từ bài nhận dạng chữ số viết tay.