Neural network là gì? Mạng nơ-ron nhân tạo dễ hiểu

Trả lời nhanh: Neural network (mạng nơ-ron nhân tạo, viết tắt ANN) là mô hình tính toán gồm nhiều “nơ-ron” đơn giản nối với nhau theo lớp. Mỗi kết nối có một trọng số. Mạng tự điều chỉnh các trọng số từ dữ liệu mẫu để học cách nhận ra quy luật, ví dụ phân biệt thư rác với thư thường.

Điểm chính

  • Mỗi nơ-ron nhân tạo chỉ làm ba việc: nhân đầu vào với trọng số, cộng thêm bias, rồi đưa qua hàm kích hoạt.
  • Mạng học qua vòng lặp: lan truyền thuận, tính loss, lan truyền ngược, cập nhật trọng số bằng gradient descent.
  • Ý tưởng có từ năm 1943, qua perceptron 1958, “mùa đông” sau 1969 và hồi sinh nhờ lan truyền ngược năm 1986.
  • Các họ mạng chính: MLP, CNN, RNN/LSTM, Transformer, GAN, GNN, mỗi loại hợp một kiểu dữ liệu.
  • Hạn chế lớn: hộp đen khó giải thích, cần nhiều dữ liệu có nhãn, tốn điện năng.
Mục lục
  1. Neural network là gì?
  2. Mạng nơ-ron nhân tạo lấy cảm hứng từ não người như thế nào?
  3. Cấu tạo của một mạng nơ-ron gồm những gì?
  4. Mạng nơ-ron học như thế nào?
  5. Perceptron là gì và vì sao bài toán XOR quan trọng?
  6. Lịch sử neural network: từ năm 1943 đến nay
  7. Các loại mạng nơ-ron phổ biến hiện nay
  8. Neural network và deep learning có quan hệ gì?
  9. Ứng dụng neural network trong thực tế
  10. Hạn chế của mạng nơ-ron là gì?
  11. Khi nào nên và không nên dùng neural network?
  12. Câu hỏi thường gặp

Neural network là gì?

Neural network là gì? Đó là một chương trình máy tính gồm nhiều đơn vị tính toán nhỏ gọi là nơ-ron (neuron), xếp thành lớp và nối với nhau. Mỗi đường nối mang một con số gọi là trọng số (weight). Dữ liệu đi qua mạng, được nhân, cộng, biến đổi, rồi cho ra kết quả ở lớp cuối.

Khác với phần mềm truyền thống, không ai viết sẵn luật “nếu A thì B”. Bạn đưa cho mạng hàng nghìn ví dụ có đáp án, mạng tự chỉnh trọng số cho tới khi trả lời gần đúng. Bộ trọng số sau huấn luyện chính là “kiến thức” mạng đã học.

Mạng neural, mạng nơ-ron, mạng thần kinh nhân tạo hay ANN (Artificial Neural Network) đều chỉ cùng một khái niệm. Chữ “nhân tạo” để phân biệt với mạng nơ-ron sinh học trong não.

Ví dụ đời thường (ví dụ minh hoạ): hộp thư tự chuyển thư quảng cáo vào mục spam. Bộ lọc không có danh sách cứng mọi câu chào mời. Nó đã “xem” rất nhiều thư được đánh dấu spam hoặc không, học ra dấu hiệu chung, rồi chấm cho thư mới một điểm, chẳng hạn 0,93, tức khả năng cao là spam.

Mạng nơ-ron là một nhánh của học máy, vốn lại thuộc trí tuệ nhân tạo. Phần lớn hệ thống AI nổi bật hiện nay đều có mạng nơ-ron ở lõi.

Mạng nơ-ron nhân tạo lấy cảm hứng từ não người như thế nào?

Não người là mạng lưới tế bào thần kinh khổng lồ. Theo nghiên cứu của Azevedo và cộng sự đăng trên Journal of Comparative Neurology năm 2009, não người trưởng thành có khoảng 86 tỷ nơ-ron. Mỗi nơ-ron nhận tín hiệu qua sợi nhánh (dendrite), tổng hợp ở thân tế bào, và nếu đủ mạnh thì phát tín hiệu qua sợi trục (axon) tới khớp thần kinh (synapse) của nơ-ron khác.

Năm 1949, Donald Hebb đưa ra giả thuyết trong cuốn The Organization of Behavior: khi tế bào A liên tục góp phần kích hoạt tế bào B, kết nối giữa chúng mạnh lên. Đây là gốc rễ của ý tưởng “học bằng cách thay đổi độ mạnh kết nối”, tức thay đổi trọng số.

Nơ-ron sinh họcNơ-ron nhân tạo
Sợi nhánhCác đầu vào x1, x2, x3…
Độ mạnh khớp thần kinhTrọng số w
Thân tế bàoPhép cộng có trọng số và bias
Ngưỡng phát xungHàm kích hoạt
Sợi trụcĐầu ra a

Lưu ý: não chỉ là nguồn cảm hứng. Mạng nơ-ron nhân tạo là mô hình toán học đơn giản hoá rất nhiều, không có ý thức và không “suy nghĩ” như người.

Cấu tạo của một mạng nơ-ron gồm những gì?

Dù nhỏ hay lớn, mọi mạng nơ-ron đều ghép từ cùng vài “viên gạch”. Sơ đồ dưới cho thấy toàn mạng và bên trong một nơ-ron.

Cấu tạo mạng nơ-ron 3–4–2 và bên trong một nơ-ron Lớp vào Lớp ẩn Lớp ra x1 x2 x3 ŷ1 ŷ2 Mỗi đường nối mang một trọng số w. Tổng: 20 trọng số + 6 bias = 26 tham số. Bên trong một nơ-ron ẩn x1x2x3 w1w2w3 bias b Σ + b f(z) a z = w1·x1 + w2·x2 + w3·x3 + b a = f(z), f là hàm kích hoạt (ví dụ ReLU) a được gửi sang các nơ-ron ở lớp sau Học = điều chỉnh các w và b
Hình 1. Trái: mạng nơ-ron truyền thẳng với 3 đầu vào, 4 nơ-ron ẩn và 2 đầu ra. Phải: một nơ-ron tính tổng có trọng số, cộng bias rồi đưa qua hàm kích hoạt.

Nơ-ron nhân tạo: một phép tính nhỏ

Mỗi nơ-ron nhận vài con số đầu vào x1, x2, x3. Nó nhân từng số với trọng số tương ứng, cộng tất cả lại, cộng thêm bias b, được giá trị z. Sau đó z đi qua hàm kích hoạt f để thành đầu ra a. Toàn bộ chỉ có vậy: z = w1·x1 + w2·x2 + w3·x3 + b, rồi a = f(z).

Trọng số và bias khác nhau thế nào?

Trọng số cho biết đầu vào nào quan trọng: dương và lớn thì đẩy kết quả lên mạnh, âm thì kéo xuống, gần 0 thì gần như bị bỏ qua.

Bias (độ lệch) là con số cộng thêm, giống ngưỡng “dễ tính” hay “khó tính” của nơ-ron. Trọng số và bias gọi chung là tham số (parameter). Mô hình “7 tỷ tham số” nghĩa là có khoảng 7 tỷ con số như vậy cần học.

Hàm kích hoạt để làm gì?

Nếu chỉ có nhân và cộng, xếp bao nhiêu lớp thì cả mạng vẫn tương đương một phép biến đổi tuyến tính, chỉ vẽ được “đường thẳng” phân chia dữ liệu. Hàm kích hoạt (activation function) thêm tính phi tuyến để mạng học được ranh giới cong, phức tạp.

Hàm kích hoạtCách hoạt độngKhoảng giá trị đầu raThường dùng ở đâu
Bước nhảy (step)z ≥ 0 thì ra 1, ngược lại ra 00 hoặc 1Perceptron cổ điển
SigmoidNén mọi số về khoảng 0 đến 1 theo đường cong chữ S(0; 1)Lớp ra của bài toán có/không
TanhGiống sigmoid nhưng đối xứng quanh 0(−1; 1)Một số mạng hồi quy
ReLUGiữ nguyên nếu z dương, về 0 nếu z âm[0; +∞)Lớp ẩn của đa số mạng hiện đại
SoftmaxBiến một dãy điểm số thành xác suất có tổng bằng 1(0; 1), tổng = 1Lớp ra khi phân loại nhiều nhóm

Lớp vào, lớp ẩn và lớp ra

  • Lớp vào (input layer): nhận dữ liệu đã số hoá. Ảnh 28×28 điểm ảnh cho 784 giá trị đầu vào.
  • Lớp ẩn (hidden layer): nơi diễn ra phần lớn việc “học”. Lớp đầu bắt đặc trưng đơn giản, lớp sau ghép thành đặc trưng phức tạp hơn.
  • Lớp ra (output layer): cho kết quả cuối. Một nơ-ron nếu cần một con số (giá nhà), nhiều nơ-ron nếu phân loại nhiều nhóm.

Mạng trong Hình 1 có 3×4 + 4×2 = 20 trọng số và 4 + 2 = 6 bias, tổng 26 tham số. Mỗi tham số là một con số phải lưu và tính, nên mô hình lớn cần nhiều bộ nhớ.

Ví dụ tính tay một nơ-ron

Ví dụ minh hoạ: một nơ-ron quyết định có nên mang ô khi ra ngoài. Hai đầu vào: x1 = 0,8 (khả năng mưa theo dự báo) và x2 = 0,5 (quãng đường đi bộ, đã quy về thang 0–1). Giả sử mạng đã học được w1 = 2,0, w2 = 1,0 và b = −1,5.

  • Tổng có trọng số: z = 2,0 × 0,8 + 1,0 × 0,5 + (−1,5) = 1,6 + 0,5 − 1,5 = 0,6.
  • Qua hàm sigmoid: a = 1 / (1 + e mũ −0,6) ≈ 0,65.
  • Diễn giải: khoảng 65% “nên mang ô”. Nếu ngưỡng quyết định là 0,5 thì câu trả lời là có.

Nếu trời quang, x1 = 0,1, thì z = −0,8 và a ≈ 0,31: không cần mang ô. Trọng số w1 gấp đôi w2 cho thấy mạng coi khả năng mưa quan trọng hơn quãng đường.

Mạng nơ-ron học như thế nào?

Ví dụ trên giả định trọng số đã “đúng”. Thực tế, trọng số ban đầu là ngẫu nhiên và mạng gần như đoán mò. Huấn luyện (training) lặp một vòng bốn bước để sửa dần chúng.

Một vòng huấn luyện mạng nơ-ron (lặp lại rất nhiều lần) 1. Lan truyền thuận (forward) Dữ liệu đi từ lớp vào qua các lớp ẩn tới lớp ra, cho ra dự đoán ŷ 2. Tính hàm mất mát (loss) So dự đoán ŷ với đáp án đúng y, ra một con số đo mức độ sai 3. Lan truyền ngược (backprop) Tính gradient: mỗi trọng số góp bao nhiêu vào lỗi, theo hướng nào 4. Cập nhật trọng số Gradient descent: w mới = w cũ − tốc độ học × gradient Ví dụ bên dưới: w = 3 → 3,8 → 4,28 → 4,57; loss = 16 → 5,76 → 2,07 → 0,75
Hình 2. Vòng huấn luyện bốn bước. Sau bước 4, mạng quay lại bước 1 với lô dữ liệu tiếp theo cho tới khi sai số đủ nhỏ.

Bước 1: Lan truyền thuận (forward propagation)

Dữ liệu đi một chiều từ lớp vào, qua các lớp ẩn, tới lớp ra. Mỗi nơ-ron làm phép tính nhỏ như trên. Kết quả ở lớp ra là dự đoán ŷ (đọc là “y mũ”).

Bước 2: Hàm mất mát (loss function)

Hàm mất mát đo khoảng cách giữa dự đoán ŷ và đáp án đúng y; càng lớn thì càng sai. Khi dự đoán một con số, người ta hay dùng sai số bình phương trung bình (MSE). Khi phân loại, cross-entropy phổ biến hơn vì nó phạt nặng trường hợp “tự tin mà sai”. Mục tiêu huấn luyện là tìm bộ trọng số làm loss nhỏ nhất.

Bước 3: Lan truyền ngược (backpropagation)

Mạng đã sai, nhưng sai vì trọng số nào? Lan truyền ngược trả lời câu hỏi đó. Thuật toán đi ngược từ lớp ra về lớp vào, dùng quy tắc đạo hàm của hàm hợp (chain rule) để tính gradient cho từng trọng số. Gradient cho biết hai điều: nếu tăng trọng số này một chút thì loss tăng hay giảm, và tăng giảm nhiều hay ít.

Giống như lần ngược một dây chuyền ra sản phẩm lỗi để xem mỗi công đoạn góp bao nhiêu phần, lan truyền ngược làm việc đó cho hàng triệu trọng số chỉ trong một lượt tính.

Bước 4: Gradient descent, xuống dốc từng bước

Có gradient, mạng chỉnh mỗi trọng số theo hướng ngược lại: w mới = w cũ − tốc độ học × gradient. Tốc độ học (learning rate) là độ dài mỗi bước. Giống người xuống núi trong sương mù: không thấy đáy, chỉ dò độ dốc dưới chân rồi bước về phía thấp hơn.

Ví dụ số: một trọng số học từ sai số

Ví dụ minh hoạ: mạng siêu nhỏ chỉ có một trọng số, dự đoán ŷ = w × x. Dữ liệu có x = 2 và đáp án đúng y = 10, nên trọng số lý tưởng là 5. Ban đầu w = 3. Hàm mất mát L = (ŷ − y)². Gradient theo w là 2 × (ŷ − y) × x. Tốc độ học chọn 0,05.

VòngwDự đoán ŷ = w × 2Loss (ŷ − 10)²Gradientw mới = w − 0,05 × gradient
136162 × (−4) × 2 = −163 + 0,8 = 3,8
23,87,65,762 × (−2,4) × 2 = −9,63,8 + 0,48 = 4,28
34,288,56≈ 2,072 × (−1,44) × 2 = −5,764,28 + 0,288 ≈ 4,57
4≈ 4,57≈ 9,14≈ 0,75…tiếp tục tiến về 5

Sau ba lần cập nhật, loss giảm từ 16 xuống khoảng 0,75. Gradient âm nghĩa là “tăng w thì loss giảm”, nên w được đẩy lên. Càng gần đáp án, bước càng ngắn.

Nếu tốc độ học là 0,5, w nhảy từ 3 lên 11, dự đoán thành 22 và loss vọt lên 144: bước quá dài làm mạng “nhảy qua” thung lũng. Vì vậy chọn tốc độ học là việc quan trọng.

Mạng thật học từ hàng nghìn tới hàng tỷ ví dụ, chia thành từng lô (batch); một lượt đi hết dữ liệu gọi là một epoch. Nguy cơ thường gặp là quá khớp (overfitting): mạng thuộc lòng dữ liệu huấn luyện nhưng làm kém với dữ liệu mới, nên luôn cần giữ riêng một phần dữ liệu để kiểm tra.

Perceptron là gì và vì sao bài toán XOR quan trọng?

Perceptron là mạng nơ-ron đơn giản nhất: một nơ-ron với hàm kích hoạt bước nhảy, cho ra 0 hoặc 1. Frank Rosenblatt mô tả nó trong bài báo “The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain” đăng trên tạp chí Psychological Review, tập 65, năm 1958. Theo Đại học Cornell, tháng 7/1958 ông trình diễn perceptron trên máy IBM 704 cho Văn phòng Nghiên cứu Hải quân Mỹ: sau 50 lần thử, máy tự học phân biệt thẻ đánh dấu bên trái với bên phải.

Perceptron làm được phép logic đơn giản. Ví dụ minh hoạ với hai đầu vào 0 hoặc 1, w1 = w2 = 1:

  • b = −1,5: chỉ khi cả hai đầu vào bằng 1 thì z dương, ra 1. Đó là AND.
  • b = −0,5: chỉ cần một đầu vào bằng 1 là ra 1. Đó là OR.

Nhưng perceptron một lớp không làm được XOR (ra 1 khi đúng một đầu vào bằng 1). Vẽ bốn điểm (0,0), (0,1), (1,0), (1,1) lên mặt phẳng, không đường thẳng nào tách được hai điểm cho kết quả 1 khỏi hai điểm cho kết quả 0.

Lời giải là thêm một lớp ẩn. Nơ-ron ẩn h1 làm OR, nơ-ron ẩn h2 làm AND. Nơ-ron đầu ra tính h1 − h2 − 0,5 rồi qua hàm bước. Thử lại: (0,0) cho −0,5, ra 0; (1,0) cho 0,5, ra 1; (1,1) cho −0,5, ra 0. Bài học: lớp ẩn và tính phi tuyến làm nên sức mạnh của mạng nơ-ron. Năm 1989, George Cybenko chứng minh trên tạp chí Mathematics of Control, Signals and Systems rằng mạng một lớp ẩn dùng hàm sigmoid, nếu đủ nhiều nơ-ron, xấp xỉ được bất kỳ hàm liên tục nào trên miền giới hạn.

Lịch sử neural network: từ năm 1943 đến nay

Hơn 80 năm, mạng nơ-ron trải qua những giai đoạn kỳ vọng và thất vọng xen kẽ. Các mốc dưới đây đã được đối chiếu với bài báo gốc hoặc nguồn chính thức.

NămSự kiệnÝ nghĩa
1943Warren McCulloch và Walter Pitts công bố “A logical calculus of the ideas immanent in nervous activity” trên Bulletin of Mathematical Biophysics, tập 5Mô hình toán học đầu tiên của nơ-ron, hoạt động kiểu “tất cả hoặc không”
1949Donald Hebb xuất bản The Organization of BehaviorÝ tưởng học bằng cách làm mạnh kết nối giữa các nơ-ron
1958Frank Rosenblatt công bố perceptron và trình diễn trên IBM 704Một trong những mạng nơ-ron đầu tiên tự học từ dữ liệu
1969Marvin Minsky và Seymour Papert xuất bản sách Perceptrons (MIT Press)Chỉ ra giới hạn của perceptron một lớp; kinh phí cho mạng nơ-ron bị cắt giảm, mở đầu “mùa đông AI”
1982John Hopfield đăng bài trên PNAS, tập 79 (15/04/1982)Mạng Hopfield làm bộ nhớ liên kết, khơi lại quan tâm
1986Rumelhart, Hinton và Williams công bố “Learning representations by back-propagating errors” trên Nature, tập 323 (09/10/1986)Phổ biến lan truyền ngược cho mạng nhiều lớp
1989Yann LeCun và cộng sự nhận dạng mã bưu chính viết tay của Bưu điện Mỹ (Neural Computation, tập 1)Ứng dụng thực tế sớm, tiền thân của CNN
1997Hochreiter và Schmidhuber công bố LSTM (Neural Computation, tập 9)Giúp mạng hồi quy nhớ được chuỗi dài
2009Scarselli và cộng sự công bố “The Graph Neural Network Model” (IEEE Transactions on Neural Networks, tập 20)Đưa mạng nơ-ron vào dữ liệu dạng đồ thị
2012AlexNet thắng cuộc thi ImageNet ILSVRC-2012 với lỗi top-5 15,3%, so với 26,2% của đội thứ haiMở đầu làn sóng học sâu
2014Goodfellow và cộng sự giới thiệu GANMạng nơ-ron bắt đầu tạo ra ảnh mới
2017Bài báo “Attention Is All You Need” giới thiệu TransformerNền móng của các mô hình ngôn ngữ lớn
2024Nobel Vật lý trao cho John Hopfield và Geoffrey HintonCho các phát hiện nền tảng về học máy với mạng nơ-ron nhân tạo

Các loại mạng nơ-ron phổ biến hiện nay

Các loại mạng nơ-ron khác nhau chủ yếu ở cách nối nơ-ron, mỗi cách hợp với một “hình dạng” dữ liệu: bảng số, ảnh, chuỗi, đồ thị.

Loại mạngÝ tưởng chínhDữ liệu phù hợpVí dụ ứng dụngĐiểm yếu
MLP (mạng truyền thẳng nhiều lớp)Mọi nơ-ron lớp trước nối với mọi nơ-ron lớp sau, dữ liệu đi một chiềuDữ liệu dạng bảng, vector đặc trưngChấm điểm rủi ro, dự báo đơn giảnKhông tận dụng cấu trúc không gian hay thứ tự
CNN (mạng tích chập)Bộ lọc nhỏ trượt trên ảnh, dùng chung trọng số để tìm nét, góc, hoa vănẢnh, video, tín hiệuNhận diện khuôn mặt, đọc X-quang, đọc chữKém hiệu quả với chuỗi dài, văn bản
RNN và LSTM (mạng hồi quy)Có vòng lặp mang “trí nhớ” từ bước trước sang bước sauChuỗi thời gian, giọng nói, văn bảnDự báo nhu cầu, nhận dạng giọng nóiKhó song song hoá; RNN thường quên thông tin xa
TransformerCơ chế chú ý (attention) cho mỗi phần tử “nhìn” mọi phần tử khác cùng lúcVăn bản, cả ảnh và âm thanhDịch máy, chatbot, mô hình ngôn ngữ lớnChi phí tính toán tăng nhanh theo độ dài đầu vào
GAN (mạng đối nghịch tạo sinh)Hai mạng thi đấu: một mạng tạo dữ liệu giả, một mạng bắt lỗiẢnh, dữ liệu tổng hợpTạo ảnh, tăng độ phân giảiHuấn luyện kém ổn định, có rủi ro deepfake
GNN (mạng nơ-ron đồ thị)Mỗi nút tổng hợp thông tin từ các nút láng giềngĐồ thị: mạng xã hội, phân tử, giao dịchPhát hiện gian lận, gợi ý, nghiên cứu thuốcKhó mở rộng với đồ thị cực lớn
  • CNN là xương sống của thị giác máy tính: bộ lọc dùng chung trọng số giúp nhận ra con mèo dù nó nằm ở góc nào của ảnh.
  • Transformer nhanh chóng thay RNN trong xử lý ngôn ngữ và là kiến trúc đứng sau các mô hình ngôn ngữ lớn như GPT, Gemini hay Claude.
  • GNN hữu ích khi quan hệ giữa các đối tượng quan trọng hơn bản thân đối tượng. Biến thể phổ biến là mạng tích chập đồ thị (GCN) của Kipf và Welling, trình bày tại ICLR 2017.
  • Ngoài ra còn có autoencoder (nén rồi tái tạo dữ liệu, dùng phát hiện bất thường) và mô hình khuếch tán (diffusion) để tạo ảnh.

Neural network và deep learning có quan hệ gì?

Deep learning (học sâu) là dùng mạng nơ-ron có nhiều lớp ẩn. Mọi mô hình học sâu đều là mạng nơ-ron, nhưng mạng vài lớp như ví dụ XOR chưa được gọi là “sâu”. Học sâu bùng nổ từ khoảng năm 2012 nhờ dữ liệu lớn và GPU. Nếu bạn muốn hiểu vì sao “sâu” lại mạnh hơn và học sâu khác học máy truyền thống ra sao, hãy đọc bài giải thích học sâu và các kiến trúc mạng sâu.

Hình dung như vòng tròn lồng nhau: AI chứa học máy, học máy chứa mạng nơ-ron, mạng nơ-ron chứa học sâu.

Ứng dụng neural network trong thực tế

Bạn dùng mạng nơ-ron hằng ngày mà không để ý:

  • Hình ảnh: mở khoá điện thoại bằng khuôn mặt, camera nhận biển số.
  • Giọng nói: trợ lý ảo, phụ đề tự động, chuyển ghi âm thành văn bản.
  • Ngôn ngữ: dịch máy, chatbot, tóm tắt văn bản.
  • Gợi ý: sàn thương mại điện tử, ứng dụng nhạc, phim đề xuất theo hành vi.
  • Tài chính: phát hiện giao dịch bất thường, chấm điểm tín dụng.
  • Y tế: hỗ trợ đọc phim chụp. Tại Việt Nam, bộ dữ liệu VinDr-CXR công bố trên Scientific Data ngày 20/07/2022 gồm 18.000 phim X-quang ngực từ Bệnh viện 108 và Bệnh viện Đại học Y Hà Nội, do 17 bác sĩ chẩn đoán hình ảnh gán nhãn, phục vụ huấn luyện mô hình.
  • Khoa học: dự đoán cấu trúc protein. Một nửa giải Nobel Hoá học 2024 được trao cho Demis Hassabis và John Jumper vì dự đoán cấu trúc protein bằng mô hình AI AlphaFold2.
  • Doanh nghiệp: đọc chứng từ bằng nhận dạng ký tự quang học, phân loại email, dự báo nhu cầu.

Hạn chế của mạng nơ-ron là gì?

Hộp đen: khó giải thích vì sao ra kết quả

Mạng hàng triệu trọng số không cho lý do dễ đọc như “từ chối vì thu nhập dưới X”, gây khó trong tín dụng, y tế, tuyển dụng. Các kỹ thuật AI giải thích được (explainable AI) chỉ mới cho gợi ý. Khi Luật Trí tuệ nhân tạo số 134/2025/QH15 đã có hiệu lực từ 01/03/2026, doanh nghiệp càng nên ghi chép rõ dữ liệu, cách huấn luyện và cách kiểm tra mô hình.

Cần nhiều dữ liệu có nhãn, và dữ liệu phải sạch

Dữ liệu thiếu, lệch hoặc gán nhãn sai cho ra mô hình sai một cách tự tin. Vì vậy khâu gán nhãn dữ liệu chiếm nhiều công sức trong dự án AI. Dữ liệu chủ yếu từ một nhóm người có thể khiến mạng kém chính xác với nhóm khác.

Tốn tài nguyên tính toán và điện năng

Huấn luyện mạng lớn cần cụm GPU chạy nhiều tuần. Theo báo cáo Energy and AI của Cơ quan Năng lượng Quốc tế (IEA), trung tâm dữ liệu dùng khoảng 415 TWh điện năm 2024, khoảng 1,5% điện năng toàn cầu, và có thể tăng lên khoảng 945 TWh vào năm 2030 với AI là động lực chính.

Dễ sai khi gặp tình huống lạ

Mạng có thể sai nặng với dữ liệu khác hẳn những gì đã thấy. Thay đổi rất nhỏ mắt người không nhận ra đôi khi cũng đủ làm mạng đổi kết quả, nên hệ thống quan trọng cần người giám sát.

Khi nào nên và không nên dùng neural network?

  • Nên dùng khi dữ liệu là ảnh, âm thanh, văn bản; quy luật quá phức tạp để viết tay; có nhiều dữ liệu.
  • Cân nhắc phương pháp khác khi dữ liệu là bảng nhỏ vài nghìn dòng: hồi quy, cây quyết định hay gradient boosting thường cho kết quả tương đương mà dễ giải thích hơn.
  • Không nên dùng một mình khi quyết định cần giải trình pháp lý hoặc lỗi sai gây hậu quả nghiêm trọng.
  • Tận dụng mô hình có sẵn và tinh chỉnh với dữ liệu riêng trước khi tự huấn luyện từ đầu.

Câu hỏi thường gặp

Mạng nơ-ron nhân tạo là gì, nói đơn giản nhất?

Đó là chương trình gồm nhiều phép tính nhỏ nối theo lớp, mỗi kết nối có một trọng số. Mạng xem nhiều ví dụ có đáp án, tự chỉnh trọng số tới khi trả lời đúng phần lớn, rồi dùng bộ trọng số đó cho dữ liệu mới. ANN là viết tắt của Artificial Neural Network.

Perceptron khác mạng nơ-ron nhiều lớp thế nào?

Perceptron chỉ có một nơ-ron với hàm bước, nên chỉ phân tách được dữ liệu bằng một đường thẳng. Mạng nhiều lớp (MLP) có lớp ẩn và hàm kích hoạt phi tuyến, nên giải được những bài như XOR mà perceptron không làm được.

Mạng nơ-ron có hoạt động giống não người không?

Không. Mạng chỉ mượn ý tưởng kết nối và độ mạnh kết nối từ não. Cách học, cấu trúc và cơ chế năng lượng đều khác xa não sinh học.

Cần bao nhiêu dữ liệu để huấn luyện một mạng nơ-ron?

Không có con số cố định. Bài toán đơn giản có thể chỉ cần vài nghìn ví dụ; mô hình ảnh hay ngôn ngữ huấn luyện từ đầu cần hàng triệu tới hàng tỷ. Tinh chỉnh mô hình có sẵn cần ít hơn nhiều.

Muốn học neural network cần biết những gì?

Nên nắm đại số tuyến tính cơ bản, đạo hàm, xác suất thống kê nhập môn và Python, rồi thực hành với PyTorch, TensorFlow hoặc Keras, bắt đầu từ bài nhận dạng chữ số viết tay.