Trả lời nhanh: Deep learning (học sâu) là một nhánh của học máy, dùng mạng nơ-ron nhân tạo nhiều lớp để tự học đặc trưng từ ảnh, âm thanh, văn bản. Ví dụ: điện thoại tự nhận ra khuôn mặt bạn trong album ảnh.
Điểm chính
- Học sâu là tập con của học máy. Khác biệt cốt lõi: mạng nơ-ron sâu tự học đặc trưng, con người không phải thiết kế.
- Mạng học bằng cách đoán, đo sai số rồi chỉnh trọng số ngược từ lớp cuối về lớp đầu (lan truyền ngược).
- Bước ngoặt năm 2012: AlexNet chạy trên 2 GPU thắng ImageNet với lỗi top-5 15,3%, so với 26,2% của đội thứ hai.
- Năm kiến trúc cần biết: CNN, RNN/LSTM, Transformer, GAN và diffusion.
- Hạn chế lớn: cần nhiều dữ liệu có nhãn, tốn chi phí tính toán, khó giải thích quyết định.
Mục lục
- Deep learning là gì?
- Deep learning ra đời và phát triển như thế nào?
- Mạng nơ-ron sâu hoạt động như thế nào?
- Các kiến trúc deep learning chính là gì?
- Deep learning và machine learning khác nhau thế nào?
- Ứng dụng deep learning trong thực tế là gì?
- Hạn chế của deep learning là gì?
- Học và làm deep learning cần công cụ gì?
- Doanh nghiệp nên bắt đầu với deep learning thế nào?
- Những hiểu lầm phổ biến về deep learning
- Câu hỏi thường gặp
Deep learning là gì?
Deep learning, tiếng Việt là học sâu, là phương pháp dạy máy tính học từ dữ liệu bằng mạng nơ-ron nhân tạo (artificial neural network) gồm nhiều lớp xếp chồng. Chữ “sâu” (deep) chỉ số lớp xử lý nằm giữa đầu vào và đầu ra, không phải “hiểu sâu” như con người.
Hãy nghĩ tới cách một đứa trẻ học nhận biết con mèo. Không ai đưa cho bé định nghĩa “bốn chân, tai nhọn, có ria”. Bé chỉ xem rất nhiều con mèo, được người lớn sửa “không phải, đó là con chó”, và dần tự rút ra quy luật. Mạng nơ-ron sâu học tương tự: xem hàng nghìn đến hàng triệu ví dụ có đáp án, tự điều chỉnh, tới khi đoán đúng cả những ảnh chưa từng thấy.
Về vị trí: trí tuệ nhân tạo là mục tiêu chung, làm cho máy thực hiện được việc cần trí thông minh. Học máy là một cách đạt mục tiêu đó bằng việc học từ dữ liệu. Học sâu là nhóm kỹ thuật bên trong học máy, chuyên dùng mạng nơ-ron nhiều lớp. Bài này tập trung vào học sâu; phần nền tảng về các thuật toán học máy nói chung có trong bài học máy là gì và hoạt động ra sao.
Deep learning ra đời và phát triển như thế nào?
Ý tưởng mạng nơ-ron có từ thập niên 1950, nhưng hơn nửa thế kỷ sau mới bùng nổ. Các mốc đáng nhớ:
- Tháng 7/1958 – Perceptron: Frank Rosenblatt (Phòng thí nghiệm Hàng không Cornell) trình diễn perceptron trên máy IBM 704 cho Văn phòng Nghiên cứu Hải quân Mỹ. Theo Đại học Cornell, sau 50 lần thử, máy tự học phân biệt thẻ đục lỗ đánh dấu bên trái với bên phải. Perceptron chỉ có một lớp nên chỉ giải được bài toán đơn giản.
- Ngày 09/10/1986 – Lan truyền ngược: David Rumelhart, Geoffrey Hinton và Ronald Williams công bố trên tạp chí Nature thuật toán lan truyền ngược (backpropagation), cho phép huấn luyện mạng có lớp ẩn.
- Cuối thập niên 1980 – CNN: theo ACM, Yann LeCun huấn luyện hệ thống mạng tích chập đầu tiên trên ảnh chữ số viết tay.
- Năm 1997 – LSTM: Sepp Hochreiter và Jürgen Schmidhuber công bố LSTM trên tạp chí Neural Computation.
- Năm 2012 – AlexNet: mạng của Alex Krizhevsky, Ilya Sutskever và Geoffrey Hinton thắng cuộc thi ImageNet ILSVRC-2012 với lỗi top-5 15,3%, đội thứ hai là 26,2%. Mạng được huấn luyện 5 đến 6 ngày trên hai card đồ hoạ GTX 580. Từ đây giới nghiên cứu chuyển hẳn sang học sâu và GPU.
- Năm 2014 – GAN: Ian Goodfellow và cộng sự giới thiệu mạng đối nghịch tạo sinh.
- Tháng 6/2017 – Transformer: bài báo “Attention Is All You Need” của nhóm tác giả Google ra mắt kiến trúc Transformer, nền móng của các mô hình ngôn ngữ lớn ngày nay.
- Ngày 27/03/2019 – Giải Turing 2018: ACM trao giải Turing năm 2018 (trị giá 1 triệu USD) cho Yoshua Bengio, Geoffrey Hinton và Yann LeCun vì những đột phá về khái niệm và kỹ thuật giúp mạng nơ-ron sâu trở thành thành phần then chốt của điện toán.
- Năm 2020 – Diffusion: Jonathan Ho, Ajay Jain và Pieter Abbeel công bố mô hình khuếch tán khử nhiễu (DDPM), mở đường cho công cụ tạo ảnh từ văn bản.
- Năm 2024 – Hai giải Nobel: Nobel Vật lý trao cho John Hopfield và Geoffrey Hinton vì các khám phá nền tảng cho học máy bằng mạng nơ-ron nhân tạo. Một nửa Nobel Hoá học thuộc về Demis Hassabis và John Jumper vì dự đoán cấu trúc protein bằng AlphaFold.
Vì sao phải chờ tới 2012? Học sâu cần ba thứ cùng lúc: thuật toán (có từ 1986), dữ liệu lớn (bộ dữ liệu cuộc thi ImageNet có khoảng 1,2 triệu ảnh huấn luyện, chia thành 1.000 lớp) và sức tính toán (GPU). Khi cả ba hội tụ, mạng sâu vượt hẳn phương pháp cũ.
Mạng nơ-ron sâu hoạt động như thế nào?
Bạn không cần toán cao cấp để nắm cơ chế. Hãy đi qua sơ đồ dưới với ví dụ: mạng nhận một bức ảnh và trả lời “mèo” hay “chó”.
Nơ-ron, lớp và trọng số
Mỗi vòng tròn là một nơ-ron nhân tạo, thực chất là một phép tính nhỏ: nhận các con số từ lớp trước, nhân mỗi số với một trọng số (weight), cộng lại, thêm hệ số điều chỉnh (bias), rồi chuyển sang lớp sau.
Trọng số giống mức độ “tin tưởng” vào từng nguồn tin. Bạn quyết định mang ô dựa trên dự báo thời tiết, màu trời và lời mẹ dặn; nếu tin dự báo nhất, nguồn đó có trọng số lớn. Học sâu là quá trình tìm bộ trọng số tốt nhất, chỉ khác là có hàng triệu nguồn tin. Mạng gồm ba loại lớp:
- Lớp đầu vào (input layer): nhận dữ liệu thô, với ảnh là giá trị từng điểm ảnh.
- Các lớp ẩn (hidden layers): nơi diễn ra việc học. Có nhiều lớp ẩn thì gọi là mạng nơ-ron sâu (deep neural network).
- Lớp đầu ra (output layer): trả kết quả, ví dụ 92% là mèo, 8% là chó.
Hàm kích hoạt: vì sao mạng không chỉ là phép cộng
Nếu nơ-ron chỉ nhân và cộng, mạng trăm lớp vẫn tương đương một phép tính tuyến tính, không học được quan hệ phức tạp. Hàm kích hoạt (activation function) “bẻ cong” kết quả. Phổ biến nhất là ReLU: giữ số dương, biến số âm thành 0, giống một công tắc: tín hiệu đủ mạnh thì bật, yếu thì tắt. Hàng triệu công tắc như vậy giúp mạng vẽ được ranh giới phức tạp, như giữa mèo lông xù và chó lông xù.
Lan truyền thuận và hàm mất mát
Ảnh đi từ đầu vào qua các lớp ẩn tới đầu ra gọi là lan truyền thuận (forward propagation). Ban đầu trọng số ngẫu nhiên nên mạng đoán bừa. Hàm mất mát (loss function) đo mức sai: ảnh là mèo mà mạng chỉ cho 30% là mèo thì sai số lớn, cho 95% thì sai số nhỏ.
Lan truyền ngược: học từ lỗi sai
Lan truyền ngược trả lời câu hỏi: trong hàng triệu trọng số, cái nào gây lỗi và nên chỉnh bao nhiêu? Thuật toán đi ngược từ đầu ra về đầu vào, tính mức “chịu trách nhiệm” của từng trọng số. Sau đó phương pháp hạ gradient (gradient descent) chỉnh mỗi trọng số một bước nhỏ theo hướng giảm sai số.
Giống như tập ném bóng vào rổ: ném lệch trái thì lần sau xoay sang phải một chút, ném quá xa thì nhẹ tay hơn. Mạng lặp như vậy qua toàn bộ dữ liệu nhiều lượt (epoch). Sau đó, mạng được kiểm tra trên dữ liệu mới chưa từng thấy. Nếu đúng trên dữ liệu huấn luyện nhưng sai nhiều trên dữ liệu mới, mạng bị quá khớp (overfitting), tức “học vẹt”.
Vì sao “sâu” lại mạnh hơn?
Mạng sâu học đặc trưng theo tầng bậc. Với ảnh, lớp ẩn đầu phát hiện cạnh và màu, lớp tiếp theo ghép thành góc, đường cong, lớp sâu hơn ghép thành mắt, tai, lớp cuối nhận ra con vật. Không ai lập trình các bước đó. Bài báo năm 1986 của Rumelhart, Hinton và Williams đã chỉ ra: các lớp ẩn tự biểu diễn những đặc trưng quan trọng của bài toán.
Các kiến trúc deep learning chính là gì?
Không có một “mạng nơ-ron sâu” duy nhất. Tuỳ loại dữ liệu, người ta chọn kiến trúc khác nhau.
| Kiến trúc | Dữ liệu phù hợp | Ý tưởng chính | Ví dụ ứng dụng |
|---|---|---|---|
| CNN (Convolutional Neural Network) – mạng tích chập | Ảnh, video, ảnh y khoa | Trượt các “bộ lọc” nhỏ khắp ảnh để tìm mẫu cục bộ như cạnh, góc, kết cấu ở mọi vị trí | Mở khoá bằng khuôn mặt, đọc phim X-quang, kiểm tra lỗi sản phẩm |
| RNN (Recurrent Neural Network) và LSTM | Chuỗi: câu chữ, âm thanh, số liệu cảm biến | Mang “bộ nhớ” từ bước trước sang bước sau; LSTM thêm các cổng để nhớ lâu hơn | Dự báo nhu cầu, gợi ý từ khi gõ phím, nhận dạng giọng nói thế hệ trước |
| Transformer | Văn bản, mã nguồn, giọng nói, cả ảnh | Cơ chế chú ý (attention) cho mỗi từ “nhìn” mọi từ khác cùng lúc, chạy song song tốt trên GPU | Dịch máy, chatbot, mô hình ngôn ngữ lớn, tóm tắt văn bản |
| GAN (Generative Adversarial Network) – mạng đối nghịch tạo sinh | Ảnh, dữ liệu tổng hợp | Hai mạng thi đấu: một mạng tạo dữ liệu giả, một mạng phân biệt thật giả | Tăng độ phân giải ảnh, tạo dữ liệu huấn luyện tổng hợp, deepfake |
| Diffusion – mô hình khuếch tán | Ảnh, âm thanh, video | Học khử nhiễu từng bước: từ ảnh nhiễu ngẫu nhiên “làm rõ” dần thành ảnh có nghĩa | Tạo ảnh từ mô tả văn bản như Stable Diffusion, sửa và mở rộng ảnh |
Vài điểm cần nhớ thêm. CNN là nền tảng của nhiều hệ thống nhận dạng chữ trong ảnh (OCR) hiện đại. RNN đọc từng từ theo thứ tự nên chậm và hay “quên” thông tin xa; Transformer khắc phục bằng cách xử lý song song. Trong bài báo gốc năm 2017, Transformer huấn luyện 3,5 ngày trên 8 GPU đã đạt kết quả dịch Anh – Pháp tốt nhất cho một mô hình đơn lẻ lúc đó, và nay là kiến trúc của các mô hình ngôn ngữ lớn (LLM). GAN và diffusion không chỉ nhận dạng mà còn sinh dữ liệu mới, là nền kỹ thuật của AI tạo sinh.
Deep learning và machine learning khác nhau thế nào?
Trả lời ngắn: học sâu là một phần của học máy, nhưng khác ở chỗ ai tìm ra đặc trưng của dữ liệu.
Lấy ví dụ lọc email rác. Với học máy truyền thống, kỹ sư tự chọn đặc trưng: số đường link, có chữ “khuyến mãi” không, tỷ lệ chữ in hoa; thuật toán chỉ học cách cân nhắc chúng. Với học sâu, bạn đưa thẳng nội dung email vào mạng, mạng tự tìm tín hiệu đáng chú ý, kể cả tín hiệu con người không nghĩ tới.
| Tiêu chí | Học máy truyền thống | Học sâu |
|---|---|---|
| Đặc trưng (feature) | Chuyên gia thiết kế thủ công | Mạng tự học từ dữ liệu thô |
| Lượng dữ liệu | Chạy tốt với vài trăm đến vài chục nghìn mẫu | Thường cần rất nhiều mẫu; ít dữ liệu dễ quá khớp |
| Dữ liệu mạnh nhất | Dạng bảng: doanh số, khách hàng, giao dịch | Phi cấu trúc: ảnh, âm thanh, văn bản, video |
| Phần cứng | CPU thông thường là đủ cho phần lớn bài toán | Cần GPU hoặc chip chuyên dụng để huấn luyện |
| Thời gian huấn luyện | Vài giây đến vài giờ | Vài giờ đến nhiều tuần |
| Khả năng giải thích | Dễ hơn: cây quyết định cho thấy từng nhánh lựa chọn | Khó, thường bị gọi là “hộp đen” |
| Chi phí | Thấp, nhóm nhỏ làm được | Cao hơn về hạ tầng, dữ liệu, nhân sự |
Khi nào chọn cái nào? Dữ liệu dạng bảng, số lượng vừa phải, cần giải thích được (như chấm điểm tín dụng): thử học máy truyền thống trước. Bài toán nhìn, nghe hoặc đọc (ảnh, giọng nói, văn bản tự do): học sâu gần như luôn tốt hơn. Nhiều doanh nghiệp không huấn luyện từ đầu mà tinh chỉnh mô hình đã huấn luyện sẵn.
Ứng dụng deep learning trong thực tế là gì?
Nhiều tính năng bạn dùng hằng ngày đã chạy bằng học sâu. Dưới đây là các lĩnh vực chính, kèm ví dụ tại Việt Nam có công bố rõ ràng.
Thị giác máy tính (computer vision)
Mở khoá bằng khuôn mặt, tự gắn thẻ người trong album, camera đếm lượt khách, đọc biển số xe. Trong nhà máy, camera kết hợp CNN kiểm tra từng sản phẩm trên băng chuyền thay mắt người, phát hiện vết xước, lệch nhãn.
Nhận dạng và tổng hợp giọng nói
Trợ lý ảo, phụ đề tự động, tổng đài tự động đều dùng mạng nơ-ron sâu để chuyển giọng nói thành chữ và ngược lại. Theo báo Người Quan Sát (02/2024), Viettel AI giành giải nhất phần nhận dạng giọng nói tự động tại cuộc thi xử lý ngôn ngữ và tiếng nói tiếng Việt VLSP 2023, lần thứ tư liên tiếp, với mô hình xử lý tiếng nói tiếng Việt tự xây dựng.
Xử lý ngôn ngữ tự nhiên (NLP)
Dịch máy, chatbot, tóm tắt văn bản, phân loại phản hồi khách hàng. Với tiếng Việt, PhoBERT do VinAI Research công bố tại EMNLP 2020 (nhánh Findings) là mô hình ngôn ngữ đơn ngữ tiếng Việt quy mô lớn đầu tiên phát hành công khai. Theo nhóm tác giả, PhoBERT tốt hơn mô hình đa ngôn ngữ XLM-R ở các bài toán như gán nhãn từ loại, nhận dạng thực thể có tên.
Y tế
Học sâu hỗ trợ bác sĩ đọc phim X-quang, CT, phát hiện tổn thương sớm. Bộ dữ liệu VinDr-CXR của Viện Nghiên cứu Dữ liệu lớn Vingroup (VinBigData), công bố trên tạp chí Scientific Data ngày 20/07/2022, gồm 18.000 phim X-quang ngực từ Bệnh viện 108 và Bệnh viện Đại học Y Hà Nội, do 17 bác sĩ chẩn đoán hình ảnh gán nhãn. Theo VnEconomy (06/2024), sản phẩm phân tích ảnh X-quang tuyến vú của nền tảng VinDr đã được Cục Quản lý Thực phẩm và Dược phẩm Mỹ (FDA) cấp phép. Không có hàng nghìn phim được chuyên gia gán nhãn dữ liệu cẩn thận, những mô hình này không thể học.
Xe tự hành và hỗ trợ lái
Xe tự hành chạy nhiều mạng nơ-ron cùng lúc: nhận diện làn đường, biển báo, người đi bộ từ camera; ước lượng khoảng cách từ cảm biến; dự đoán hướng đi của xe xung quanh. Ở mức phổ thông, cảnh báo lệch làn và phanh khẩn cấp tự động trên ô tô mới cũng dùng thị giác máy. Lĩnh vực này đòi độ tin cậy rất cao vì một lỗi nhận dạng có thể gây tai nạn.
Các lĩnh vực khác
Gợi ý sản phẩm và video trong thương mại điện tử; phát hiện giao dịch bất thường, xác thực khuôn mặt trong ngân hàng; nhận diện sâu bệnh qua ảnh lá cây trong nông nghiệp (ví dụ minh hoạ). Ở tầm chính sách, Quyết định 127/QĐ-TTg ngày 26/01/2021 về Chiến lược quốc gia về nghiên cứu, phát triển và ứng dụng trí tuệ nhân tạo đến năm 2030 đặt mục tiêu Việt Nam vào nhóm 4 nước dẫn đầu ASEAN và nhóm 50 nước dẫn đầu thế giới về lĩnh vực này.
Hạn chế của deep learning là gì?
Cần nhiều dữ liệu, và dữ liệu phải sạch
Mạng sâu có hàng triệu tham số nên cần rất nhiều ví dụ. Dữ liệu sai nhãn, lệch về một nhóm hoặc khác xa thực tế sẽ khiến mô hình học sai, đúng nguyên tắc “rác vào, rác ra”. Ví dụ minh hoạ: mô hình nhận diện khuôn mặt huấn luyện chủ yếu bằng ảnh người châu Âu có thể kém chính xác với người châu Á.
Chi phí tính toán
Huấn luyện mô hình lớn cần cụm GPU chạy nhiều ngày đến nhiều tuần, tốn điện và chi phí hạ tầng. Chạy mô hình (suy luận) cho hàng triệu người dùng cũng tốn tài nguyên. Doanh nghiệp nhỏ thường thuê GPU trên đám mây hoặc dùng mô hình có sẵn.
Hộp đen: khó giải thích
Mô hình kết luận “khoản vay rủi ro cao” nhưng khó chỉ ra chính xác vì sao, vì quyết định phân tán qua hàng triệu trọng số. Đây là trở ngại trong y tế, tài chính, pháp lý. Lĩnh vực AI giải thích được (explainable AI) có các kỹ thuật như bản đồ nhiệt chỉ vùng ảnh mô hình chú ý, nhưng chưa giải quyết triệt để.
Dễ bị đánh lừa ngoài vùng đã học
Thay đổi rất nhỏ trên ảnh, mắt người không thấy, có thể khiến mô hình phân loại sai. Camera nhận diện tốt ban ngày có thể sai nhiều khi trời mưa, ban đêm. Mô hình sinh văn bản còn có thể “ảo giác”, tạo thông tin nghe hợp lý nhưng sai.
Học và làm deep learning cần công cụ gì?
Bạn không phải tự viết thuật toán lan truyền ngược. Thư viện nguồn mở đã làm sẵn phần khó; bạn chỉ mô tả kiến trúc mạng và dữ liệu.
| Công cụ | Xuất xứ | Điểm mạnh | Phù hợp với |
|---|---|---|---|
| TensorFlow | Google mở mã nguồn ngày 09/11/2015, giấy phép Apache 2.0 | Triển khai rộng: máy chủ, điện thoại, trình duyệt | Đưa mô hình vào sản phẩm, ứng dụng di động |
| PyTorch | Phát hành năm 2016 bởi nhóm nghiên cứu AI của Facebook (nay là Meta); từ 12/09/2022 thuộc PyTorch Foundation của Linux Foundation | Viết như Python thông thường, dễ gỡ lỗi, rất phổ biến trong nghiên cứu | Thử nghiệm mô hình mới, tinh chỉnh mô hình có sẵn |
| Keras | Thư viện cấp cao; Keras 3 chạy trên JAX, TensorFlow hoặc PyTorch | Cú pháp gọn, vài dòng có mạng chạy được | Người mới, làm mẫu nhanh |
Lộ trình cho người mới: Python cơ bản; ma trận, đạo hàm, xác suất ở mức phổ thông; khái niệm học máy nền tảng; rồi thực hành một bài nhỏ như phân loại ảnh chữ số viết tay. Chưa có GPU, bạn có thể dùng môi trường notebook trên đám mây có GPU miễn phí với giới hạn thời gian.
Doanh nghiệp nên bắt đầu với deep learning thế nào?
- Chọn bài toán ảnh, giọng nói hoặc văn bản có khối lượng lớn, lặp lại: đọc chứng từ, phân loại phản hồi, kiểm tra lỗi sản phẩm.
- Kiểm kê dữ liệu: bao nhiêu mẫu, đã có nhãn chưa, chất lượng ra sao.
- Ưu tiên mô hình hoặc dịch vụ có sẵn, chỉ tinh chỉnh bằng dữ liệu riêng.
- Đo trên mẫu thật của bạn: độ chính xác, thời gian xử lý, tỷ lệ phải sửa tay.
- Giữ người kiểm soát quyết định quan trọng và theo dõi mô hình định kỳ, vì dữ liệu thực tế thay đổi theo thời gian.
Những hiểu lầm phổ biến về deep learning
- “Mạng nơ-ron hoạt động giống bộ não.” Chỉ giống ở ý tưởng ban đầu. Nơ-ron nhân tạo là phép tính đơn giản; não sinh học phức tạp hơn nhiều và học được từ vài ví dụ.
- “Học sâu nghĩa là máy hiểu sâu.” “Sâu” chỉ số lớp. Mô hình nắm quy luật thống kê, không có hiểu biết hay ý thức.
- “Cứ dùng học sâu là tốt hơn.” Với dữ liệu bảng, ít mẫu, thuật toán học máy truyền thống thường tương đương, rẻ và dễ giải thích hơn.
- “Càng nhiều dữ liệu càng tốt, bất kể chất lượng.” Dữ liệu nhiều mà sai nhãn sẽ làm mô hình sai một cách tự tin.
- “Phải có siêu máy tính.” Huấn luyện mô hình lớn từ đầu thì đúng, nhưng tinh chỉnh mô hình có sẵn hay gọi dịch vụ đám mây vừa sức nhiều doanh nghiệp.
Câu hỏi thường gặp
Học sâu là gì, có phải là deep learning không?
Đúng. Học sâu là tên tiếng Việt của deep learning: phương pháp học máy dùng mạng nơ-ron nhân tạo nhiều lớp để tự học đặc trưng từ dữ liệu.
Mạng nơ-ron sâu cần bao nhiêu lớp?
Không có ranh giới chính thức. Thường mạng có nhiều hơn một lớp ẩn được xem là “sâu”; mô hình hiện đại có thể có hàng chục đến hàng trăm lớp.
Deep learning và machine learning khác nhau ở điểm nào quan trọng nhất?
Ở khâu đặc trưng. Học máy truyền thống cần con người chọn đặc trưng; học sâu tự học từ dữ liệu thô, đổi lại cần nhiều dữ liệu, GPU hơn và khó giải thích hơn.
Deep learning có cần GPU không?
Để huấn luyện mô hình vừa và lớn trong thời gian hợp lý thì gần như bắt buộc, vì GPU làm song song rất nhiều phép nhân ma trận. Mô hình nhỏ hoặc chỉ chạy suy luận thì CPU vẫn dùng được.
ChatGPT có phải là deep learning không?
Có. ChatGPT dựa trên mô hình ngôn ngữ lớn xây bằng kiến trúc Transformer, một kiến trúc học sâu, huấn luyện trên lượng văn bản rất lớn.
Ai được xem là “cha đẻ” của deep learning?
Geoffrey Hinton, Yann LeCun và Yoshua Bengio, ba người cùng nhận giải Turing năm 2018. Hinton nhận thêm Nobel Vật lý 2024 cùng John Hopfield.
Deep learning có thay thế con người không?
Học sâu tự động hoá tốt việc nhận dạng, phân loại lặp lại, nhưng con người vẫn cần đặt bài toán, chuẩn bị dữ liệu, kiểm tra kết quả và chịu trách nhiệm với quyết định quan trọng.