Trả lời nhanh: Computer vision (thị giác máy tính) là lĩnh vực trí tuệ nhân tạo giúp máy tính đọc hiểu ảnh và video: nhận ra trong khung hình có gì, nằm ở đâu, đang làm gì. Ví dụ quen thuộc là điện thoại mở khoá bằng khuôn mặt hay camera giao thông tự phát hiện xe vượt đèn đỏ.
Điểm chính
- Với máy tính, ảnh chỉ là ma trận số. Computer vision biến ma trận đó thành nhãn, khung toạ độ, vùng điểm ảnh, danh tính hay tư thế.
- Bước ngoặt năm 2012: mạng nơ-ron tích chập AlexNet thắng ImageNet với lỗi top-5 15,3%, so với 26,2% của đội thứ hai.
- Bảy tác vụ chính: phân loại ảnh, phát hiện vật thể, phân đoạn, nhận diện khuôn mặt, theo dõi đối tượng, OCR, ước lượng tư thế.
- Từ 13/12/2025, Hà Nội vận hành 748 camera AI chuyên phát hiện vi phạm giao thông.
- Dữ liệu sinh trắc học, như đặc điểm khuôn mặt dùng để nhận dạng, là dữ liệu cá nhân nhạy cảm theo Nghị định 356/2025/NĐ-CP hướng dẫn Luật 91/2025/QH15.
Mục lục
- Computer vision là gì?
- Thị giác máy tính ra đời và phát triển như thế nào?
- Máy tính “nhìn” một bức ảnh như thế nào?
- Computer vision làm được những tác vụ nào?
- Ứng dụng computer vision trong các ngành ra sao?
- Triển khai một hệ thống computer vision cần những gì?
- Computer vision có những hạn chế gì?
- Dùng computer vision tại Việt Nam cần lưu ý gì về pháp lý?
- Doanh nghiệp nên bắt đầu áp dụng computer vision thế nào?
- Những hiểu lầm phổ biến về computer vision
- Câu hỏi thường gặp
Computer vision là gì?
Computer vision, tiếng Việt là thị giác máy tính, là nhánh của trí tuệ nhân tạo dạy máy tính trích xuất thông tin có ý nghĩa từ ảnh và video. Mục tiêu không phải chụp hay chỉnh ảnh, mà là hiểu nội dung: đây là xe máy, nó ở làn trái, người lái không đội mũ bảo hiểm.
Ví dụ: ứng dụng nông nghiệp nhìn ảnh lá cây bị đốm và gợi ý tên bệnh; siêu thị dùng camera đếm khách theo giờ; nhà máy dùng camera loại chai bị móp trên băng chuyền.
Thị giác máy tính là một lĩnh vực ứng dụng của trí tuệ nhân tạo, cùng hàng với xử lý ngôn ngữ hay nhận dạng giọng nói. Công cụ chính hiện nay là mạng nơ-ron nhiều lớp; cách các mạng này được huấn luyện có trong bài học sâu hoạt động ra sao.
Đừng nhầm với xử lý ảnh (image processing). Xử lý ảnh nhận ảnh và trả ra ảnh: làm nét, khử nhiễu, chỉnh sáng. Thị giác máy tính nhận ảnh và trả ra thông tin: “có 3 người”, “sản phẩm lỗi”. Xử lý ảnh thường là bước chuẩn bị cho thị giác máy tính.
Thị giác máy tính ra đời và phát triển như thế nào?
- Tháng 7/1966 – Summer Vision Project: Seymour Papert tại Phòng thí nghiệm AI của Viện Công nghệ Massachusetts (MIT) viết bản ghi nhớ AIM-100, đặt mục tiêu cho nhóm làm việc mùa hè xây dựng “một phần đáng kể của hệ thống thị giác”: tách ảnh thành vùng vật thể và nền, rồi gọi tên vật thể. Bài toán tưởng xong trong một mùa hè hoá ra kéo dài nhiều thập kỷ.
- Năm 2009 – ImageNet: nhóm Jia Deng, Fei-Fei Li công bố tại hội nghị CVPR 2009 bộ dữ liệu ImageNet, khi đó gồm 3,2 triệu ảnh thuộc 5.247 nhóm khái niệm. Lần đầu có kho ảnh gán nhãn đủ lớn để mô hình “thấy nhiều”.
- Năm 2012 – AlexNet: Krizhevsky, Sutskever và Hinton huấn luyện mạng nơ-ron tích chập 8 lớp, 60 triệu tham số trên khoảng 1,2 triệu ảnh của 1.000 lớp. Tại ILSVRC-2012, mô hình đạt lỗi top-5 15,3%, đội thứ hai 26,2%. Từ đây, học sâu thay thế đặc trưng do người thiết kế.
- Năm 2015 – YOLO: Joseph Redmon và cộng sự công bố YOLO (You Only Look Once), phát hiện vật thể trong một lần chạy, bản gốc đạt 45 khung hình mỗi giây, mở đường cho xử lý thời gian thực trên camera.
- Hiện nay: mô hình đa phương thức hiểu cả ảnh lẫn chữ, mô tả được ảnh bằng câu. Hệ thống công nghiệp vẫn chủ yếu dùng mô hình chuyên biệt vì nhanh, rẻ, dễ kiểm soát.
Máy tính “nhìn” một bức ảnh như thế nào?
Một ảnh 1920×1080 có khoảng 2 triệu điểm ảnh (pixel). Mỗi điểm là một số độ sáng từ 0 đến 255; ảnh màu có ba kênh đỏ, lục, lam (RGB). Máy không thấy “chiếc xe”, nó chỉ thấy hàng triệu con số, và phải tìm ra đặc trưng (feature) như cạnh, góc, vệt màu. Trước 2012, kỹ sư tự viết công thức tìm đặc trưng. Nay mạng nơ-ron tự học chúng từ dữ liệu có nhãn.
Kiến trúc kinh điển là mạng nơ-ron tích chập (Convolutional Neural Network, CNN): các bộ lọc nhỏ trượt khắp ảnh, mỗi bộ lọc “bắt” một kiểu mẫu hình. Lớp đầu tìm cạnh, lớp giữa ghép thành bánh xe, đèn pha, lớp sâu ghép thành hình chiếc xe máy.
Mô hình học bằng cách đoán nhãn, so với đáp án rồi chỉnh bộ lọc, lặp lại hàng triệu lần. Ngoài CNN, Vision Transformer chia ảnh thành các ô nhỏ và xử lý như một chuỗi. Điều quan trọng với người làm ứng dụng: mô hình chỉ giỏi trên loại ảnh nó đã được học.
Computer vision làm được những tác vụ nào?
Mỗi tác vụ cần kiểu dữ liệu gán nhãn và chi phí khác nhau, nên cần chọn đúng ngay từ đầu.
| Tác vụ | Đầu ra | Ví dụ ứng dụng |
|---|---|---|
| Phân loại ảnh (image classification) | Một hoặc vài nhãn cho cả ảnh, kèm xác suất | Sản phẩm đạt hay lỗi, phân loại trái cây |
| Phát hiện vật thể (object detection) | Khung, nhãn, điểm tin cậy cho từng vật | Đếm xe theo làn, phát hiện người không đội mũ bảo hộ |
| Phân đoạn ảnh (image segmentation) | Mặt nạ (mask) gán nhãn từng điểm ảnh | Khoanh vùng tổn thương trên phim chụp, đo vết nứt |
| Nhận diện khuôn mặt (face recognition) | So khớp với ảnh mẫu (1:1) hoặc tìm trong danh sách (1:N) | Mở khoá điện thoại, chấm công, eKYC |
| Theo dõi đối tượng (object tracking) | Mã định danh và quỹ đạo của vật qua nhiều khung hình | Đếm khách không trùng, đo tốc độ xe |
| Nhận dạng ký tự (OCR) | Văn bản đọc từ ảnh | Đọc biển số, hoá đơn giấy, mã vận đơn |
| Ước lượng tư thế (pose estimation) | Toạ độ điểm khớp: vai, khuỷu tay, đầu gối | Phát hiện người ngã, chấm động tác tập luyện |
- Phát hiện khuôn mặt khác nhận diện khuôn mặt. Phát hiện chỉ trả lời “có mặt người”. Nhận diện trả lời “đây là ai”, và khi đó dữ liệu trở thành sinh trắc học.
- OCR là tác vụ con chuyên đọc chữ. Cách tăng độ chính xác với tiếng Việt và chọn công cụ có trong bài nhận dạng ký tự quang học.
- Các tác vụ thường ghép với nhau. Đọc biển số = phát hiện xe, phát hiện vùng biển, rồi OCR.
Ứng dụng computer vision trong các ngành ra sao?
Sản xuất: kiểm tra lỗi sản phẩm
Camera trên băng chuyền chụp từng sản phẩm, mô hình phát hiện vết xước, móp, lệch nhãn, thiếu linh kiện rồi ra lệnh gạt sản phẩm lỗi, không mỏi mắt sau tám tiếng như người. Ví dụ minh hoạ: xưởng đóng chai dùng phát hiện vật thể kiểm tra nắp, nhãn và OCR đọc hạn sử dụng. Đây là thành phần điển hình của nhà máy thông minh. Khó nhất là lỗi hiếm, ít ảnh để học; các nhóm kỹ thuật thường dùng mô hình phát hiện bất thường chỉ học ảnh sản phẩm tốt.
Bán lẻ
Đếm khách theo khung giờ, đo vùng được ghé nhiều, phát hiện kệ hết hàng, nhận diện rau quả ở quầy tự thanh toán. Nếu chỉ cần đếm người, hãy dùng phát hiện người và lưu số liệu tổng hợp, không nhận diện danh tính: rẻ hơn và ít rủi ro pháp lý hơn.
Giao thông: camera phạt nguội
Theo báo Thanh tra ngày 13/12/2025, Công an TP Hà Nội chính thức vận hành hệ thống camera AI cùng Trung tâm điều khiển giao thông thông minh, gồm 1.837 camera các loại, trong đó 748 camera AI chuyên dụng giám sát, xử lý vi phạm. Camera tự phân tích hình ảnh, lưu dữ liệu tối đa 75 ngày, phát hiện được 28 hành vi vi phạm. Phòng Cảnh sát giao thông cho biết mục tiêu không chỉ là “phạt nguội” mà còn giảm ùn tắc.
Theo VnEconomy ngày 21/01/2025, Quyết định 319/QĐ-UBND ngày 17/01/2025 của UBND TP Hà Nội phê duyệt đề án quản lý camera giám sát tập trung; đề án nêu 23.736 camera giám sát bảo đảm an ninh, trật tự giao thông, camera an ninh được tích hợp AI nhận diện khuôn mặt, biển số xe. Về kỹ thuật, camera phạt nguội ghép phát hiện phương tiện, theo dõi quỹ đạo và OCR biển số.
Y tế: chẩn đoán hình ảnh
Thị giác máy tính giúp bác sĩ khoanh vùng tổn thương nghi ngờ trên X-quang, CT, MRI. Bộ dữ liệu VinDr-CXR của Viện Nghiên cứu Dữ liệu lớn Vingroup (VinBigData), công bố trên Scientific Data ngày 20/07/2022, gồm 18.000 phim X-quang ngực từ Bệnh viện 108 và Bệnh viện Đại học Y Hà Nội, do 17 bác sĩ chẩn đoán hình ảnh gán nhãn. Theo VnEconomy (06/2024), sản phẩm phân tích X-quang tuyến vú của VinDr đã được FDA Mỹ cấp phép. AI chỉ hỗ trợ; quyết định chẩn đoán vẫn thuộc về bác sĩ.
Nông nghiệp
Ảnh drone, vệ tinh theo dõi sức khoẻ cây trồng, phát hiện vùng sâu bệnh; ứng dụng chụp lá gợi ý bệnh hại; dây chuyền phân loại nông sản theo kích cỡ, màu, vết thâm. Ánh sáng ngoài trời thay đổi liên tục nên mô hình cần dữ liệu thu tại địa phương.
An ninh và các lĩnh vực khác
Kiểm soát ra vào bằng khuôn mặt, phát hiện xâm nhập vùng cấm, cảnh báo khói. Ngân hàng dùng xác thực khuôn mặt khi mở tài khoản trực tuyến. Kho vận đọc mã vận đơn, đo kích thước kiện hàng. Ô tô mới dùng camera cảnh báo lệch làn.
Triển khai một hệ thống computer vision cần những gì?
Camera và hiện trường
Phần lớn lỗi nằm ở hiện trường, không ở mô hình. Hãy xác định trước: độ phân giải đủ cho vật nhỏ nhất cần thấy; ánh sáng ổn định (đèn chuyên dụng thường giúp nhiều hơn đổi mô hình); góc đặt và tốc độ chụp với vật chuyển động; mạng và nguồn điện. Khi camera nằm trong mạng thiết bị kết nối, nên thiết kế cùng kiến trúc IoT của doanh nghiệp.
Xử lý tại biên hay trên đám mây?
| Tiêu chí | Tại biên (edge) | Đám mây (cloud) |
|---|---|---|
| Nơi chạy mô hình | Trong camera thông minh hoặc máy tính nhỏ cạnh camera | Máy chủ nhà cung cấp |
| Độ trễ | Rất thấp, hợp gạt sản phẩm lỗi | Phụ thuộc đường truyền |
| Băng thông | Chỉ gửi kết quả, ảnh sự kiện | Phải gửi luồng ảnh, video |
| Quyền riêng tư | Ảnh gốc có thể không rời hiện trường | Cần xem nơi lưu trữ, chuyển dữ liệu xuyên biên giới |
| Sức mạnh tính toán | Hạn chế, cần mô hình gọn | Dễ mở rộng |
Nhiều hệ thống chọn kiến trúc lai: suy luận tại biên, gửi ảnh khó và số liệu tổng hợp lên điện toán đám mây để lưu trữ và huấn luyện lại.
Dữ liệu và gán nhãn
Phân loại cần một nhãn mỗi ảnh; phát hiện vật thể cần vẽ khung từng vật; phân đoạn cần tô viền từng điểm ảnh, tốn công hơn nhiều lần. Quy trình và kiểm soát chất lượng nhãn có trong bài gán nhãn dữ liệu. Ba nguyên tắc: thu ảnh tại đúng hiện trường, đủ ca sáng tối, mưa nắng; viết hướng dẫn gán nhãn rõ (vật bị che một nửa có vẽ khung không); tách riêng bộ kiểm thử mô hình không được học.
Đo độ chính xác bằng chỉ số nào?
- Precision (độ chuẩn): trong các lần báo “lỗi”, bao nhiêu phần trăm đúng là lỗi. Thấp nghĩa là báo động giả nhiều.
- Recall (độ phủ): trong các lỗi thật, bắt được bao nhiêu. Thấp nghĩa là để lọt lỗi.
- IoU và mAP: IoU đo mức trùng giữa khung dự đoán và khung đúng; mAP là chỉ số tổng hợp để so sánh mô hình phát hiện vật thể.
Chọn chỉ số theo chi phí sai lầm: kiểm tra linh kiện an toàn thì ưu tiên recall; phạt vi phạm thì precision phải rất cao và có người xác minh.
Computer vision có những hạn chế gì?
- Điều kiện hình ảnh: ánh sáng yếu, ngược sáng, mưa, ống kính bẩn, vật bị che đều làm kết quả giảm. Camera lệch vài độ cũng đủ đếm sai.
- Dữ liệu trôi dạt: đổi bao bì, đổi bố trí kệ, đổi mùa vụ khiến độ chính xác giảm dần mà không ai báo.
- Bị đánh lừa: ảnh in hay video phát lại có thể lừa hệ thống khuôn mặt thiếu chống giả mạo (liveness detection).
- Quyền riêng tư và chi phí: camera ghi cả người không liên quan; chi phí gồm camera, đèn, máy tính tại biên, gán nhãn, vận hành và huấn luyện lại.
Thiên lệch trong nhận diện khuôn mặt
Nghiên cứu Gender Shades của Joy Buolamwini và Timnit Gebru (hội nghị FAT* 2018) đánh giá 3 hệ thống thương mại: tỷ lệ lỗi phân loại giới tính với phụ nữ da sẫm màu lên tới 34,7%, trong khi mức cao nhất với nam giới da sáng màu là 0,8%. Ngày 19/12/2019, Viện Tiêu chuẩn và Công nghệ Quốc gia Mỹ (NIST) công bố đánh giá 189 thuật toán của 99 nhà phát triển trên 18,27 triệu ảnh: ở đối chiếu 1:1, nhiều thuật toán nhận nhầm khuôn mặt người châu Á và người Mỹ gốc Phi nhiều hơn 10 đến 100 lần so với người da trắng; một số thuật toán phát triển tại châu Á không có chênh lệch lớn này. Bài học: hãy kiểm thử trên khuôn mặt, ánh sáng và camera thật của bạn.
Dùng computer vision tại Việt Nam cần lưu ý gì về pháp lý?
Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15 và Nghị định 356/2025/NĐ-CP
Luật số 91/2025/QH15 được thông qua ngày 26/06/2025, hiệu lực từ 01/01/2026. Các điều liên quan trực tiếp:
- Điều 2 khoản 1 và 3: dữ liệu cá nhân là thông tin xác định hoặc giúp xác định một con người cụ thể; dữ liệu nhạy cảm là dữ liệu gắn với quyền riêng tư, thuộc danh mục do Chính phủ ban hành.
- Điều 31: dữ liệu sinh trắc học là dữ liệu về thuộc tính vật lý, đặc điểm sinh học cá biệt và ổn định để xác định một người. Bên thu thập phải bảo mật thiết bị lưu trữ, hạn chế quyền truy cập, có hệ thống phát hiện xâm phạm.
- Điều 32: ghi hình nơi công cộng được làm không cần đồng ý trong một số trường hợp như bảo đảm trật tự, an toàn xã hội, nhưng phải thông báo để người dân biết mình bị ghi hình (trừ khi luật quy định khác), dùng đúng mục đích, chỉ lưu trong thời gian cần thiết.
- Điều 30: xử lý dữ liệu cá nhân bằng AI phải đúng mục đích, trong phạm vi cần thiết và phân loại theo mức độ rủi ro.
- Điều 8: phạt tối đa 03 tỷ đồng với tổ chức cho phần lớn vi phạm; vi phạm chuyển dữ liệu xuyên biên giới tới 5% doanh thu năm trước liền kề.
Nghị định 356/2025/NĐ-CP ngày 31/12/2025 cụ thể hoá danh mục: Điều 4 khoản 1 điểm đ xếp “dữ liệu sinh trắc học, đặc điểm di truyền” vào nhóm nhạy cảm, còn Điều 3 khoản 6 xếp “hình ảnh của cá nhân” vào nhóm cơ bản.
Phân biệt quan trọng: ảnh, video có mặt người là dữ liệu cá nhân cơ bản. Khi hệ thống trích đặc điểm khuôn mặt để xác định người đó là ai, như chấm công hay nhận diện khách quen, dữ liệu trở thành sinh trắc học, thuộc nhóm nhạy cảm. Nội dung mang tính tham khảo; dự án cụ thể nên được pháp chế rà soát.
Luật Trí tuệ nhân tạo 134/2025/QH15
Luật được thông qua ngày 10/12/2025, hiệu lực từ 01/03/2026, không áp dụng cho AI chỉ phục vụ quốc phòng, an ninh, cơ yếu. Điểm cần nắm:
- Điều 9: ba mức rủi ro cao, trung bình, thấp, xét theo tác động đến quyền con người, an toàn, lĩnh vực và quy mô sử dụng. Danh mục rủi ro cao do Thủ tướng quy định (Điều 13 khoản 4).
- Điều 10: nhà cung cấp tự phân loại trước khi đưa vào sử dụng; hệ thống rủi ro trung bình, cao phải thông báo Bộ Khoa học và Công nghệ qua Cổng thông tin một cửa về AI.
- Điều 14: hệ thống rủi ro cao phải quản trị dữ liệu huấn luyện, lưu hồ sơ kỹ thuật, nhật ký, cho phép con người giám sát và can thiệp.
- Điều 7 khoản 3: cấm thu thập, xử lý dữ liệu để huấn luyện, vận hành AI trái pháp luật về dữ liệu, bảo vệ dữ liệu cá nhân, sở hữu trí tuệ. Bộ ảnh huấn luyện cũng phải có nguồn gốc hợp pháp.
- Điều 35: hệ thống đã chạy trước 01/03/2026 có 18 tháng để tuân thủ nếu thuộc y tế, giáo dục, tài chính; 12 tháng với lĩnh vực khác.
Doanh nghiệp nên bắt đầu áp dụng computer vision thế nào?
- Chọn bài toán hẹp, đo được, như “phát hiện chai thiếu nắp ở dây chuyền 2”.
- Đo hiện trạng: tỷ lệ lỗi lọt, thời gian kiểm tra, chi phí sai sót.
- Chọn tác vụ đơn giản nhất đủ dùng: phân loại trước, cần vị trí mới phát hiện vật thể.
- Rà soát dữ liệu cá nhân từ đầu: không cần biết ai là ai thì đừng thu, hoặc làm mờ mặt tại biên.
- Thu và gán nhãn dữ liệu tại hiện trường thật.
- Thử 2 đến 3 phương án trên cùng bộ kiểm thử.
- Thí điểm song song cách làm cũ, có người xác minh.
- Mở rộng và giám sát: theo dõi precision, recall, huấn luyện lại định kỳ, lập hồ sơ phân loại rủi ro.
Những hiểu lầm phổ biến về computer vision
- “Lắp camera là AI tự hiểu.” Mô hình chỉ nhận ra thứ đã học; lỗi đặc thù cần dữ liệu của chính nhà máy bạn.
- “Độ chính xác 99% của nhà cung cấp sẽ đúng với tôi.” Con số đó đo trên dữ liệu của họ.
- “Computer vision là nhận diện khuôn mặt.” Kiểm tra lỗi, đếm hàng, đọc mã đều không cần biết ai là ai.
- “Huấn luyện một lần là xong.” Hiện trường thay đổi, mô hình cần giám sát và cập nhật.
Câu hỏi thường gặp
Thị giác máy tính là gì, có phải là computer vision không?
Đúng. Thị giác máy tính là cách dịch của computer vision, đôi khi gọi là thị giác máy. Đây là lĩnh vực giúp máy tính hiểu nội dung ảnh và video.
Computer vision và nhận diện hình ảnh có giống nhau không?
Nhận diện hình ảnh (image recognition) thường chỉ việc xác định ảnh chứa gì, gần với phân loại ảnh. Computer vision rộng hơn, gồm cả phát hiện vật thể, phân đoạn, theo dõi, ước lượng tư thế.
Object detection khác image classification thế nào?
Phân loại ảnh cho một nhãn cho cả ảnh. Phát hiện vật thể trả về khung, nhãn và điểm tin cậy cho từng vật, nên biết vật ở đâu và đếm được số lượng.
Computer vision có cần học sâu không?
Không bắt buộc. Bài toán đơn giản trong điều kiện kiểm soát vẫn giải được bằng xử lý ảnh truyền thống. Với ảnh thực tế đa dạng, học sâu gần như luôn tốt hơn.
Chấm công bằng nhận diện khuôn mặt có hợp pháp không?
Có thể, nhưng đặc điểm khuôn mặt dùng để nhận dạng là dữ liệu sinh trắc học, thuộc nhóm nhạy cảm theo Nghị định 356/2025/NĐ-CP. Doanh nghiệp cần căn cứ xử lý hợp pháp, thường là sự đồng ý của người lao động, thông báo rõ mục đích, bảo mật theo Điều 31 Luật 91/2025/QH15 và nên có phương án thay thế.
Doanh nghiệp nhỏ có áp dụng được không?
Được. Nhiều dịch vụ đám mây và mô hình nguồn mở có sẵn tác vụ phát hiện người, đọc chữ, đọc mã. Hãy thí điểm trên một camera rồi mới mở rộng.
Cần bao nhiêu ảnh để huấn luyện mô hình?
Không có con số chung. Tinh chỉnh mô hình có sẵn cần ít ảnh hơn nhiều so với huấn luyện từ đầu. Quan trọng hơn số lượng là độ đa dạng về ánh sáng, góc chụp và trường hợp khó.