Data science là gì? Khoa học dữ liệu, quy trình và nghề

Trả lời nhanh: Data science (khoa học dữ liệu) là lĩnh vực kết hợp thống kê, lập trình và hiểu biết nghiệp vụ để rút ra tri thức và dự báo có ích từ dữ liệu, ví dụ phân tích lịch sử mua hàng để biết khách nào sắp rời bỏ và nên giữ chân họ bằng cách nào.

Điểm chính

  • Data science không chỉ là “chạy mô hình”. Nó bắt đầu từ câu hỏi kinh doanh và kết thúc bằng quyết định hoặc sản phẩm dùng được.
  • Ba trụ cột là toán và thống kê, lập trình, hiểu biết nghiệp vụ. Thiếu một trụ, kết quả dễ sai hoặc vô dụng.
  • CRISP-DM, khung quy trình ra đời cuối năm 1996, chia dự án thành 6 giai đoạn có vòng lặp, từ hiểu nghiệp vụ tới triển khai.
  • Tại Việt Nam, Khoa học dữ liệu đã có mã ngành đại học riêng là 7460108 theo Thông tư 09/2022/TT-BGDĐT.
  • Thách thức lớn nhất thường không nằm ở thuật toán mà ở chất lượng dữ liệu, thiên lệch và tuân thủ pháp luật về dữ liệu cá nhân.
Mục lục
  1. Data science là gì?
  2. Thuật ngữ data science ra đời từ đâu?
  3. Khoa học dữ liệu gồm những mảng kiến thức nào?
  4. Quy trình khoa học dữ liệu diễn ra như thế nào?
  5. Data science khác data analytics, machine learning, AI và data engineering thế nào?
  6. Data scientist là gì? Các vai trò nghề trong ngành dữ liệu
  7. Học data science cần những kỹ năng và công cụ gì?
  8. Ứng dụng data science trong các ngành như thế nào?
  9. Ngành khoa học dữ liệu ở Việt Nam đào tạo ở đâu?
  10. Lộ trình tự học data science cho người mới bắt đầu
  11. Thách thức khi làm data science là gì?
  12. Câu hỏi thường gặp

Data science là gì?

Data science là gì? Hiểu ngắn gọn, đó là cách dùng phương pháp khoa học để biến dữ liệu thô thành hiểu biết và hành động. Người làm data science đặt câu hỏi, thu thập và làm sạch dữ liệu, phân tích, xây mô hình, rồi truyền đạt kết quả để người khác ra quyết định.

Viện Tiêu chuẩn và Công nghệ Quốc gia Hoa Kỳ (NIST), trong bộ khung tương tác dữ liệu lớn phiên bản 3 công bố tháng 10/2019, định nghĩa data science là phương pháp tổng hợp tri thức hữu ích trực tiếp từ dữ liệu, thông qua quá trình khám phá hoặc đặt giả thuyết rồi kiểm định giả thuyết. Điểm mấu chốt nằm ở chữ “khoa học”: có giả thuyết, có kiểm chứng, có thể lặp lại.

“Khoa học dữ liệu là gì” và “data science là gì” thực chất là cùng một câu hỏi; hai cách gọi được dùng song song.

Ví dụ dễ hiểu về data science

Giả sử một chuỗi siêu thị muốn giảm lượng hàng tươi sống bị huỷ cuối ngày (ví dụ minh hoạ). Nhóm dữ liệu sẽ:

  1. Đặt câu hỏi: ngày mai mỗi cửa hàng nên nhập bao nhiêu kg rau, thịt?
  2. Gom dữ liệu bán hàng, lịch khuyến mãi, ngày lễ, thời tiết; loại các ngày hệ thống lỗi.
  3. Xây mô hình dự báo nhu cầu theo từng cửa hàng và mặt hàng.
  4. Thử vài tuần, so với thực tế, rồi đưa vào phần mềm đặt hàng.

Kết quả không phải một biểu đồ đẹp mà là quyết định tốt hơn mỗi ngày.

Thuật ngữ data science ra đời từ đâu?

Khoa học dữ liệu không xuất hiện từ hư không. Nó lớn lên từ thống kê và khoa học máy tính qua nhiều thập kỷ. Theo tổng hợp “A Very Short History of Data Science” của Gil Press trên Forbes (2013), các mốc đáng chú ý gồm:

  • Năm 1962: nhà thống kê John Tukey viết “The Future of Data Analysis”, cho rằng phân tích dữ liệu về bản chất là một khoa học thực nghiệm, không chỉ là toán học.
  • Năm 1974: nhà khoa học máy tính Peter Naur dùng thuật ngữ data science trong cuốn “Concise Survey of Computer Methods”, hiểu là khoa học xử lý dữ liệu.
  • Năm 2001: William S. Cleveland đề xuất mở rộng ngành thống kê bằng cách kết hợp với khoa học máy tính và gọi lĩnh vực mở rộng đó là data science.
  • Năm 2008: DJ Patil và Jeff Hammerbacher chọn chức danh “data scientist” cho đội ngũ của họ tại LinkedIn và Facebook.
  • Tháng 10/2012: Thomas H. Davenport và DJ Patil đăng bài “Data Scientist: The Sexiest Job of the 21st Century” trên Harvard Business Review, đưa nghề này ra công chúng.

Sự bùng nổ sau năm 2010 gắn với dữ liệu số tăng nhanh và chi phí tính toán giảm; xem thêm bài về dữ liệu lớn và đặc điểm 5V.

Khoa học dữ liệu gồm những mảng kiến thức nào?

Cách giải thích phổ biến nhất là sơ đồ Venn do Drew Conway công bố ngày 30/09/2010. Ông cho rằng data science nằm ở giao điểm của ba nhóm năng lực.

Data science nằm ở giao điểm của ba nhóm năng lực Lập trình xử lý dữ liệu (hacking skills) Toán và thống kê (math, statistics) Hiểu biết nghiệp vụ (substantive expertise) Machine learning Vùng nguy hiểm Nghiên cứu truyền thống Data science Phỏng theo sơ đồ Venn của Drew Conway (30/09/2010)
Thiếu một trong ba nhóm năng lực, kết quả không còn là data science: thiếu nghiệp vụ chỉ còn kỹ thuật mô hình, thiếu thống kê dễ rơi vào “vùng nguy hiểm”.
  • Lập trình và xử lý dữ liệu (hacking skills): lấy dữ liệu từ nhiều nguồn, xử lý tệp lớn, tư duy thuật toán.
  • Toán và thống kê: chọn đúng phương pháp và hiểu kết quả có nghĩa gì. Theo Conway, tối thiểu bạn phải biết hồi quy bình phương nhỏ nhất là gì và đọc nó thế nào.
  • Hiểu biết nghiệp vụ (substantive expertise): biết đặt câu hỏi đúng về thế giới thực, ví dụ về tín dụng, bán lẻ hay y tế, rồi đem giả thuyết đi kiểm chứng bằng dữ liệu.

Các vùng giao nhau cũng có ý nghĩa. Lập trình cộng thống kê mà không có nghiệp vụ chỉ cho ra kỹ thuật học máy. Thống kê cộng nghiệp vụ mà không có lập trình là kiểu nghiên cứu truyền thống. Đáng lo nhất là “vùng nguy hiểm”: người biết lấy dữ liệu và hiểu lĩnh vực, chạy được hồi quy, nhưng không hiểu các hệ số nói gì. Họ có thể tạo ra phân tích trông rất thuyết phục nhưng sai.

Quy trình khoa học dữ liệu diễn ra như thế nào?

Khung quy trình được dùng rộng rãi nhất là CRISP-DM (Cross-Industry Standard Process for Data Mining). Theo tài liệu hướng dẫn CRISP-DM 1.0, khung này được hình thành cuối năm 1996 bởi đại diện DaimlerChrysler, SPSS và NCR, sau đó có thêm công ty bảo hiểm OHRA tham gia. Tên gọi có chữ “data mining” nhưng cấu trúc của nó áp dụng tốt cho hầu hết dự án data science hiện nay.

Vòng đời dự án khoa học dữ liệu theo CRISP-DM 1. Hiểu nghiệp vụ Business understanding Chốt câu hỏi kinh doanh, mục tiêu và cách đo thành công 2. Hiểu dữ liệu Data understanding Thu thập, khám phá, phát hiện lỗi chất lượng dữ liệu 3. Chuẩn bị dữ liệu Data preparation Làm sạch, ghép bảng, tạo biến; thường phải làm lại nhiều lần 4. Mô hình hoá Modeling Chọn kỹ thuật, huấn luyện, tinh chỉnh tham số 5. Đánh giá Evaluation Mô hình có giải quyết đúng bài toán kinh doanh không? 6. Triển khai Deployment Đưa vào vận hành hoặc báo cáo; giám sát, bảo trì mô hình Chưa đạt: quay lại bước 1 Dữ liệu ở trung tâm Mũi tên hai chiều: hai bước thường phải quay lại lẫn nhau
Sáu giai đoạn của CRISP-DM. Thứ tự không cứng nhắc: nhóm dự án thường đi tới đi lui giữa các bước, đặc biệt giữa chuẩn bị dữ liệu và mô hình hoá.

1. Hiểu nghiệp vụ (business understanding)

Bước này chuyển mục tiêu kinh doanh thành một bài toán dữ liệu. “Tăng doanh thu” là quá mơ hồ. “Dự đoán khách nào có khả năng ngừng mua trong 60 ngày tới để gửi ưu đãi giữ chân” là bài toán làm được. Bạn cũng cần chốt cách đo thành công ngay từ đầu.

2. Hiểu dữ liệu (data understanding)

Thu thập dữ liệu ban đầu, xem phân bố, tìm giá trị thiếu, giá trị bất thường. Theo hướng dẫn CRISP-DM, mục tiêu của bước này là làm quen với dữ liệu và phát hiện sớm các vấn đề chất lượng.

3. Chuẩn bị dữ liệu (data preparation)

Làm sạch, ghép nhiều bảng, xử lý dữ liệu thiếu, tạo biến mới (feature engineering). Tài liệu CRISP-DM nói rõ các tác vụ chuẩn bị dữ liệu thường phải làm nhiều lần và không theo thứ tự cố định. Trên thực tế, đây hay là bước tốn công nhất.

4. Mô hình hoá (modeling)

Chọn một hoặc vài kỹ thuật như hồi quy, cây quyết định, phân cụm, rồi huấn luyện và tinh chỉnh tham số. Mỗi kỹ thuật có yêu cầu riêng về dạng dữ liệu, nên nhóm thường phải quay lại bước 3.

5. Đánh giá (evaluation)

Một mô hình có độ chính xác cao chưa chắc giải quyết được bài toán kinh doanh. Theo CRISP-DM, mục tiêu chính của bước này là kiểm tra xem còn vấn đề kinh doanh quan trọng nào chưa được xem xét đủ hay không. Nếu chưa đạt, dự án quay lại bước 1.

6. Triển khai (deployment)

Kết quả có thể là báo cáo, dashboard hoặc mô hình chạy tự động trong hệ thống. Mô hình cần được giám sát vì hành vi khách hàng thay đổi theo thời gian.

CRISP-DM không phải khung duy nhất; năm 2015 IBM giới thiệu ASUM-DM để mở rộng nó. Khi mô hình đã chạy thật, giữ đường ống dữ liệu ổn định là phạm vi của DataOps.

Data science khác data analytics, machine learning, AI và data engineering thế nào?

Cách dễ nhớ: AI là mục tiêu lớn, machine learning là một nhóm kỹ thuật, data analytics trả lời câu hỏi về quá khứ, data engineering lo đường ống dữ liệu, còn data science bao trùm quy trình từ câu hỏi tới mô hình và hành động.

Lĩnh vựcCâu hỏi chínhĐầu ra điển hìnhCông cụ thường dùng
Data scienceĐiều gì sẽ xảy ra, vì sao, và nên làm gì?Mô hình dự báo, thử nghiệm A/B, khuyến nghị hành độngPython, R, SQL, scikit-learn, Jupyter
Data analyticsĐiều gì đã xảy ra và vì sao?Báo cáo, dashboard, phân tích nguyên nhânSQL, Excel, Power BI, Tableau
Machine learningLàm sao để máy tự học quy luật từ dữ liệu?Mô hình phân loại, hồi quy, phân cụmscikit-learn, PyTorch, TensorFlow
Trí tuệ nhân tạo (AI)Làm sao để máy thực hiện tác vụ cần trí tuệ người?Hệ thống nhận diện, chatbot, trợ lý tự độngMô hình học sâu, mô hình ngôn ngữ lớn, nền tảng AI
Data engineeringLàm sao để dữ liệu đúng, đủ, đến đúng chỗ?Đường ống ETL/ELT, kho dữ liệu, data lakeSQL, Spark, Airflow, Kafka, dịch vụ đám mây
  • Data science và data analytics: NIST coi phân tích là một bước trong quy trình data science. Khác biệt chủ yếu nằm ở độ sâu thống kê và mô hình dự báo.
  • Data science và machine learning: machine learning là công cụ, data science là cách dùng công cụ đó cho đúng bài toán. Phần nguyên lý và thuật toán được giải thích chi tiết trong bài học máy hoạt động ra sao.
  • Data science và AI: nhiều dự án data science không dùng AI, ví dụ một phân tích hồi quy tìm yếu tố ảnh hưởng doanh số. Bức tranh rộng hơn có trong bài trí tuệ nhân tạo là gì.
  • Data science và data engineering: data engineer xây “đường ống và bể chứa”, data scientist dùng nước trong bể. Nơi chứa dữ liệu thô đa dạng thường là data lake, còn dữ liệu đã chuẩn hoá cho báo cáo nằm trong kho dữ liệu.

Data scientist là gì? Các vai trò nghề trong ngành dữ liệu

Data scientist là người dùng thống kê, lập trình và hiểu biết nghiệp vụ để trả lời câu hỏi kinh doanh bằng dữ liệu, thường bao gồm xây và đánh giá mô hình dự báo. Trong một nhóm dữ liệu, họ làm việc cùng ba vai trò khác:

Vai tròViệc chínhKỹ năng cốt lõiCông cụ hay gặp
Data analyst (chuyên viên phân tích dữ liệu)Trả lời câu hỏi kinh doanh, làm báo cáo và dashboardSQL, thống kê mô tả, trực quan hoá, hiểu nghiệp vụExcel, SQL, Power BI, Tableau, Looker Studio
Data scientist (nhà khoa học dữ liệu)Thiết kế thí nghiệm, xây mô hình dự báo, rút ra khuyến nghịXác suất thống kê, học máy, lập trình, giao tiếpPython, R, SQL, pandas, scikit-learn, Jupyter
Data engineer (kỹ sư dữ liệu)Xây và vận hành đường ống, kho dữ liệuCơ sở dữ liệu, hệ phân tán, lập trình, điện toán đám mâySQL, Python, Spark, Kafka, Airflow, dbt
ML engineer (kỹ sư học máy)Đưa mô hình vào sản phẩm, tối ưu, giám sátKỹ thuật phần mềm, MLOps, học máyPython, Docker, Kubernetes, MLflow, PyTorch

Ranh giới giữa các vai trò tuỳ quy mô công ty: ở doanh nghiệp nhỏ, một người có thể kiêm cả ba việc đầu. Khi đọc tin tuyển dụng, hãy xem mô tả công việc thay vì chỉ nhìn chức danh.

Bài viết không nêu mức lương vì chưa có khảo sát công khai, có phương pháp rõ ràng và cập nhật năm 2026 cho thị trường Việt Nam.

Học data science cần những kỹ năng và công cụ gì?

Kỹ năng nền tảng

  • Xác suất và thống kê: phân phối, kiểm định giả thuyết, khoảng tin cậy, hồi quy. Đây là phần giúp bạn phân biệt “tương quan” với “nhân quả”.
  • Lập trình: Python là lựa chọn phổ biến nhờ hệ sinh thái thư viện phong phú; R mạnh về thống kê.
  • SQL: phần lớn dữ liệu doanh nghiệp nằm trong cơ sở dữ liệu quan hệ. Không biết SQL, bạn sẽ phụ thuộc người khác để lấy dữ liệu.
  • Trực quan hoá và kể chuyện bằng dữ liệu: một phát hiện không được hiểu thì không tạo ra quyết định.

Công cụ phổ biến

  • pandas: theo trang chính thức, đây là công cụ nguồn mở để phân tích và thao tác dữ liệu, xây trên ngôn ngữ Python.
  • scikit-learn: thư viện nguồn mở cho phân tích dự báo, gồm các nhóm phân loại, hồi quy, phân cụm và tiền xử lý.
  • Jupyter Notebook, Git, Power BI: lần lượt để khám phá dữ liệu, quản lý phiên bản mã và dựng dashboard.
  • Apache Spark: khi dữ liệu vượt sức một máy, Spark cho phép xử lý trên cụm nhiều máy bằng Python hoặc SQL.

Bài toán ảnh, âm thanh, văn bản cần thêm thư viện học sâu như PyTorch. Còn phần lớn dữ liệu dạng bảng trong doanh nghiệp vẫn giải tốt bằng SQL, pandas và mô hình cổ điển.

Ứng dụng data science trong các ngành như thế nào?

Data science có mặt ở bất kỳ nơi nào có dữ liệu và có quyết định cần đưa ra. Dưới đây là các ví dụ theo ngành; ví dụ nào không có nguồn công bố được ghi rõ là minh hoạ.

Ngân hàng và tài chính

Chấm điểm tín dụng và phát hiện gian lận là hai ứng dụng kinh điển. Theo bài trên báo Đại biểu Nhân dân ngày 30/09/2025, MoMo dùng thuật toán học máy kết hợp dữ liệu lớn để chấm điểm tín dụng dựa trên lịch sử thanh toán hoá đơn, hành vi tiêu dùng thay vì tài sản thế chấp. Ở cấp hệ thống, Ngân hàng Nhà nước vận hành hệ thống SIMO để giám sát tài khoản nghi ngờ gian lận; tính đến 23/03/2026, hệ thống đã triển khai tại 149 tổ chức và giúp ngăn chặn hơn 3.990 tỷ đồng, theo VietNamNet.

Y tế

Phân tích hình ảnh y khoa, dự báo nguy cơ bệnh và tối ưu lịch khám là các hướng phổ biến. Ngày 04/06/2021, VinBrain và tổ chức phi chính phủ FIT (Đức) công bố sách trắng về AI hỗ trợ tầm soát lao trên ảnh X-quang; nhóm thu thập hơn 500.000 ảnh, trong đó 185.486 ảnh đã làm sạch được dùng để huấn luyện, đánh giá và kiểm thử, theo Zing News. Con số này cho thấy công sức làm sạch dữ liệu lớn đến mức nào.

Bán lẻ và thương mại điện tử

Ví dụ minh hoạ: gợi ý sản phẩm theo lịch sử mua, phân khúc khách hàng (phân tích RFM), dự đoán khách sắp rời bỏ, thử nghiệm A/B cho trang thanh toán.

Sản xuất và logistics

Ví dụ minh hoạ: dùng dữ liệu cảm biến dự đoán máy sắp hỏng (bảo trì dự đoán), tìm nguyên nhân lỗi theo ca và lô nguyên liệu, tối ưu tuyến giao hàng.

Dịch vụ công

Data science cần dữ liệu nền tảng sạch và liên thông. Cơ sở dữ liệu quốc gia về dân cư chính thức vận hành từ 01/07/2021, thu thập hơn 98 triệu nhân khẩu, theo VOV. Khi dữ liệu dân cư thống nhất, các bài toán như dự báo nhu cầu dịch vụ công, phân bổ nguồn lực y tế, giáo dục mới có cơ sở để giải.

Ngành khoa học dữ liệu ở Việt Nam đào tạo ở đâu?

Ngành khoa học dữ liệu đã có vị trí chính thức trong hệ thống giáo dục đại học. Theo Thông tư 09/2022/TT-BGDĐT ngày 06/06/2022 của Bộ Giáo dục và Đào tạo, có hiệu lực từ 22/07/2022, Khoa học dữ liệu được bổ sung vào danh mục ngành đào tạo. Mã ngành trình độ đại học là 7460108, thuộc lĩnh vực Toán và thống kê; trình độ thạc sĩ có mã 8460108.

Một số trường đã công bố chương trình hoặc đề án cho ngành này (thông tin công khai, đối chiếu tới tháng 10/2026):

  • Trường Đại học Kinh tế Quốc dân: mở ngành Khoa học dữ liệu từ năm 2024, cùng đợt với Trí tuệ nhân tạo và Kỹ thuật phần mềm.
  • Trường Đại học Công nghệ Thông tin, Đại học Quốc gia TP.HCM: ngành Khoa học dữ liệu mã 7460108 có trong phương án tuyển sinh năm 2026, gồm cả chương trình giảng dạy bằng tiếng Anh.
  • Trường Đại học Công Thương TP.HCM: công khai chương trình đào tạo đại học chính quy ngành Khoa học dữ liệu, mã 7460108.
  • Trường Đại học Tôn Đức Thắng: đề án mở ngành Khoa học dữ liệu (tháng 12/2025) với hai chuyên ngành Phân tích dữ liệu kinh doanh và Trí tuệ nhân tạo và học máy, thời gian đào tạo 4 năm.

Nội dung dữ liệu còn có trong các ngành gần như Khoa học máy tính, Hệ thống thông tin, Thống kê kinh tế. Trước khi chọn trường, hãy đọc chương trình chi tiết: tỷ lệ môn toán thống kê, lập trình và đồ án thực tế.

Danh sách trên không đầy đủ và không phải xếp hạng. Chỉ tiêu, tổ hợp xét tuyển và điểm chuẩn thay đổi hằng năm; hãy kiểm tra trên cổng thông tin tuyển sinh chính thức của từng trường.

Lộ trình tự học data science cho người mới bắt đầu

Không học đúng ngành vẫn có thể vào nghề, nhất là khi bạn đã có nền tảng nghiệp vụ. Lộ trình gợi ý đi từ “dùng được ngay” tới “chuyên sâu”:

  1. Giai đoạn 1, nền tảng dữ liệu: Excel nâng cao, SQL tới mức nối bảng, gom nhóm; tự làm một báo cáo bán hàng từ dữ liệu thô.
  2. Giai đoạn 2, Python cho dữ liệu: cú pháp Python, pandas, thư viện vẽ biểu đồ; phân tích một bộ dữ liệu công khai và viết kết luận.
  3. Giai đoạn 3, thống kê ứng dụng: thống kê mô tả, phân phối, kiểm định giả thuyết, hồi quy tuyến tính và logistic, thiết kế thử nghiệm A/B.
  4. Giai đoạn 4, học máy cổ điển: cây quyết định, rừng ngẫu nhiên, gradient boosting, phân cụm; đọc precision, recall và tránh quá khớp.
  5. Giai đoạn 5, dự án hoàn chỉnh: làm 2–3 dự án theo đủ 6 bước CRISP-DM, có câu hỏi kinh doanh rõ ràng, mã nguồn trên Git và một bản trình bày ngắn cho người không chuyên.
  6. Giai đoạn 6, mở rộng: đi sâu vào kỹ thuật dữ liệu, học sâu hoặc phân tích chuyên ngành.

Mẹo: thay vì sưu tầm chứng chỉ, hãy xây danh mục dự án gắn với ngành bạn muốn vào, có giải thích rõ giả định và giới hạn.

Thách thức khi làm data science là gì?

Chất lượng dữ liệu

Mô hình tốt đến đâu cũng không cứu được dữ liệu sai. Nguyên tắc “rác vào, rác ra” áp dụng trọn vẹn cho data science. Gartner, dựa trên nghiên cứu năm 2020, ước tính dữ liệu kém chất lượng khiến mỗi tổ chức tốn trung bình ít nhất 12,9 triệu USD mỗi năm. Trong thông cáo ngày 26/02/2025, Gartner còn dự báo đến hết năm 2026, các tổ chức sẽ bỏ dở 60% dự án AI không có dữ liệu sẵn sàng cho AI.

Luật Dữ liệu số 60/2024/QH15, có hiệu lực từ 01/07/2025, cũng đặt yêu cầu tại Điều 12 về chất lượng dữ liệu: bảo đảm tính chính xác, hợp lệ, toàn vẹn, đầy đủ, cập nhật kịp thời và thống nhất.

Thiên lệch và đạo đức

Dữ liệu lịch sử phản ánh cả những bất công trong quá khứ. Năm 2018, Reuters đưa tin Amazon đã dừng một công cụ AI tuyển dụng vì nó hạ điểm hồ sơ có từ “women’s”; công cụ học từ hồ sơ khoảng 10 năm, phần lớn của nam giới. Bài học cho data scientist: phải kiểm tra mô hình theo từng nhóm người dùng, không chỉ nhìn độ chính xác tổng.

Một rủi ro khác là nhầm tương quan với nhân quả: hai chỉ số cùng tăng không có nghĩa cái này gây ra cái kia.

Dữ liệu cá nhân và tuân thủ pháp luật

Phần lớn dự án data science chạm tới dữ liệu khách hàng, nhân viên. Tại Việt Nam, Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 được thông qua ngày 26/06/2025, có hiệu lực từ 01/01/2026; Nghị định 356/2025/NĐ-CP hướng dẫn luật này, thay thế Nghị định 13/2023/NĐ-CP. Điều 30 của luật có quy định riêng về bảo vệ dữ liệu cá nhân khi xử lý dữ liệu lớn, trí tuệ nhân tạo và điện toán đám mây: chỉ xử lý đúng mục đích, trong phạm vi cần thiết, kèm biện pháp bảo mật, xác thực và phân quyền.

Nếu sản phẩm cuối là một hệ thống AI, bạn còn cần lưu ý Luật Trí tuệ nhân tạo số 134/2025/QH15, có hiệu lực từ 01/03/2026. Trong thực hành, hãy ẩn danh hoá khi có thể, chỉ lấy trường dữ liệu thật sự cần và ghi lại mục đích sử dụng.

Câu hỏi thường gặp

Data science và khoa học dữ liệu có giống nhau không?

Có. Khoa học dữ liệu là tên tiếng Việt của data science. Tên ngành đại học dùng “Khoa học dữ liệu”, trong khi tin tuyển dụng thường giữ nguyên “data science” hoặc “data scientist”.

Ngành khoa học dữ liệu có mã ngành là gì?

Mã ngành Khoa học dữ liệu trình độ đại học là 7460108, thuộc lĩnh vực Toán và thống kê, theo Thông tư 09/2022/TT-BGDĐT. Trình độ thạc sĩ có mã 8460108.

Học data science có cần giỏi toán không?

Bạn cần nền tảng xác suất, thống kê và đại số tuyến tính ở mức hiểu và vận dụng, không cần mức nghiên cứu. Điều quan trọng là hiểu kết quả mô hình có nghĩa gì và khi nào nó sai.

Nên học Python hay R cho data science?

Nếu mới bắt đầu, Python là lựa chọn an toàn vì dùng được từ phân tích tới triển khai mô hình. R phù hợp nếu bạn làm nhiều thống kê học thuật hoặc nghiên cứu. Dù chọn ngôn ngữ nào, SQL vẫn là kỹ năng bắt buộc.

Quy trình khoa học dữ liệu gồm mấy bước?

Theo CRISP-DM có 6 giai đoạn: hiểu nghiệp vụ, hiểu dữ liệu, chuẩn bị dữ liệu, mô hình hoá, đánh giá và triển khai. Các giai đoạn có thể quay lại lẫn nhau chứ không đi theo đường thẳng.

AI có thay thế data scientist không?

Công cụ AI giúp viết mã, làm sạch dữ liệu và thử mô hình nhanh hơn. Tuy nhiên, việc đặt đúng câu hỏi, đánh giá rủi ro, hiểu bối cảnh kinh doanh và chịu trách nhiệm về quyết định vẫn cần con người.