Trả lời nhanh: IDP (Intelligent Document Processing), tức xử lý tài liệu thông minh, là công nghệ tự nhận biết loại tài liệu, đọc và trích xuất đúng các trường cần dùng, kiểm tra hợp lệ rồi đưa dữ liệu vào hệ thống như ERP. Phần máy chưa chắc chắn được chuyển cho người duyệt.
Điểm chính
- OCR chỉ biến ảnh thành chữ. IDP còn phân loại, trích xuất trường, kiểm tra, cho người duyệt và đẩy dữ liệu vào phần mềm nghiệp vụ.
- Pipeline IDP điển hình có 8 bước. Con người duyệt (human-in-the-loop) là một phần của thiết kế, không phải dấu hiệu thất bại.
- Ở Việt Nam, tệp XML của hoá đơn điện tử mới có giá trị pháp lý. Có XML thì đọc XML, chỉ OCR chứng từ giấy, ảnh hoặc PDF quét.
- Đo IDP bằng độ chính xác cấp trường, tỷ lệ xử lý thẳng (STP) và độ tin cậy, không chỉ bằng câu “chính xác 99%”.
- Tài liệu chứa nhiều dữ liệu cá nhân, nên IDP phải tuân thủ Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15, hiệu lực từ 01/01/2026.
Mục lục
- IDP là gì?
- IDP khác OCR và RPA thế nào?
- IDP hoạt động như thế nào?
- Những công nghệ nào tạo nên IDP?
- IDP xử lý những loại tài liệu nào?
- IDP được ứng dụng trong những ngành nào?
- Làm IDP ở Việt Nam có gì khác?
- Đo chất lượng IDP bằng chỉ số nào?
- Triển khai IDP trong doanh nghiệp theo các bước nào?
- Dữ liệu cá nhân trong tài liệu: IDP cần tuân thủ gì?
- Câu hỏi thường gặp
IDP là gì?
IDP (Intelligent Document Processing), dịch là xử lý tài liệu thông minh, là nhóm công nghệ dùng trí tuệ nhân tạo để biến hoá đơn, hợp đồng, giấy tờ tuỳ thân thành dữ liệu có cấu trúc mà phần mềm dùng ngay được. Kết quả không phải một đoạn văn bản dài, mà là các trường cụ thể: “số hoá đơn = 0001234”, “tổng tiền = 12.540.000”.
Khi định nghĩa thị trường giải pháp IDP, Gartner liệt kê các năng lực bắt buộc: tiếp nhận tài liệu nhiều định dạng và bố cục; tiền xử lý, gồm cả phân loại tài liệu; trích xuất dữ liệu từ ảnh, văn bản, nhiều ngôn ngữ; rà soát kết quả bằng kiểm tra tự động và có con người sửa; tích hợp dữ liệu vào ứng dụng khác; điều phối và tự động hoá. Nói cách khác, IDP là cả một quy trình, không phải một thuật toán.
Cách dễ nhớ: OCR là “mắt” đọc chữ, còn IDP là “mắt cộng não cộng quy trình”. Nó biết tài liệu thuộc loại gì, cần lấy thông tin nào, thông tin có hợp lý không, và khi nào cần hỏi con người.
Ví dụ: xử lý 1.000 hoá đơn đầu vào mỗi tháng
Ví dụ minh hoạ, số liệu giả định. Phòng kế toán một công ty phân phối nhận khoảng 1.000 chứng từ mua vào mỗi tháng, mỗi chứng từ cần khoảng 12 trường như người bán, mã số thuế, số hoá đơn, ngày, dòng hàng, thuế suất, tổng tiền. Nhập tay là gõ khoảng 12.000 trường mỗi tháng. Với IDP:
- 800 chứng từ là hoá đơn điện tử có tệp XML. Hệ thống đọc thẳng XML, kiểm tra chữ ký số, đối chiếu đơn mua hàng. Khoảng 40 hoá đơn lệch số lượng hoặc đơn giá được đánh dấu.
- 200 chứng từ là ảnh, PDF quét, biên lai, hoá đơn nước ngoài, đi qua OCR và trích xuất. Khoảng 140 chứng từ đạt ngưỡng tin cậy ở mọi trường, 60 chứng từ cần người xác nhận.
- Kết quả: khoảng 900 chứng từ (90%) được ghi thẳng vào ERP. Kế toán chỉ xem khoảng 100 chứng từ, mỗi chứng từ chỉ vài trường được tô sáng.
Tỷ lệ thật phụ thuộc chất lượng chứng từ và độ chặt của quy tắc kiểm tra.
IDP khác OCR và RPA thế nào?
OCR (nhận dạng ký tự quang học) chỉ biến ảnh của chữ thành chữ, không biết đâu là tổng tiền hay số hoá đơn. RPA là robot phần mềm thao tác trên giao diện như nhân viên: mở phần mềm, dán dữ liệu, bấm lưu. RPA giỏi việc lặp lại với dữ liệu đã có cấu trúc, nhưng không tự đọc hiểu tài liệu mới.
| Tiêu chí | OCR | IDP | RPA |
|---|---|---|---|
| Câu hỏi nó trả lời | Trong ảnh có chữ gì? | Tài liệu là gì, chứa thông tin nào, có đúng không? | Làm sao thao tác trên phần mềm thay người? |
| Đầu vào | Ảnh, bản quét, PDF dạng ảnh | Ảnh, PDF, email, XML, Word | Dữ liệu có cấu trúc, giao diện phần mềm |
| Đầu ra | Văn bản thô, có thể kèm vị trí chữ | Trường dữ liệu có cấu trúc kèm điểm tin cậy | Thao tác đã thực hiện: bản ghi đã nhập, email đã gửi |
| Công nghệ chính | Thị giác máy tính, học sâu đọc chữ | OCR, thị giác máy tính, NLP, học máy, LLM, quy tắc nghiệp vụ | Kịch bản thao tác, kết nối API |
| Xử lý ngoại lệ | Không có | Chấm điểm tin cậy, chuyển người duyệt | Dừng hoặc báo lỗi khi giao diện đổi |
| Vai trò | Một bước bên trong IDP | Lớp “đọc hiểu” tài liệu | Lớp “tay chân” thực thi |
Ba công nghệ bổ trợ nhau. Trong quy trình trả tiền nhà cung cấp, RPA lấy tệp từ hộp thư, IDP đọc hiểu và trích xuất, rồi RPA hoặc API ghi kết quả vào phần mềm kế toán. Ghép nhiều công cụ như vậy để tự động hoá liên hoàn thường được gọi là hyperautomation. Xem bức tranh tổng thể ở bài tự động hoá quy trình doanh nghiệp.
IDP hoạt động như thế nào?
Hầu hết hệ thống IDP đi qua 8 bước dưới đây. Tên gọi giữa các nhà cung cấp có thể khác, nhưng logic giống nhau.
- Tiếp nhận (ingestion). Gom tài liệu từ hộp thư, máy quét, ứng dụng di động, cổng nhà cung cấp, API về một hàng đợi, ghi lại nguồn và thời điểm để truy vết.
- Tiền xử lý ảnh (preprocessing). Xoay thẳng, cắt viền, khử nhiễu, nắn phối cảnh ảnh chụp điện thoại, tách PDF nhiều trang thành từng tài liệu.
- Phân loại tài liệu (classification). Xác định đây là hoá đơn, hợp đồng, căn cước hay vận đơn. Mỗi loại đi theo bộ quy tắc riêng, nên phân loại sai kéo theo trích xuất sai.
- OCR/ICR. Đọc chữ in (OCR) và chữ viết tay (ICR, Intelligent Character Recognition), kèm toạ độ từng chữ. Tệp đã có lớp chữ hoặc tệp XML thì bỏ qua bước này.
- Trích xuất (extraction). Tìm cặp khoá – giá trị như “Mã số thuế: 0101234567”, nhận diện thực thể có tên (NER, Named Entity Recognition) như tên công ty, ngày tháng, và tái dựng bảng dòng hàng.
- Kiểm tra hợp lệ (validation). Tổng dòng hàng có khớp tiền trước thuế không, thuế suất có hợp lệ không, số hoá đơn đã nhập chưa, đơn giá có khớp đơn mua hàng không. Mỗi trường được gắn điểm tin cậy.
- Con người duyệt (human-in-the-loop). Trường dưới ngưỡng tin cậy hoặc vi phạm quy tắc hiện lên màn hình duyệt, cạnh ảnh gốc, tô sáng đúng vị trí. Tài liệu đạt mọi điều kiện đi thẳng sang bước cuối.
- Xuất dữ liệu. Ghi vào hệ thống ERP hoặc phần mềm kế toán, kèm liên kết tệp gốc. Bản sửa của người duyệt được lưu để huấn luyện lại mô hình.
Những công nghệ nào tạo nên IDP?
IDP ghép nhiều kỹ thuật AI đã trưởng thành vào cùng một quy trình.
OCR và ICR: đọc chữ
Lớp nền của IDP. OCR hiện đại dùng học sâu đọc cả dòng chữ; chi tiết kỹ thuật có trong bài OCR dẫn ở trên.
Thị giác máy tính: hiểu bố cục
Thị giác máy tính (computer vision) giúp hệ thống nhìn trang giấy như một bố cục: đâu là tiêu đề, bảng, ô chữ ký, con dấu, mã QR. Mô hình phân tích bố cục (layout analysis) nhận ra cả bảng không kẻ khung và tách vùng chữ in khỏi vùng viết tay.
NLP: hiểu nghĩa của chữ
Xử lý ngôn ngữ tự nhiên (NLP) giúp hiểu “Đơn vị bán hàng”, “Người bán” và “Bên A” trong các mẫu khác nhau cùng chỉ một vai trò. NLP cũng đảm nhận NER, chuẩn hoá ngày tháng, số tiền và phân loại tài liệu theo nội dung.
LLM và mô hình đa phương thức
Những năm gần đây, các mô hình ngôn ngữ lớn (LLM) và mô hình đa phương thức, tức đọc được cả ảnh lẫn chữ, được đưa vào IDP. Thay vì huấn luyện mô hình riêng cho từng mẫu, bạn mô tả “lấy số hợp đồng, bên thuê, ngày hết hạn” bằng lời và nhận kết quả dạng JSON. Các nhà cung cấp lớn đi theo hướng ghép hai lớp. Ví dụ, tài liệu chính thức của Microsoft mô tả Azure Document Intelligence cho trích xuất xác định (deterministic) với tài liệu có cấu trúc, còn Content Understanding cung cấp bộ phân tích dùng LLM cho nội dung phức tạp, phi cấu trúc.
LLM mạnh với mẫu chưa gặp bao giờ, nhưng cần thiết kế bù ba điểm yếu:
- Có thể “bịa” giá trị (hallucination). Cần đối chiếu kết quả với chữ OCR và toạ độ thật trên trang.
- Điểm tin cậy không tự đáng tin. Mô hình nói “chắc chắn” chưa chắc đã đúng, nên phải tính và hiệu chỉnh riêng.
- Chi phí và độ trễ cao hơn. Cách phổ biến là dùng mô hình nhỏ cho tài liệu quen và chỉ gọi LLM cho ca khó.
IDP xử lý những loại tài liệu nào?
Độ khó phụ thuộc mức độ cấu trúc của tài liệu.
| Nhóm | Đặc điểm | Ví dụ | Cách xử lý phù hợp |
|---|---|---|---|
| Có cấu trúc | Mẫu cố định, trường luôn ở cùng vị trí | Tờ khai theo mẫu, phiếu khảo sát, mặt thẻ căn cước | Mẫu khuôn (template) theo toạ độ, dễ làm nhất |
| Bán cấu trúc | Cùng loại thông tin, mỗi nơi trình bày một kiểu | Hoá đơn nhiều nhà cung cấp, sao kê, vận đơn, phiếu xét nghiệm | Học máy hoặc LLM nhận diện theo ngữ cảnh, không theo vị trí |
| Phi cấu trúc | Văn bản tự do, thông tin rải rác | Hợp đồng, email, biên bản, hồ sơ bệnh án | NLP, LLM trích ý; trường quan trọng bắt buộc qua người duyệt |
IDP được ứng dụng trong những ngành nào?
Ngân hàng: hồ sơ KYC và tín dụng
IDP phân loại giấy tờ tuỳ thân, sao kê lương, hợp đồng lao động, giấy tờ tài sản; trích họ tên, số định danh, thu nhập; rồi đối chiếu chéo, ví dụ tên trên sao kê có khớp tên trên căn cước không. Cán bộ thẩm định tập trung vào đánh giá rủi ro thay vì gõ lại.
Bảo hiểm: hồ sơ bồi thường
Hồ sơ bồi thường sức khoẻ gồm đơn yêu cầu, giấy ra viện, hoá đơn viện phí, đơn thuốc. IDP tách trang, trích chẩn đoán, ngày điều trị, chi phí, và đánh dấu bất thường như hoá đơn trùng hoặc ngày điều trị ngoài thời hạn hợp đồng.
Kế toán: hoá đơn và chứng từ
Ứng dụng phổ biến nhất. Ngoài hoá đơn, IDP đọc phiếu giao hàng, biên bản nghiệm thu, đề nghị thanh toán để đối chiếu ba bên. Với hoá đơn điện tử ở Việt Nam, cách làm đúng được trình bày ở phần sau.
Logistics: vận đơn và chứng từ xuất nhập khẩu
Mỗi hãng tàu trình bày vận đơn (bill of lading), hoá đơn thương mại, phiếu đóng gói một kiểu. IDP trích số container, cảng đi, cảng đến, trọng lượng và kiểm tra các con số có khớp nhau giữa chứng từ trước khi lập tờ khai.
Nhân sự: hồ sơ người lao động
IDP đưa thông tin từ CV, bằng cấp, giấy khám sức khoẻ vào hệ thống nhân sự, đồng thời gắn nhãn dữ liệu nhạy cảm như thông tin sức khoẻ để áp quyền truy cập chặt hơn.
Làm IDP ở Việt Nam có gì khác?
Tiếng Việt có dấu
Dấu nhỏ, dễ mất khi ảnh mờ, và sai một dấu là sai tên riêng. Với IDP, hậu quả nặng hơn OCR thuần vì tên người, tên công ty, địa chỉ là trường dùng để đối chiếu. Hãy chạy thử trên chứng từ thật và kiểm tra hệ thống có chuẩn hoá Unicode trước khi so khớp không.
Con dấu, chữ ký và chữ viết tay
Con dấu đỏ thường đè lên chữ, kèm chữ ký và phần điền tay như số tiền bằng chữ. Hệ thống cần tách lớp màu con dấu trước khi đọc, nhận diện “có dấu, có chữ ký” như một trường kiểm tra, và đưa phần viết tay quan trọng sang người duyệt.
Hoá đơn điện tử: đọc XML thay vì OCR
Theo Điều 12 Nghị định 123/2020/NĐ-CP ngày 19/10/2020 (hiệu lực từ 01/07/2022), hoá đơn điện tử dùng định dạng XML, gồm thành phần dữ liệu nghiệp vụ, thành phần chữ ký số và, với hoá đơn có mã, thành phần mã của cơ quan thuế. Cấu trúc thẻ dữ liệu được Tổng cục Thuế quy định tại Quyết định 1450/QĐ-TCT ngày 07/10/2021. Công văn 1152/TCT-CS ngày 05/04/2023 nêu rõ tệp XML có giá trị pháp lý, còn tệp PDF chỉ là bản thể hiện.
Vì vậy, nếu người bán gửi kèm XML, hãy đọc thẳng XML: dữ liệu đã có cấu trúc, đúng tuyệt đối từng ký tự và có chữ ký số để kiểm tra toàn vẹn. OCR bản PDF lúc này vừa tốn chi phí vừa tự tạo rủi ro đọc sai. Bạn cũng có thể kiểm tra thông tin hoá đơn trên cổng hoá đơn điện tử của cơ quan thuế, nơi có chức năng đọc tệp XML.
Nghị định 70/2025/NĐ-CP ngày 20/03/2025, hiệu lực từ 01/06/2025, sửa đổi Nghị định 123/2020, trong đó cho phép hoá đơn ghi số định danh cá nhân của người mua hoặc mã số đơn vị có quan hệ với ngân sách. Kho hoá đơn của bạn vì thế có thể chứa thêm dữ liệu cá nhân. Nghị định này cũng đổi quy định về thời điểm lập hoá đơn, nên quy tắc kiểm tra ngày tháng cần cập nhật theo.
Căn cước gắn chip: đọc chip thay vì chụp ảnh
Theo khoản 3 Điều 18 Luật Căn cước số 26/2023/QH15 (hiệu lực từ 01/07/2024), bộ phận lưu trữ trên thẻ căn cước chứa thông tin được mã hoá, gồm ảnh khuôn mặt, vân tay, mống mắt; điện thoại có NFC đọc được chip này. Điều 16 Thông tư 17/2024/TT-NHNN yêu cầu khi mở tài khoản thanh toán bằng phương thức điện tử, ngân hàng phải đối chiếu sinh trắc học của khách với dữ liệu trong chip thẻ căn cước hoặc qua tài khoản định danh điện tử. Bài học giống hoá đơn: có dữ liệu số gốc thì ưu tiên nó, OCR mặt thẻ chỉ là dự phòng.
Đo chất lượng IDP bằng chỉ số nào?
Câu “độ chính xác 99%” gần như vô nghĩa nếu không biết đo ở cấp nào, trên dữ liệu nào. Nên dùng các chỉ số sau.
| Chỉ số | Cách tính | Ý nghĩa |
|---|---|---|
| Độ chính xác cấp trường (field-level accuracy) | Số trường đúng / tổng số trường | Tính riêng cho trường quan trọng như tổng tiền, mã số thuế |
| Độ chính xác cấp tài liệu | Số tài liệu đúng mọi trường / tổng số tài liệu | Phản ánh sát công sức con người phải bỏ ra |
| Tỷ lệ xử lý thẳng (STP, straight-through processing) | Số tài liệu không cần người chạm vào / tổng số | Chỉ số kinh doanh quan trọng nhất |
| Độ tin cậy có hiệu chỉnh (calibration) | Trường được chấm tin cậy 95% thì thực tế có khoảng 95% đúng không | Điểm tin cậy lệch thực tế thì ngưỡng duyệt sẽ để lọt lỗi |
| Tỷ lệ lỗi lọt | Số trường sai nhưng vẫn đi thẳng / tổng trường đi thẳng | Rủi ro thật: lỗi vào sổ sách mà không ai thấy |
Vì sao 98% cấp trường vẫn có thể là ít? Hoá đơn có 10 trường, mỗi trường đúng 98% và lỗi độc lập, thì xác suất đúng cả hoá đơn chỉ khoảng 0,98 mũ 10, xấp xỉ 82%. Gần 1/5 số hoá đơn vẫn có ít nhất một chỗ sai.
Ngưỡng tin cậy là sự đánh đổi: ngưỡng cao thì ít lỗi lọt nhưng STP thấp, ngưỡng thấp thì ngược lại. Nên đặt ngưỡng riêng từng trường: tổng tiền và mã số thuế cần chặt, mô tả hàng có thể nới hơn.
Triển khai IDP trong doanh nghiệp theo các bước nào?
Dự án IDP thường thất bại vì chọn sai tài liệu để bắt đầu hoặc không có dữ liệu để đo, hơn là vì công nghệ.
- Chọn một quy trình khối lượng lớn, luật rõ như hoá đơn đầu vào. Đo hiện trạng: số tài liệu, thời gian xử lý, tỷ lệ lỗi nhập tay.
- Kiểm kê nguồn tài liệu. Bao nhiêu phần trăm đã có XML, bao nhiêu là giấy hay ảnh. Đôi khi chỉ cần yêu cầu nhà cung cấp gửi XML là giải quyết phần lớn bài toán.
- Xây bộ dữ liệu kiểm thử. Vài trăm tài liệu thật, đa dạng nguồn và chất lượng ảnh, gán nhãn đúng từng trường. Công việc này gần với số hoá tài liệu và cần làm cẩn thận.
- Chạy thử (PoC) trên chính bộ dữ liệu đó, so các giải pháp bằng cùng chỉ số ở nhiều mức ngưỡng, không dùng bộ mẫu do nhà cung cấp chọn.
- Thiết kế màn hình duyệt và quy tắc kiểm tra cùng kế toán, nghiệp vụ, không chỉ đội kỹ thuật.
- Tích hợp và chạy song song với cách làm cũ vài tuần trước khi chuyển hẳn.
- Vận hành, cải tiến: theo dõi STP và lỗi lọt hằng tuần, huấn luyện lại từ bản sửa, rồi mới thêm loại tài liệu mới.
Khi chọn giải pháp, hãy hỏi: có hỗ trợ tiếng Việt cho cả chữ in lẫn viết tay không, dữ liệu xử lý ở đâu, có điểm tin cậy từng trường không, có đọc XML hoá đơn điện tử không, và tính phí theo trang hay theo tài liệu.
Dữ liệu cá nhân trong tài liệu: IDP cần tuân thủ gì?
Tài liệu đi qua IDP chứa họ tên, số định danh, ảnh chân dung, số tài khoản, thông tin sức khoẻ. Khung pháp lý chính là Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 ngày 26/06/2025, hiệu lực từ 01/01/2026, cùng Nghị định 356/2025/NĐ-CP ngày 31/12/2025 hướng dẫn luật và thay thế Nghị định 13/2023/NĐ-CP.
- Phân loại dữ liệu ngay khi trích xuất. Theo Nghị định 356/2025, số căn cước, hộ chiếu, số tài khoản, hình ảnh cá nhân là dữ liệu cơ bản; tình trạng sức khoẻ, dữ liệu sinh trắc học, thông tin tài chính và tín dụng là dữ liệu nhạy cảm. Hãy gắn nhãn mức nhạy cảm cho từng trường để phân quyền.
- Dùng nền tảng ở nước ngoài là chuyển dữ liệu xuyên biên giới. Khoản 1 Điều 20 Luật 91/2025 coi việc dùng nền tảng ngoài lãnh thổ để xử lý dữ liệu cá nhân thu thập tại Việt Nam là chuyển dữ liệu xuyên biên giới, phải lập hồ sơ đánh giá tác động và gửi cơ quan chuyên trách trong 60 ngày, trừ trường hợp được miễn. Đây là câu hỏi bắt buộc khi chọn dịch vụ IDP trên đám mây.
- Nhà cung cấp IDP là bên xử lý dữ liệu. Doanh nghiệp vẫn là bên kiểm soát, cần hợp đồng nêu rõ mục đích, phạm vi, thời hạn lưu và trách nhiệm bảo mật.
- Tối thiểu hoá và che dữ liệu. Chỉ trích trường cần thiết, che số định danh trên màn hình duyệt nếu không cần, xoá ảnh gốc khi hết thời hạn lưu.
- Chế tài đáng kể. Điều 8 Luật 91/2025 đặt mức phạt tối đa với tổ chức là 5% doanh thu năm trước liền kề cho vi phạm chuyển dữ liệu xuyên biên giới và 3 tỷ đồng cho vi phạm khác.
Lưu ý: phần trên là tóm tắt để định hướng kỹ thuật, không thay thế tư vấn pháp lý. Dự án xử lý giấy tờ tuỳ thân, hồ sơ sức khoẻ hoặc dữ liệu tài chính quy mô lớn nên được rà soát cùng bộ phận pháp chế.
Câu hỏi thường gặp
IDP là viết tắt của gì?
IDP là viết tắt của Intelligent Document Processing, dịch là xử lý tài liệu thông minh. Một số nơi gọi là “xử lý chứng từ thông minh” hay “trích xuất dữ liệu từ tài liệu bằng AI”, đều chỉ cùng nhóm giải pháp.
IDP và OCR khác nhau như thế nào?
OCR chỉ chuyển ảnh thành văn bản. IDP dùng OCR làm một bước, rồi thêm phân loại, trích xuất đúng trường, kiểm tra hợp lệ, chấm điểm tin cậy và chuyển người duyệt khi cần. Đầu ra của IDP là dữ liệu có cấu trúc sẵn sàng đưa vào phần mềm.
Doanh nghiệp nhỏ có cần IDP không?
Nếu chỉ nhận vài chục hoá đơn mỗi tháng và đều có XML, chức năng nhập XML của phần mềm kế toán thường là đủ. IDP đáng cân nhắc khi khối lượng lớn, nhiều chứng từ giấy hoặc nhiều loại tài liệu cần đối chiếu chéo.
Dùng ChatGPT hay LLM có thay được IDP không?
LLM trích xuất một tài liệu rất tốt, nhưng IDP là cả quy trình: tiếp nhận hàng loạt, quy tắc kiểm tra, điểm tin cậy, màn hình duyệt, nhật ký, tích hợp ERP và bảo vệ dữ liệu cá nhân. LLM thường là một thành phần bên trong IDP hiện đại.
IDP có đọc được chữ viết tay tiếng Việt không?
Có thể, nhưng kém chữ in và khác nhau nhiều giữa các giải pháp; một số dịch vụ lớn hỗ trợ chữ in tiếng Việt nhưng chưa hỗ trợ chữ viết tay tiếng Việt. Hãy chạy thử trên mẫu thật và cho trường viết tay quan trọng luôn qua người duyệt.
Có XML rồi thì còn cần IDP cho hoá đơn không?
Không cần OCR nữa, nhưng các bước khác vẫn có giá trị: kiểm tra chữ ký số và mã số thuế, đối chiếu đơn mua hàng và phiếu nhập kho, xử lý ngoại lệ, đọc chứng từ đi kèm chưa ở dạng điện tử.