Fine-tuning là gì? Tinh chỉnh mô hình AI, LoRA và quy trình

Trả lời nhanh: Fine-tuning (tinh chỉnh mô hình) là việc huấn luyện thêm một mô hình AI đã được huấn luyện sẵn trên một bộ dữ liệu nhỏ, chuyên biệt, để nó làm tốt hơn một nhiệm vụ cụ thể, ví dụ trả lời đúng giọng văn thương hiệu hoặc phân loại đơn khiếu nại theo quy định nội bộ.

Điểm chính

  • Fine-tuning thay đổi trọng số của mô hình, khác với viết prompt hay RAG vốn để nguyên mô hình.
  • Fine-tuning giỏi dạy mô hình cách làm (định dạng, giọng văn, thuật ngữ, quy tắc phân loại), kém khi dùng để nạp kiến thức mới hay thay đổi.
  • LoRA và QLoRA chỉ huấn luyện một phần rất nhỏ tham số, giúp tinh chỉnh mô hình lớn với phần cứng khiêm tốn hơn nhiều.
  • Chất lượng dữ liệu gán nhãn quyết định kết quả nhiều hơn số lượng mẫu.
  • Rủi ro chính: quên kiến thức cũ, suy giảm lớp an toàn, lộ dữ liệu huấn luyện. Dữ liệu cá nhân phải tuân thủ Luật 91/2025/QH15.
Mục lục
  1. Fine-tuning là gì?
  2. Fine-tuning khác pre-training như thế nào?
  3. Fine-tuning hoạt động như thế nào?
  4. Có những kiểu fine-tuning nào?
  5. Khi nào nên fine-tune, khi nào chưa cần?
  6. Quy trình fine-tuning gồm những bước nào?
  7. Chuẩn bị dữ liệu fine-tuning thế nào cho đúng?
  8. Đánh giá mô hình sau khi fine-tuning ra sao?
  9. Chi phí fine-tuning phụ thuộc vào yếu tố nào?
  10. Fine-tuning có những rủi ro gì?
  11. Fine-tuning với dữ liệu cá nhân cần lưu ý gì?
  12. Những hiểu lầm phổ biến về fine-tuning
  13. Câu hỏi thường gặp

Fine-tuning là gì?

Fine-tuning là bước huấn luyện bổ sung một mô hình đã học sẵn (pre-trained model) bằng dữ liệu của riêng bạn. Google định nghĩa ngắn gọn trong khoá học Machine Learning của họ: tinh chỉnh là quá trình huấn luyện thêm giúp mô hình dự đoán chính xác hơn cho một nhiệm vụ cụ thể.

Trong tiếng Việt, fine-tuning thường được gọi là tinh chỉnh mô hình, tinh chỉnh AI, đôi khi là “điều chỉnh tinh”. Ý tưởng gốc đến từ học chuyển giao (transfer learning): thay vì dạy một mô hình từ con số không, bạn tận dụng những gì nó đã biết rồi chỉ dạy thêm phần còn thiếu. Đây là một kỹ thuật cơ bản của học máy, áp dụng cho cả mô hình ảnh, giọng nói lẫn mô hình ngôn ngữ.

Ví dụ minh hoạ: một công ty bảo hiểm có mô hình ngôn ngữ đọc hiểu tiếng Việt tốt, nhưng khi tóm tắt hồ sơ bồi thường, nó viết dài, sai thứ tự mục và dùng từ không theo thuật ngữ nội bộ. Bộ phận nghiệp vụ chuẩn bị vài trăm cặp “hồ sơ gốc và bản tóm tắt chuẩn” rồi tinh chỉnh. Sau đó mô hình viết đúng khung, đúng thuật ngữ mà không cần dán hướng dẫn dài vào mỗi câu lệnh.

Với mô hình ngôn ngữ lớn (LLM), fine-tuning còn là một phần trong quy trình tạo ra chính các trợ lý AI quen thuộc. Mô hình nền chỉ biết đoán chữ tiếp theo; nhờ tinh chỉnh bằng các cặp hỏi đáp mẫu, nó mới học được cách làm theo yêu cầu và trò chuyện.

Fine-tuning khác pre-training như thế nào?

Pre-training (tiền huấn luyện) là giai đoạn mô hình học từ một kho dữ liệu khổng lồ để có hiểu biết chung về ngôn ngữ và thế giới. Fine-tuning diễn ra sau đó, trên dữ liệu nhỏ hơn rất nhiều, để chuyên môn hoá.

Tiêu chíPre-training (tiền huấn luyện)Fine-tuning (tinh chỉnh)
Mục tiêuHọc kiến thức và kỹ năng ngôn ngữ tổng quátThích nghi với một nhiệm vụ, lĩnh vực hoặc phong cách cụ thể
Điểm bắt đầuTrọng số khởi tạo ngẫu nhiênTrọng số của mô hình đã huấn luyện
Dữ liệuRất lớn, đa dạng, phần lớn không gán nhãn (web, sách, mã nguồn)Nhỏ, chọn lọc, thường có đáp án mẫu do người chuẩn bị
Tài nguyên tính toánRất lớn, chỉ một số ít tổ chức làm đượcNhỏ hơn nhiều lần, doanh nghiệp vừa có thể làm
Ai thường làmNhà phát triển mô hình nềnDoanh nghiệp, nhóm sản phẩm, nhà nghiên cứu
Kết quảMô hình nền (base model, foundation model)Mô hình chuyên biệt dựa trên mô hình nền

Giữa hai giai đoạn này còn có tiếp tục tiền huấn luyện (continued pre-training): cho mô hình đọc thêm một kho văn bản lớn của một ngôn ngữ hoặc một ngành, chưa cần đáp án mẫu. Mô hình VT-Super-120B-A12B do Viettel AI công bố tháng 06/2026 là một ví dụ tại Việt Nam: theo thông tin công bố, mô hình đi qua giai đoạn tiếp tục tiền huấn luyện trên dữ liệu tiếng Việt, sau đó là tinh chỉnh có giám sát và học tăng cường.

Một ví dụ khác: PhoGPT-4B-Chat của VinAI được tạo bằng cách tinh chỉnh mô hình nền PhoGPT-4B trên khoảng 70.000 cặp lệnh và câu trả lời cùng khoảng 290.000 đoạn hội thoại, theo bài báo công bố tháng 11/2023.

Fine-tuning hoạt động như thế nào?

Một mô hình học sâu là tập hợp rất nhiều con số gọi là trọng số (weights). Trong lúc tinh chỉnh, mô hình nhận một mẫu đầu vào, đưa ra câu trả lời, so với đáp án mẫu để tính mức sai (loss), rồi chỉnh nhẹ các trọng số theo hướng giảm sai. Quá trình lặp lại trên toàn bộ dữ liệu, thường qua vài vòng (epoch).

Khác với huấn luyện từ đầu, tinh chỉnh thường dùng tốc độ học (learning rate) nhỏ để không “xoá” những gì mô hình đã biết. Tuỳ phương pháp, bạn có thể cập nhật toàn bộ trọng số, chỉ một số lớp cuối, hoặc giữ nguyên mô hình và học thêm một phần nhỏ gắn vào. Sự khác nhau này tạo ra các kiểu fine-tuning ở phần dưới.

Full fine-tuning và LoRA: phần nào được huấn luyện? Full fine-tuning Toàn bộ trọng số W đều được cập nhật Học mạnh nhất, tốn bộ nhớ nhất Mỗi tác vụ lưu một bản đầy đủ Dễ quên kiến thức cũ hơn LoRA (một kiểu PEFT) Trọng số gốc W đóng băng + A B Chỉ học hai ma trận nhỏ A và B Lưu riêng adapter, dùng chung W QLoRA: nén W xuống 4-bit để tiết kiệm thêm bộ nhớ GPU
Hình 1. Full fine-tuning cập nhật mọi trọng số. LoRA giữ nguyên mô hình gốc và chỉ học thêm hai ma trận hạng thấp gắn vào từng lớp.

Có những kiểu fine-tuning nào?

Có hai cách phân loại hay gặp: theo lượng tham số được cập nhật (full hay một phần) và theo loại dữ liệu dạy mô hình (đáp án mẫu hay đánh giá ưu tiên). Hai cách này kết hợp được với nhau, ví dụ instruction tuning bằng LoRA.

Full fine-tuning: cập nhật toàn bộ tham số

Mọi trọng số của mô hình đều được huấn luyện lại. Đây là cách cho mô hình học mạnh nhất, nhưng cần nhiều bộ nhớ GPU và mỗi phiên bản tinh chỉnh là một bản sao đầy đủ của mô hình. Bài báo LoRA lấy ví dụ GPT-3 175B: triển khai nhiều bản tinh chỉnh độc lập, mỗi bản 175 tỷ tham số, là quá tốn kém. Vì vậy full fine-tuning chủ yếu dùng với mô hình nhỏ hoặc khi có ngân sách hạ tầng lớn.

PEFT: tinh chỉnh hiệu quả tham số

PEFT (Parameter-Efficient Fine-Tuning) là nhóm phương pháp chỉ huấn luyện một số ít tham số, có thể là tham số thêm vào, còn phần lớn mô hình giữ nguyên. Theo tài liệu của thư viện PEFT trên Hugging Face, cách này giảm đáng kể chi phí tính toán và lưu trữ trong khi đạt hiệu năng tương đương mô hình tinh chỉnh toàn bộ, đủ để huấn luyện mô hình lớn trên phần cứng phổ thông hơn. Các phương pháp PEFT gồm adapter, prefix tuning, prompt tuning và nổi tiếng nhất là LoRA.

LoRA: học thêm hai ma trận nhỏ

LoRA (Low-Rank Adaptation) được Edward J. Hu và cộng sự công bố tháng 06/2021. LoRA đóng băng trọng số gốc và chèn thêm các cặp ma trận hạng thấp có thể huấn luyện vào mỗi lớp Transformer. Theo bài báo, so với tinh chỉnh GPT-3 175B theo cách thông thường, LoRA giảm số tham số cần huấn luyện khoảng 10.000 lần và giảm yêu cầu bộ nhớ GPU khoảng 3 lần, chất lượng ngang hoặc tốt hơn trên các mô hình thử nghiệm, và không làm tăng độ trễ khi suy luận.

Lợi ích thực tế: một mô hình gốc dùng chung, nhiều “adapter” nhỏ cho từng phòng ban hay từng tác vụ, hoán đổi khi cần. Đổi lại, một nghiên cứu năm 2024 có tên “LoRA Learns Less and Forgets Less” cho thấy với lập trình và toán, LoRA cấu hình thông thường học kém hơn full fine-tuning khá rõ, nhưng giữ được năng lực gốc ngoài lĩnh vực tốt hơn.

QLoRA: LoRA trên mô hình đã nén

QLoRA (công bố tháng 05/2023) kết hợp LoRA với việc lượng tử hoá (quantization) mô hình gốc xuống 4-bit, tức lưu mỗi trọng số bằng ít bit hơn. Nhóm tác giả cho biết cách này giảm bộ nhớ đủ để tinh chỉnh mô hình 65 tỷ tham số trên một GPU 48 GB mà vẫn giữ hiệu năng như tinh chỉnh 16-bit. QLoRA phù hợp khi bạn muốn tự tinh chỉnh mô hình mở mà không có cụm máy chủ lớn.

Instruction tuning: dạy mô hình làm theo yêu cầu

Instruction tuning (tinh chỉnh theo chỉ dẫn), còn gọi là tinh chỉnh có giám sát (SFT, supervised fine-tuning) khi dữ liệu là các cặp yêu cầu và câu trả lời mẫu. Nghiên cứu FLAN của Google (09/2021) tinh chỉnh một mô hình 137 tỷ tham số trên hơn 60 nhiệm vụ được mô tả bằng câu lệnh tự nhiên, và mô hình vượt GPT-3 ở chế độ zero-shot trên 20 trong 25 nhiệm vụ được đánh giá. Với doanh nghiệp, SFT là dạng fine-tuning phổ biến nhất: bạn đưa mẫu đầu vào và đầu ra chuẩn, mô hình học bắt chước.

RLHF và DPO: dạy mô hình theo đánh giá của con người

Có những thứ khó viết thành một đáp án duy nhất, như “câu trả lời nào lịch sự và hữu ích hơn”. Khi đó người ta dùng dữ liệu ưu tiên: con người so sánh hai hay nhiều câu trả lời và chọn câu tốt hơn.

  • RLHF (Reinforcement Learning from Human Feedback): dùng dữ liệu xếp hạng để huấn luyện một mô hình thưởng (reward model), rồi tối ưu LLM bằng học tăng cường để đạt điểm thưởng cao. Trong bài báo InstructGPT của OpenAI (03/2022), người đánh giá ưa chuộng câu trả lời của mô hình 1,3 tỷ tham số đã qua SFT và RLHF hơn mô hình GPT-3 175 tỷ tham số.
  • DPO (Direct Preference Optimization): công bố tháng 05/2023, tối ưu trực tiếp trên các cặp câu trả lời được ưu tiên và bị loại, không cần huấn luyện mô hình thưởng riêng và không cần vòng học tăng cường. Nhóm tác giả mô tả DPO ổn định, nhẹ về tính toán, kết quả ngang hoặc tốt hơn RLHF trong thí nghiệm của họ.

Một số nền tảng thương mại hiện cho phép doanh nghiệp tự chạy các kiểu này. Ví dụ tài liệu của OpenAI liệt kê bốn phương pháp: tinh chỉnh có giám sát, tinh chỉnh với hình ảnh, DPO và tinh chỉnh tăng cường (reinforcement fine-tuning) cho nhiệm vụ cần suy luận chuyên sâu.

KiểuThay đổi gìDữ liệu cầnHợp khi
Full fine-tuningToàn bộ trọng sốĐáp án mẫuMô hình nhỏ, cần thay đổi hành vi sâu, có hạ tầng
LoRA, PEFTPhần nhỏ tham số thêm vàoĐáp án mẫuPhần lớn bài toán doanh nghiệp, nhiều tác vụ dùng chung mô hình gốc
QLoRANhư LoRA, mô hình gốc nén 4-bitĐáp án mẫuTự tinh chỉnh mô hình mở với ít GPU
Instruction tuning (SFT)Cách làm theo yêu cầuCặp yêu cầu và câu trả lờiĐịnh dạng, giọng văn, quy trình xử lý cố định
RLHF, DPOMức độ ưu tiên giữa các câu trả lờiCặp so sánh tốt hơn, kém hơnGiọng điệu, độ an toàn, chất lượng khó viết thành đáp án đúng duy nhất

Ngoài ra còn có chưng cất (distillation): dùng một mô hình lớn tạo ra mô hình nhỏ hơn, chạy nhanh và rẻ hơn. Google lưu ý mô hình chưng cất thường có chất lượng dự đoán thấp hơn mô hình gốc.

Khi nào nên fine-tune, khi nào chưa cần?

Đây là câu hỏi quan trọng nhất trước khi bỏ tiền. Có ba cách để mô hình làm tốt việc của bạn: viết prompt tốt hơn, cho mô hình tra cứu tài liệu (RAG), hoặc tinh chỉnh. Hướng dẫn của OpenAI khuyên bắt đầu bằng đánh giá và tối ưu prompt, vì quá trình này “có thể là tất cả những gì bạn cần” để đạt kết quả tốt.

Vấn đề bạn gặpNên thử trướcVì sao
Mô hình hiểu sai yêu cầu, trả lời lan manPrompt engineeringHướng dẫn rõ, ví dụ mẫu thường đủ; sửa trong vài phút
Thiếu kiến thức nội bộ: quy chế, bảng giá, sản phẩmRAGKiến thức nằm ngoài mô hình, đổi tài liệu là cập nhật, trích được nguồn
Thông tin thay đổi hằng tuần, hằng ngàyRAGTinh chỉnh lại mỗi lần đổi dữ liệu là quá chậm và tốn
Cần đúng định dạng, giọng văn, thuật ngữ ổn định qua hàng nghìn lần gọiFine-tuningHành vi “ngấm” vào mô hình, không phụ thuộc prompt dài
Phân loại, trích xuất theo quy tắc riêng, nhiều trường hợp ngoại lệFine-tuningDạy bằng nhiều ví dụ hơn mức nhét vừa một prompt
Prompt quá dài làm chậm và tốn token mỗi lần gọiFine-tuning hoặc chưng cấtRút ngắn prompt, có thể dùng mô hình nhỏ hơn
Cần câu trả lời bám tài liệu và phân quyền theo người dùngRAGKiến thức trong trọng số không phân quyền được

Nghiên cứu ủng hộ cách chia này. Một so sánh công bố tháng 12/2023 (“Fine-Tuning or Retrieval?”) cho thấy RAG liên tục cho kết quả tốt hơn tinh chỉnh không giám sát khi cần đưa kiến thức vào mô hình, kể cả kiến thức hoàn toàn mới. Một nghiên cứu khác công bố tháng 05/2024 ghi nhận mô hình học kiến thức mới qua fine-tuning chậm hơn hẳn, và khi đã học được, xu hướng bịa thông tin tăng lên. Kết luận của họ: mô hình chủ yếu có kiến thức từ tiền huấn luyện, còn fine-tuning dạy nó dùng kiến thức đó hiệu quả hơn.

Trong thực tế, hai hướng thường kết hợp: RAG cung cấp sự thật cập nhật, fine-tuning lo cách trình bày. Bài RAG là gì và cách triển khai có phần so sánh chi tiết hơn; còn các kỹ thuật viết câu lệnh nên thử trước khi tinh chỉnh có trong bài hướng dẫn prompt engineering.

Quy trình fine-tuning gồm những bước nào?

Dù dùng dịch vụ đám mây hay tự chạy mô hình mở, quy trình tinh chỉnh mô hình bài bản thường gồm 8 bước.

Quy trình tinh chỉnh mô hình 8 bước 1. Xác định bài toán Thế nào là tốt hơn, đo bằng gì 2. Thử prompt, RAG trước Lập mức nền (baseline) để so sánh 3. Thu thập, gán nhãn Mẫu đầu vào và đầu ra chuẩn 4. Làm sạch, chia tập Tách train, validation, test 5. Chọn mô hình, cách làm Full, LoRA, QLoRA hay DPO 6. Huấn luyện, theo dõi Loss, siêu tham số, checkpoint 7. Đánh giá So với baseline, kiểm tra an toàn 8. Triển khai, giám sát Thu lỗi thực tế, tinh chỉnh lại
Hình 2. Đường nét đứt: nếu bước đánh giá chưa đạt, hãy quay lại sửa dữ liệu trước khi đổi siêu tham số hay đổi mô hình.
  1. Xác định bài toán và tiêu chí thành công. Viết rõ đầu vào, đầu ra mong muốn và cách đo, ví dụ “tóm tắt đủ 5 mục bắt buộc, không quá 150 chữ”.
  2. Thử prompt và RAG trước, lập mức nền. Ghi lại kết quả của mô hình gốc trên cùng bộ câu hỏi kiểm thử. Không có mức nền thì không biết fine-tuning có đáng không.
  3. Thu thập và gán nhãn dữ liệu. Lấy từ dữ liệu thật: email đã trả lời tốt, hồ sơ đã được chuyên gia duyệt, log hội thoại đã chỉnh sửa. Xem phần chuẩn bị dữ liệu bên dưới.
  4. Làm sạch, khử nhận dạng và chia tập. Loại mẫu trùng, mẫu sai, che dữ liệu cá nhân; tách tập huấn luyện (train), tập kiểm định (validation) và tập kiểm thử (test) không trùng nhau.
  5. Chọn mô hình gốc và phương pháp. Mô hình thương mại qua API hay mô hình mở tự chạy; full fine-tuning, LoRA, QLoRA hay DPO. Cân nhắc giấy phép sử dụng của mô hình mở.
  6. Huấn luyện và theo dõi. Theo dõi loss trên tập train và validation. Nếu loss train giảm mà validation tăng, mô hình đang học thuộc lòng (overfitting). Lưu các mốc (checkpoint) để chọn bản tốt nhất.
  7. Đánh giá. So với mức nền trên tập test, kiểm tra năng lực chung, an toàn và rò rỉ dữ liệu.
  8. Triển khai và giám sát. Chạy thử với nhóm nhỏ, thu lỗi thực tế, bổ sung vào dữ liệu cho vòng tinh chỉnh sau. Ghi phiên bản dữ liệu và mô hình để truy vết.

Chuẩn bị dữ liệu fine-tuning thế nào cho đúng?

Với fine-tuning, dữ liệu chính là “giáo trình”. Mô hình sẽ bắt chước mọi thứ có trong mẫu, kể cả lỗi chính tả, câu trả lời cẩu thả hay thiên lệch. Nguyên tắc garbage in, garbage out ở đây thể hiện rất rõ.

Mỗi mẫu dữ liệu trông ra sao?

Với tinh chỉnh có giám sát, mỗi mẫu là một cặp: đầu vào (câu hỏi, văn bản cần xử lý, có thể kèm hướng dẫn hệ thống) và đầu ra mong muốn. Nhiều nền tảng dùng định dạng JSONL, mỗi dòng là một đoạn hội thoại hoàn chỉnh. Với DPO, mỗi mẫu gồm một đầu vào cùng hai câu trả lời: câu được chọn và câu bị loại.

Cần bao nhiêu mẫu?

Không có con số chung. Một vài mốc tham khảo từ tài liệu chính thức:

  • Google cho biết nhiều trường hợp chỉ cần vài trăm đến vài nghìn ví dụ huấn luyện để tinh chỉnh LLM.
  • OpenAI yêu cầu tối thiểu 10 mẫu và khuyên bắt đầu với khoảng 50 mẫu được soạn kỹ rồi đánh giá. Nếu 50 mẫu không tạo ra cải thiện, họ khuyên xem lại cách đặt bài toán hoặc prompt trước khi thêm dữ liệu.

Cách làm an toàn: bắt đầu nhỏ, đo, rồi mới mở rộng ở đúng những loại tình huống mô hình còn yếu.

Gán nhãn và viết đáp án mẫu

Đáp án mẫu nên do người hiểu nghiệp vụ viết hoặc duyệt. Hãy soạn hướng dẫn gán nhãn (annotation guideline) gồm: định nghĩa từng nhãn, ví dụ đúng và sai, cách xử lý trường hợp mập mờ. Cho hai người gán độc lập một phần dữ liệu để đo mức đồng thuận; nếu họ hay bất đồng, hướng dẫn chưa đủ rõ. Bài data annotation là gì giải thích chi tiết quy trình và cách kiểm soát chất lượng gán nhãn.

Tiêu chí chất lượng của bộ dữ liệu

  • Đúng: mọi đáp án được chuyên gia xác nhận. Một mẫu sai được lặp lại vài lần đủ dạy mô hình sai.
  • Nhất quán: cùng loại đầu vào thì cùng kiểu đầu ra, cùng thuật ngữ, cùng định dạng.
  • Đa dạng và đại diện: có cả trường hợp dễ, khó, ngoại lệ, đúng tỷ lệ gặp trong thực tế.
  • Giống môi trường thật: câu hỏi viết như người dùng thật viết, kể cả viết tắt, không dấu, sai chính tả nếu người dùng hay gõ như vậy.
  • Sạch: không trùng lặp, không lẫn mẫu của tập test vào tập train, không chứa dữ liệu cá nhân không cần thiết.
  • Có nguồn gốc rõ: biết mẫu đến từ đâu, ai duyệt, phiên bản nào, để sửa khi phát hiện lỗi.

Lưu ý với tiếng Việt: chuẩn hoá Unicode về một dạng (dựng sẵn), thống nhất cách bỏ dấu (“hoà” hay “hòa”), viết hoa tên riêng, định dạng số và ngày. Mô hình sẽ học đúng sự không thống nhất nếu dữ liệu không thống nhất.

Đánh giá mô hình sau khi fine-tuning ra sao?

Loss giảm chưa có nghĩa mô hình tốt hơn với người dùng. Hãy đánh giá theo bốn lớp:

  1. Chất lượng nhiệm vụ chính. Chạy cả mô hình gốc và mô hình đã tinh chỉnh trên cùng tập test chưa từng dùng để huấn luyện. Bài toán phân loại, trích xuất thì đo độ chính xác, F1, tỷ lệ trường đúng. Bài toán viết thì chấm theo thang tiêu chí (rubric), bằng người hoặc bằng một mô hình khác làm giám khảo, nhưng nên đối chiếu một phần với người chấm.
  2. Năng lực chung. Kiểm tra lại các việc ngoài phạm vi tinh chỉnh mà hệ thống vẫn cần, như hiểu câu hỏi thông thường, suy luận đơn giản, tiếng Việt tự nhiên, để phát hiện quên kiến thức.
  3. An toàn và tuân thủ. Thử các yêu cầu không phù hợp, câu hỏi lừa, câu lệnh chèn (prompt injection) để xem mô hình còn từ chối đúng không.
  4. Rò rỉ dữ liệu. Thử gợi mô hình nhắc lại tên, số điện thoại, nội dung hợp đồng có trong dữ liệu huấn luyện.

Ngoài ra, đo cả độ trễ và chi phí mỗi lần gọi. Một mô hình tinh chỉnh tốt hơn một chút nhưng chậm gấp đôi có thể không đáng triển khai.

Chi phí fine-tuning phụ thuộc vào yếu tố nào?

Không có mức giá chung, vì chi phí thay đổi theo mô hình, nhà cung cấp và quy mô dữ liệu. Thay vì hỏi “fine-tune hết bao nhiêu”, hãy ước tính theo các yếu tố sau.

Yếu tốẢnh hưởng thế nào
Kích thước mô hình gốcMô hình càng nhiều tham số, càng cần nhiều bộ nhớ GPU và thời gian huấn luyện
Phương phápFull fine-tuning tốn nhất; LoRA và QLoRA giảm mạnh bộ nhớ và dung lượng lưu trữ
Khối lượng dữ liệu và số vòng (epoch)Dịch vụ đám mây thường tính theo số token huấn luyện; tự chạy thì tính theo giờ GPU
Chuẩn bị dữ liệuCông chuyên gia viết, duyệt đáp án và gán nhãn thường là khoản lớn và hay bị đánh giá thấp
Đánh giá và thử nghiệmNhiều vòng thử, chấm điểm bằng người hoặc bằng mô hình
Vận hành (suy luận)Phí gọi mô hình đã tinh chỉnh trên nền tảng, hoặc chi phí máy chủ GPU nếu tự triển khai
Bảo trìTinh chỉnh lại khi nghiệp vụ đổi, khi mô hình gốc có phiên bản mới hoặc bị ngừng hỗ trợ

Hãy kiểm tra bảng giá hiện hành của nhà cung cấp tại thời điểm triển khai, vì giá huấn luyện và giá suy luận của mô hình tinh chỉnh thường khác giá mô hình gốc.

Fine-tuning có những rủi ro gì?

Quên kiến thức cũ (catastrophic forgetting)

Khi học điều mới, mô hình có thể làm kém đi những việc trước đây làm tốt. Một nghiên cứu tháng 08/2023 ghi nhận hiện tượng này khi tinh chỉnh theo chỉ dẫn các mô hình từ 1 đến 7 tỷ tham số, ở cả kiến thức chuyên ngành, suy luận và đọc hiểu. Cách giảm: dùng tốc độ học nhỏ, số vòng vừa phải, trộn thêm một phần dữ liệu tổng quát, ưu tiên LoRA, và luôn chạy bộ kiểm tra năng lực chung.

Học thuộc lòng (overfitting)

Dữ liệu ít mà huấn luyện quá lâu, mô hình trả lời giống hệt mẫu và lúng túng trước câu hỏi hơi khác. Dấu hiệu là kết quả trên tập train rất tốt nhưng tập test kém.

Bịa thông tin nhiều hơn

Như nghiên cứu đã nêu ở trên, ép mô hình học các sự thật mới qua fine-tuning có thể làm tăng xu hướng bịa. Fine-tuning không phải thuốc chữa ảo giác AI; muốn câu trả lời bám dữ liệu, hãy dùng RAG và kiểm tra nguồn.

Suy giảm lớp an toàn

Nghiên cứu của Xiangyu Qi và cộng sự (10/2023) cho thấy chỉ với 10 mẫu độc hại, chi phí chưa tới 0,20 USD qua API, có thể phá lớp an toàn của GPT-3.5 Turbo. Đáng chú ý hơn, tinh chỉnh bằng dữ liệu bình thường, vô hại cũng có thể vô tình làm suy giảm mức độ an toàn. Vì vậy đánh giá an toàn phải chạy lại sau mỗi lần tinh chỉnh.

Rò rỉ dữ liệu huấn luyện

Mô hình có thể ghi nhớ và nhắc lại nguyên văn dữ liệu đã học. Nghiên cứu năm 2020 của Carlini và cộng sự trích xuất được hàng trăm đoạn văn bản nguyên văn từ dữ liệu huấn luyện GPT-2, gồm cả thông tin định danh cá nhân, có đoạn chỉ xuất hiện một lần trong dữ liệu. Nếu bạn tinh chỉnh bằng email khách hàng hay hồ sơ nhân sự, người dùng mô hình có thể moi được các thông tin này.

Đầu độc dữ liệu

Danh sách OWASP Top 10 cho ứng dụng LLM năm 2025 xếp “đầu độc dữ liệu và mô hình” (LLM04) là một rủi ro chính: dữ liệu tiền huấn luyện, tinh chỉnh hoặc embedding bị can thiệp để cài cửa hậu hay thiên lệch. OWASP khuyến nghị theo dõi nguồn gốc dữ liệu, kiểm soát phiên bản dữ liệu, thẩm định kỹ nhà cung cấp dữ liệu và kiểm thử tấn công (red team).

Phụ thuộc mô hình gốc

Mô hình tinh chỉnh gắn với một phiên bản mô hình gốc cụ thể. Khi nhà cung cấp ra phiên bản mới hoặc ngừng phiên bản cũ, bạn có thể phải tinh chỉnh lại. Hãy lưu giữ bộ dữ liệu, bộ đánh giá và cấu hình để làm lại nhanh.

Fine-tuning với dữ liệu cá nhân cần lưu ý gì?

Dữ liệu doanh nghiệp muốn dùng để tinh chỉnh thường chứa dữ liệu cá nhân: tên, số điện thoại, nội dung trao đổi của khách hàng, hồ sơ nhân viên. Khác với RAG, dữ liệu đã “ngấm” vào trọng số rất khó xoá riêng lẻ; muốn loại bỏ chắc chắn thường phải huấn luyện lại từ bộ dữ liệu đã làm sạch. Vì vậy cần xử lý từ đầu.

  • Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 (thông qua 26/06/2025, hiệu lực 01/01/2026), Điều 30: xử lý dữ liệu cá nhân bằng trí tuệ nhân tạo, dữ liệu lớn, điện toán đám mây phải đúng mục đích, trong phạm vi cần thiết, có biện pháp bảo mật, xác thực và phân quyền truy cập; xử lý bằng AI phải phân loại theo mức độ rủi ro.
  • Chuyển dữ liệu xuyên biên giới (Điều 20): dùng nền tảng ở ngoài lãnh thổ Việt Nam để xử lý dữ liệu cá nhân được tính là chuyển dữ liệu xuyên biên giới; bên chuyển phải lập hồ sơ đánh giá tác động gửi cơ quan chuyên trách trong 60 ngày kể từ lần chuyển đầu tiên, trừ các trường hợp luật miễn. Điều này liên quan trực tiếp khi bạn tải dữ liệu lên dịch vụ tinh chỉnh đặt máy chủ ở nước ngoài.
  • Dữ liệu nhạy cảm: Nghị định 356/2025/NĐ-CP (hiệu lực 01/01/2026) liệt kê các loại như thông tin sức khoẻ, tài chính, sinh trắc học, vị trí. Nên loại khỏi dữ liệu tinh chỉnh nếu không thật sự cần.
  • Luật Trí tuệ nhân tạo số 134/2025/QH15 (thông qua 10/12/2025, hiệu lực 01/03/2026), Điều 7 cấm thu thập, xử lý dữ liệu để huấn luyện hệ thống AI trái quy định về dữ liệu, dữ liệu cá nhân, sở hữu trí tuệ và an ninh mạng.

Danh sách việc nên làm trước khi tinh chỉnh:

  1. Xác định mục đích và kiểm tra cơ sở pháp lý cho việc dùng dữ liệu vào huấn luyện.
  2. Khử nhận dạng: thay tên, số điện thoại, số căn cước, địa chỉ bằng ký hiệu giả trước khi đưa vào bộ dữ liệu.
  3. Đọc kỹ điều khoản dịch vụ: dữ liệu tải lên được lưu ở đâu, bao lâu, có bị dùng cho mục đích khác không, mô hình tinh chỉnh thuộc quyền ai.
  4. Với dữ liệu nhạy cảm, cân nhắc tinh chỉnh mô hình mở trên hạ tầng do doanh nghiệp kiểm soát.
  5. Kiểm thử rò rỉ trước khi triển khai và ghi nhật ký phiên bản dữ liệu để đáp ứng yêu cầu truy vết.

Lưu ý: phần pháp lý trên chỉ tóm tắt các điểm liên quan đến tinh chỉnh mô hình, không thay thế tư vấn pháp lý. Trường hợp cụ thể cần đối chiếu văn bản gốc và hỏi bộ phận pháp chế.

Những hiểu lầm phổ biến về fine-tuning

  1. “Fine-tune là cách tốt nhất để AI biết tài liệu của công ty.” Thường không. Kiến thức hay thay đổi và cần trích nguồn phù hợp với RAG hơn.
  2. “Càng nhiều dữ liệu càng tốt.” Vài trăm mẫu đúng và nhất quán thường hơn hàng chục nghìn mẫu lẫn lỗi.
  3. “Tinh chỉnh xong là dùng mãi.” Nghiệp vụ đổi, mô hình gốc đổi, người dùng hỏi kiểu mới. Cần giám sát và tinh chỉnh lại định kỳ.
  4. “Fine-tuning làm mô hình an toàn hơn.” Có thể ngược lại. Lớp an toàn có thể yếu đi, nên luôn đánh giá lại.
  5. “Phải có đội nghiên cứu AI mới làm được.” Với dịch vụ tinh chỉnh có sẵn và LoRA, phần khó nhất thường là dữ liệu và đánh giá, không phải mã nguồn.

Câu hỏi thường gặp

Fine-tuning tiếng Việt là gì?

Fine-tuning dịch sang tiếng Việt là tinh chỉnh, tinh chỉnh mô hình hoặc tinh chỉnh AI: huấn luyện thêm một mô hình có sẵn bằng dữ liệu chuyên biệt để làm tốt một nhiệm vụ cụ thể.

Fine-tuning và training khác nhau thế nào?

Training từ đầu bắt đầu với trọng số ngẫu nhiên và cần lượng dữ liệu, tính toán rất lớn. Fine-tuning bắt đầu từ mô hình đã huấn luyện, chỉ cần dữ liệu nhỏ hơn nhiều để chuyên môn hoá.

LoRA là gì trong fine-tuning?

LoRA là phương pháp tinh chỉnh hiệu quả tham số: giữ nguyên mô hình gốc, chỉ huấn luyện thêm các ma trận nhỏ gắn vào từng lớp. Nhờ đó tốn ít bộ nhớ hơn và lưu được nhiều phiên bản tinh chỉnh gọn nhẹ cho cùng một mô hình gốc.

Có nên fine-tune ChatGPT hay các mô hình thương mại không?

Một số nhà cung cấp cho phép tinh chỉnh một số mô hình qua API. Chỉ nên làm khi đã thử prompt và RAG mà vẫn chưa đạt, có bộ dữ liệu chất lượng và bộ đánh giá rõ ràng, và đã kiểm tra điều khoản xử lý dữ liệu.

Cần bao nhiêu dữ liệu để fine-tune?

Tuỳ bài toán. Google cho biết thường chỉ cần vài trăm đến vài nghìn ví dụ; OpenAI khuyên bắt đầu với khoảng 50 mẫu chất lượng rồi đánh giá trước khi mở rộng.

Fine-tuning có làm mô hình hết bịa thông tin không?

Không. Fine-tuning có thể giảm lỗi trong phạm vi được dạy nhưng không loại bỏ ảo giác, thậm chí có thể làm tăng nếu ép mô hình học sự thật mới. Hãy kết hợp RAG và kiểm tra nguồn.

Có thể xoá dữ liệu khỏi mô hình đã fine-tune không?

Rất khó xoá riêng một thông tin khỏi trọng số. Cách chắc chắn là loại dữ liệu đó khỏi bộ huấn luyện rồi tinh chỉnh lại, nên hãy khử nhận dạng dữ liệu cá nhân ngay từ đầu.