Tổng quan: Bản đồ AI & học từ dữ liệu
Bản đồ module: từ câu hỏi 'bài toán này có cần AI không' tới chỗ LLM đứng trên bản đồ. Không cần nền toán hay ML — chỉ cần đã biết code.
TL;DR: Module này trả lời câu hỏi đứng trước mọi câu hỏi khác về AI: bài toán này có thật sự cần học từ dữ liệu không, hay if-else viết tay vẫn thắng? Nếu cần, model học theo tín hiệu nào — nhãn có sẵn, cấu trúc dữ liệu, hay điểm thưởng chỉ đánh giá chứ không chỉ dẫn — và chính nhãn cùng cách chia dữ liệu đó quyết định hành vi thật của model. Module vạch ranh giới cứng giữa lúc model còn học (train) và lúc chỉ chạy (inference), dạy cách đọc ba con số train/validation/production để bắt overfitting và data leakage, rồi định vị LLM trên bản đồ AI ⊃ machine learning ⊃ deep learning ⊃ generative AI. Module không dạy cách xây model — dạy cách đọc đúng mọi tài liệu AI mà không lạc thuật ngữ.
Vì sao module này tồn tại
Bạn là kỹ sư phần mềm, biết code, chưa từng học máy. Sếp giao một ticket: "thêm AI vào tính năng X." Trước khi viết được một dòng liên quan tới AI, có cả một lớp câu hỏi phải trả lời trước: bài toán này có thật sự cần học từ dữ liệu không, hay nó chỉ là if-else viết chưa xong? Nếu cần, model học theo cách nào trong ba cách khác hẳn nhau? Dữ liệu và nhãn nó dùng có đáng tin không? Con số đo đẹp trên máy bạn có còn đúng khi chạy thật? Và khi đồng nghiệp nhắc tới GPT hay Claude, nó khác gì với một model chấm điểm rủi ro tín dụng bạn vừa nghe qua?
Không câu hỏi nào trong số đó cần bạn hiểu công thức lan truyền ngược hay kiến trúc transformer. Đó là lý do module này tồn tại — nó là bản đồ, không phải bản vẽ kỹ thuật. Cơ chế bên trong một mạng nơ-ron học ra sao thuộc module Mạng nơ-ron; cỗ máy vận hành một LLM — tokenization, attention, sinh văn bản — thuộc module Cỗ máy LLM. Module này chỉ trả lời: khi nào cần đi sâu vào những module đó, và khi đọc một bài viết hay tài liệu nhắc tới train, nhãn, overfitting hay LLM, bạn hiểu đúng nó đang nói về cái gì — không lạc thuật ngữ, không nhầm khái niệm.
Sau module này bạn sẽ
- Justify khi nào một bài toán thật sự cần học từ dữ liệu, và khi nào rule-based vẫn là lựa chọn đúng — không phải phản xạ "cứ có dữ liệu là nên dùng AI"
- Distinguish ba kiểu học qua đúng một trục — tín hiệu model nhận được để biết mình đúng hay sai — và định vị LLM trên bản đồ AI/machine learning/deep learning/generative AI
- Explain vì sao dữ liệu, nhãn và cách chia train/validation/test quyết định hành vi thật của model, không chỉ là thủ tục hình thức
- Compare hai pha train và inference theo chi phí, độ trễ, và thứ gì thay đổi được ở mỗi pha
- Diagnose overfitting và data leakage từ mô tả một hệ đo đẹp offline nhưng hỏng khi chạy thật
Lộ trình module
Tám bài chia thành ba khối nối tiếp nhau. Ba bài đầu dựng nền: bài 01 trả lời "có cần học từ dữ liệu không" bằng bốn câu hỏi quyết định, đặt ranh giới rõ với rule-based. Bài 02 tách "học từ dữ liệu" nói chung ở bài 01 thành ba tín hiệu dạy khác hẳn nhau — supervised, unsupervised, reinforcement. Bài 03 mổ xẻ tiếp trục nhãn: nhãn là gì, vì sao nhãn sai không công cụ nào bắt được, và luật tách train/validation/test trước khi chạm vào dữ liệu.
Hai bài giữa lật qua vòng đời một model đã có. Bài 04 vạch ranh giới cứng giữa train (trọng số còn đổi) và inference (trọng số đóng băng) — giải thích luôn vì sao chatbot "nhớ" bạn dù không trọng số nào bị sửa. Bài 05 dùng bộ ba con số train/validation/production để chẩn đoán overfitting và data leakage — lý do phổ biến nhất khiến demo đẹp mà production hỏng.
Bài 06 kéo mọi thứ lên một bản đồ lớn hơn: AI ⊃ machine learning ⊃ deep learning ⊃ generative AI, định vị LLM ở ô trong cùng, và hé lộ một điều bất ngờ — pretraining một LLM vẫn là học có tín hiệu dạy, chỉ khác nhãn tự sinh từ chính văn bản. Bài 07 là mini-challenge capstone: ba ticket nghe giống hệt nhau "cần AI", bạn tự phân loại paradigm và chẩn đoán lỗi đo trước khi đọc lời giải — một bài không cần chạy model nào. Bài 08 gom lại thành cheat sheet và tự đánh giá theo đúng năm outcome ở trên.

Đọc theo đúng thứ tự: 01 — Khi nào cần học từ dữ liệu, 02 — Ba kiểu học, 03 — Dữ liệu, nhãn và chia tập, 04 — Train vs inference, 05 — Overfitting & data leakage, 06 — LLM trên bản đồ, 07 — Mini-challenge: đọc mô tả hệ AI.
Yêu cầu trước khi bắt đầu
- Không cần nền toán hay ML — chỉ cần đã biết lập trình (đọc if-else, hàm, vòng lặp) là đủ để theo hết module.
- Không cần cài đặt công cụ hay môi trường gì — cả module chỉ dùng pseudocode để minh hoạ cơ chế, không có bài lab code chạy được.
- Đây là module mở đầu của khoá — không có module nào trước nó cần đọc.
Time budget
| Bài | Nội dung | Thời gian |
|---|---|---|
| 01 | Khi nào cần học từ dữ liệu, khi nào if-else vẫn thắng | 13 phút |
| 02 | Ba kiểu học | 13 phút |
| 03 | Dữ liệu, nhãn và ba tập không được trộn | 12 phút |
| 04 | Train vs inference | 13 phút |
| 05 | Overfitting & data leakage | 13 phút |
| 06 | LLM trên bản đồ | 12 phút |
| 07 | Mini-challenge: đọc ba mô tả hệ thống | 13 phút |
| 08 | Tổng kết module | ~6 phút |
Tổng khoảng 1h35.
Cách học module này hiệu quả
- Đừng nhảy cóc: bài 03 dùng lại trục "đủ ví dụ" đã mở ở bài 01, bài 06 recall cả bài 02 (ba kiểu học) lẫn bài 04 (train/inference) — đọc lệch thứ tự thì phần lớn "vì sao" trong bài sẽ trống.
- Gặp callout "Thử đoán" thì viết ra dự đoán trước khi đọc tiếp — bài 03, 05, 06 đều dùng mẫu này, và phần giải thích ngay sau chỉ có tác dụng khi bạn đã tự đoán trước.
- Ở bài 07, thật sự viết câu trả lời cho cả ba scenario trước khi cuộn xuống lời giải — mini-challenge này chấm bằng lập luận, không có một đáp án đúng tuyệt đối.
- Gặp một khái niệm nghe quen tay (nhãn, train, paradigm học), mở lại
Recallgắn trong bài thay vì đoán — vài dòng ôn ngắn thường quyết định bạn hiểu đúng hay hiểu lệch phần còn lại của bài.
Bài này đáng gửi cho bạn học cùng?
Copy link đã gắn nguồn — dán group, chat, hoặc LinkedIn.
Bài này có giúp bạn hiểu bản chất không?
Hỏi đáp về bài này
Chưa có câu hỏi
Có gì chưa rõ trong bài? Đặt câu hỏi đầu tiên — câu trả lời từ cộng đồng giúp bạn (và người sau).
Đặt câu hỏi đầu tiên