AI Core cho lập trình viên/Tổng quan: Bản đồ AI & học từ dữ liệu
1/54
Bài 1 / 54~5 phútBản đồ AI & học từ dữ liệuMiễn phí lượt xem

Tổng quan: Bản đồ AI & học từ dữ liệu

Bản đồ module: từ câu hỏi 'bài toán này có cần AI không' tới chỗ LLM đứng trên bản đồ. Không cần nền toán hay ML — chỉ cần đã biết code.

TL;DR: Module này trả lời câu hỏi đứng trước mọi câu hỏi khác về AI: bài toán này có thật sự cần học từ dữ liệu không, hay if-else viết tay vẫn thắng? Nếu cần, model học theo tín hiệu nào — nhãn có sẵn, cấu trúc dữ liệu, hay điểm thưởng chỉ đánh giá chứ không chỉ dẫn — và chính nhãn cùng cách chia dữ liệu đó quyết định hành vi thật của model. Module vạch ranh giới cứng giữa lúc model còn học (train) và lúc chỉ chạy (inference), dạy cách đọc ba con số train/validation/production để bắt overfitting và data leakage, rồi định vị LLM trên bản đồ AI ⊃ machine learningdeep learninggenerative AI. Module không dạy cách xây model — dạy cách đọc đúng mọi tài liệu AI mà không lạc thuật ngữ.

Vì sao module này tồn tại

Bạn là kỹ sư phần mềm, biết code, chưa từng học máy. Sếp giao một ticket: "thêm AI vào tính năng X." Trước khi viết được một dòng liên quan tới AI, có cả một lớp câu hỏi phải trả lời trước: bài toán này có thật sự cần học từ dữ liệu không, hay nó chỉ là if-else viết chưa xong? Nếu cần, model học theo cách nào trong ba cách khác hẳn nhau? Dữ liệu và nhãn nó dùng có đáng tin không? Con số đo đẹp trên máy bạn có còn đúng khi chạy thật? Và khi đồng nghiệp nhắc tới GPT hay Claude, nó khác gì với một model chấm điểm rủi ro tín dụng bạn vừa nghe qua?

Không câu hỏi nào trong số đó cần bạn hiểu công thức lan truyền ngược hay kiến trúc transformer. Đó là lý do module này tồn tại — nó là bản đồ, không phải bản vẽ kỹ thuật. Cơ chế bên trong một mạng nơ-ron học ra sao thuộc module Mạng nơ-ron; cỗ máy vận hành một LLM — tokenization, attention, sinh văn bản — thuộc module Cỗ máy LLM. Module này chỉ trả lời: khi nào cần đi sâu vào những module đó, và khi đọc một bài viết hay tài liệu nhắc tới train, nhãn, overfitting hay LLM, bạn hiểu đúng nó đang nói về cái gì — không lạc thuật ngữ, không nhầm khái niệm.

Sau module này bạn sẽ

  • Justify khi nào một bài toán thật sự cần học từ dữ liệu, và khi nào rule-based vẫn là lựa chọn đúng — không phải phản xạ "cứ có dữ liệu là nên dùng AI"
  • Distinguish ba kiểu học qua đúng một trục — tín hiệu model nhận được để biết mình đúng hay sai — và định vị LLM trên bản đồ AI/machine learning/deep learning/generative AI
  • Explain vì sao dữ liệu, nhãn và cách chia train/validation/test quyết định hành vi thật của model, không chỉ là thủ tục hình thức
  • Compare hai pha train và inference theo chi phí, độ trễ, và thứ gì thay đổi được ở mỗi pha
  • Diagnose overfitting và data leakage từ mô tả một hệ đo đẹp offline nhưng hỏng khi chạy thật

Lộ trình module

Tám bài chia thành ba khối nối tiếp nhau. Ba bài đầu dựng nền: bài 01 trả lời "có cần học từ dữ liệu không" bằng bốn câu hỏi quyết định, đặt ranh giới rõ với rule-based. Bài 02 tách "học từ dữ liệu" nói chung ở bài 01 thành ba tín hiệu dạy khác hẳn nhau — supervised, unsupervised, reinforcement. Bài 03 mổ xẻ tiếp trục nhãn: nhãn là gì, vì sao nhãn sai không công cụ nào bắt được, và luật tách train/validation/test trước khi chạm vào dữ liệu.

Hai bài giữa lật qua vòng đời một model đã có. Bài 04 vạch ranh giới cứng giữa train (trọng số còn đổi) và inference (trọng số đóng băng) — giải thích luôn vì sao chatbot "nhớ" bạn dù không trọng số nào bị sửa. Bài 05 dùng bộ ba con số train/validation/production để chẩn đoán overfitting và data leakage — lý do phổ biến nhất khiến demo đẹp mà production hỏng.

Bài 06 kéo mọi thứ lên một bản đồ lớn hơn: AI ⊃ machine learning ⊃ deep learning ⊃ generative AI, định vị LLM ở ô trong cùng, và hé lộ một điều bất ngờ — pretraining một LLM vẫn là học có tín hiệu dạy, chỉ khác nhãn tự sinh từ chính văn bản. Bài 07 là mini-challenge capstone: ba ticket nghe giống hệt nhau "cần AI", bạn tự phân loại paradigm và chẩn đoán lỗi đo trước khi đọc lời giải — một bài không cần chạy model nào. Bài 08 gom lại thành cheat sheet và tự đánh giá theo đúng năm outcome ở trên.

Bản đồ module chia tám bài thành ba khối: khối một dựng nền với rule-based, ba kiểu học và chia tập; khối hai đi qua vòng đời một model gồm train vs inference và overfitting; khối ba lên bản đồ lớn với LLM, mini-challenge và tổng kết

Đọc theo đúng thứ tự: 01 — Khi nào cần học từ dữ liệu, 02 — Ba kiểu học, 03 — Dữ liệu, nhãn và chia tập, 04 — Train vs inference, 05 — Overfitting & data leakage, 06 — LLM trên bản đồ, 07 — Mini-challenge: đọc mô tả hệ AI.

Yêu cầu trước khi bắt đầu

  • Không cần nền toán hay ML — chỉ cần đã biết lập trình (đọc if-else, hàm, vòng lặp) là đủ để theo hết module.
  • Không cần cài đặt công cụ hay môi trường gì — cả module chỉ dùng pseudocode để minh hoạ cơ chế, không có bài lab code chạy được.
  • Đây là module mở đầu của khoá — không có module nào trước nó cần đọc.

Time budget

BàiNội dungThời gian
01Khi nào cần học từ dữ liệu, khi nào if-else vẫn thắng13 phút
02Ba kiểu học13 phút
03Dữ liệu, nhãn và ba tập không được trộn12 phút
04Train vs inference13 phút
05Overfitting & data leakage13 phút
06LLM trên bản đồ12 phút
07Mini-challenge: đọc ba mô tả hệ thống13 phút
08Tổng kết module~6 phút

Tổng khoảng 1h35.

Cách học module này hiệu quả

  • Đừng nhảy cóc: bài 03 dùng lại trục "đủ ví dụ" đã mở ở bài 01, bài 06 recall cả bài 02 (ba kiểu học) lẫn bài 04 (train/inference) — đọc lệch thứ tự thì phần lớn "vì sao" trong bài sẽ trống.
  • Gặp callout "Thử đoán" thì viết ra dự đoán trước khi đọc tiếp — bài 03, 05, 06 đều dùng mẫu này, và phần giải thích ngay sau chỉ có tác dụng khi bạn đã tự đoán trước.
  • Ở bài 07, thật sự viết câu trả lời cho cả ba scenario trước khi cuộn xuống lời giải — mini-challenge này chấm bằng lập luận, không có một đáp án đúng tuyệt đối.
  • Gặp một khái niệm nghe quen tay (nhãn, train, paradigm học), mở lại Recall gắn trong bài thay vì đoán — vài dòng ôn ngắn thường quyết định bạn hiểu đúng hay hiểu lệch phần còn lại của bài.

Bài này đáng gửi cho bạn học cùng?

Copy link đã gắn nguồn — dán group, chat, hoặc LinkedIn.

Bài này có giúp bạn hiểu bản chất không?

Hỏi đáp về bài này

Chưa có câu hỏi

Đặt câu hỏi

Có gì chưa rõ trong bài? Đặt câu hỏi đầu tiên — câu trả lời từ cộng đồng giúp bạn (và người sau).

Đặt câu hỏi đầu tiên

Bài tiếp theo

Khi nào cần học từ dữ liệu, khi nào if-else vẫn thắng