Tổng quan: Cỗ máy LLM
Bản đồ module + nền tối thiểu cho người vào thẳng đây: model là hàm học từ dữ liệu, train khác inference, output là phân phối xác suất. Rồi sáu mảnh ghép của cỗ máy sinh văn bản.
TL;DR: Module này mổ đúng một cỗ máy: LLM sinh văn bản bằng cách lặp lại một vòng — tokenize, nhìn context, tính phân phối xác suất cho token kế tiếp, chọn (sample) một token, decode, nối vào chuỗi, lặp lại. Sáu bài concept lần lượt bóc từng mảnh của vòng lặp đó: bước dự đoán, đơn vị token, giới hạn context, cách chọn (sampling/temperature), vì sao chat model cư xử khác base model, và vì sao hallucination là hệ quả tất yếu chứ không phải bug ngẫu nhiên. Học xong, bạn đọc một log lỗi LLM và chỉ đúng tầng nào hỏng — thay vì đoán mò.
Vì sao module này tồn tại
Bạn dùng LLM qua API mỗi ngày — chatbot hỗ trợ, sinh mô tả sản phẩm, tóm tắt tài liệu. Rồi những sự cố khó hiểu xuất hiện: hoá đơn API tăng gần gấp đôi dự tính dù nội dung tiếng Việt không đổi nhiều; bot được dặn một yêu cầu ở tin nhắn đầu, tới tin nhắn bốn mươi coi như chưa từng nghe; temperature vặn lên "cho sinh động" lại ra câu đứt mạch, lặp một cụm từ vô nghĩa; hỏi cùng một câu ba lần trong ba phiên riêng, nhận về ba đáp án khác hẳn nhau — một trong ba còn kèm chi tiết nghe rất thật nhưng hoàn toàn bịa.
Phản xạ tự nhiên là gắn mỗi sự cố với một lời giải thích riêng: "chắc do prompt chưa đủ tốt", "chắc do model hôm nay tệ", "chắc phải đổi model xịn hơn". Nhưng cả bốn sự cố trên đều bắt nguồn từ đúng một cơ chế: model dự đoán token kế tiếp, lặp đi lặp lại, không có bước nào kiểm tra sự thật hay ghi nhớ dài hạn. Nắm được cơ chế đó, bạn không cần nhớ bốn lời giải thích rời rạc — bạn suy ra được cả bốn, và đoán trước được cả sự cố thứ năm chưa từng gặp.
Nếu bạn vào thẳng module này — chưa hoàn thành Module 1 (Bản đồ AI) hay Module 2 (Não nhân tạo vừa đủ) — ba điều sau là đủ để không lạc ngay từ bài 01:
- Model là một hàm học được từ dữ liệu. Hàng tỷ tham số (trọng số) được chỉnh dần qua một quá trình gọi là train, không phải một tập luật if-else viết tay bởi con người.
- Train khác inference. Train là lúc trọng số được học — chạy một lần, tốn nhiều thời gian và tài nguyên. Inference là mỗi lần bạn gọi API: trọng số đã cố định, model chỉ tính toán trên đầu vào mới. Toàn bộ module này nói về inference.
- Output của model là một phân phối xác suất, không phải một câu trả lời tính sẵn. Bài 01 trace chính xác bước này — đây là mảnh ghép đầu tiên và quan trọng nhất.
Sau module này bạn sẽ
- Trace vòng lặp sinh văn bản của LLM: tokenize → context → dự đoán phân phối → sample → decode
- Explain vì sao model xử lý token thay vì ký tự, và hệ quả với tiếng Việt, code và chi phí API
- Predict hành vi model khi context window tràn và khi temperature/top-p thay đổi
- Distinguish base model vs chat model qua vai trò của SFT và RLHF
- Diagnose hallucination từ cơ chế next-token thay vì coi nó là bug ngẫu nhiên
Lộ trình module

Sáu bài concept (01–06) xếp theo đúng thứ tự phụ thuộc, không hoán đổi được. Bài 01 dựng vòng lặp autoregressive — nền mà mọi bài sau dựa vào. Bài 02 gọi tên chính xác đơn vị model xử lý (token) — cần biết trước khi nói tới context window (đo bằng token) hay chi phí API (tính theo token). Bài 03 trả lời câu hỏi: "toàn bộ token đứng trước" mà bài 01 nhắc tới, lớn được tới đâu — đó là context window. Bài 04 mổ đúng bước "chọn" mà bài 01 mới nêu tên chứ chưa giải thích — sampling, temperature, top-p. Tới hết bài 04, bốn bài đã dựng xong toàn bộ cơ chế sinh văn bản thô.
Bài 05 rẽ sang một trục khác: vẫn đúng cơ chế đó, nhưng huấn luyện thêm (SFT rồi RLHF) đổi hành vi model thế nào — vì sao chat model biết dừng, biết trả lời thẳng, còn base model thô chỉ viết tiếp theo thống kê. Bài 06 gộp lại ba mảnh trước (01, 03, 04) để giải thích hallucination: không phải bug, mà hệ quả tất yếu khi phân phối xác suất không được neo vững bởi dữ liệu train hay context.
Bài 07 — mini-challenge — không dạy khái niệm mới. Nó đưa ba log lỗi thật, buộc bạn tự chẩn đoán cơ chế đứng sau bằng đúng bốn công cụ vừa học (tokenization, context, sampling, hallucination) trước khi xem lời giải — đây là bài kiểm tra thật sự bạn hiểu cơ chế hay chỉ nhớ tên gọi. Bài 08 gói mọi thứ vào một cheat sheet một trang và self-assessment theo đúng năm learning outcome ở trên.
Yêu cầu trước khi bắt đầu
- Không bắt buộc phải hoàn thành Module 1 (Bản đồ AI) hay Module 2 (Não nhân tạo vừa đủ) trước — module này tự chứa, phần "nền tối thiểu" ở trên là đủ để bắt đầu. Có thời gian thì hai module đó cho trực giác sâu hơn về "học từ dữ liệu" và "trọng số" mà bài 05 có nhắc lại.
- Đã từng dùng một chatbot AI hoặc gọi LLM API (ChatGPT, Claude, Gemini...) ít nhất vài lần — module dùng nhiều ví dụ giả định bạn đã thấy hành vi model trong thực tế.
- Không cần biết code ML, không cần biết Python. Pseudocode trong bài đọc được bằng logic lập trình thông thường — không phải cú pháp một ngôn ngữ cụ thể.
Time budget
| Bài | Chủ đề | Thời lượng |
|---|---|---|
| 00 | Tổng quan (bài này) | ~5 phút |
| 01 | Dự đoán token kế tiếp | ~12 phút |
| 02 | Tokenization | ~13 phút |
| 03 | Context window | ~12 phút |
| 04 | Sampling — temperature & top-p | ~11 phút |
| 05 | Từ base model đến chat model | ~11 phút |
| 06 | Hallucination | ~13 phút |
| 07 | Mini-challenge — đọc log ba sự cố | ~15 phút |
| 08 | Tổng kết & cheat sheet | ~6 phút |
| Tổng | ~1 giờ 38 phút |
Cách học module này hiệu quả
- Làm nghiêm túc mọi ô "Thử đoán". Gần như bài nào cũng dừng lại bắt bạn tự viết dự đoán trước khi đọc giải thích — bỏ qua bước này là bỏ qua chính công cụ giúp bạn kiểm tra mình đã hiểu cơ chế đủ để dự đoán, không chỉ nhớ chữ.
- Đừng học bài 06 tách rời. Hallucination chỉ trọn nghĩa khi bạn đã nắm bài 01 (không có bước fact-check), bài 03 (context thiếu thông tin) và bài 04 (temperature làm phân phối phẳng) — ba bài đó là nguyên liệu trực tiếp của bài 06.
- Bài 07 là lúc kiểm tra thật. Nếu chẩn đoán sai một log, đừng đoán tiếp — quay lại đúng bài tương ứng (02/03/04/06) đọc lại phần cơ chế trước khi xem lời giải.
- Nếu vào thẳng module này, đọc kỹ phần "nền tối thiểu" ở trên trước khi sang bài 01 — ba ý đó (hàm học từ dữ liệu, train khác inference, output là phân phối xác suất) là toàn bộ nền bạn cần, không thiếu gì thêm.
Bài tiếp theo: Dự đoán token kế tiếp — vòng lặp sinh văn bản
Bài này đáng gửi cho bạn học cùng?
Copy link đã gắn nguồn — dán group, chat, hoặc LinkedIn.
Bài này có giúp bạn hiểu bản chất không?
Hỏi đáp về bài này
Chưa có câu hỏi
Có gì chưa rõ trong bài? Đặt câu hỏi đầu tiên — câu trả lời từ cộng đồng giúp bạn (và người sau).
Đặt câu hỏi đầu tiên