Nội dung
Danh sách bài học
- 01~5 phút
Tổng quan: Transformer & attention
Bản đồ module: từ nỗi đau của model đọc tuần tự, qua attention và transformer block, đến decoder-only LLM và scaling laws — đủ để đọc sơ đồ kiến trúc, không cần PhD.
- 02~12 phút
Nỗi đau của model đọc tuần tự trước khi có transformer
Trước transformer, model đọc văn bản từng token một: phụ thuộc xa bị quên dần, train không song song hoá được — hai nỗi đau attention sẽ giải quyết.
- 03~13 phút
Query/Key/Value: attention là phép tra cứu mềm có trọng số
Attention để mỗi token tự hỏi các token khác qua query, key, value — lấy thông tin liên quan nhất, không cần đi qua nút cổ chai hidden state tuần tự.
- 04~11 phút
Multi-head attention — mỗi head một góc nhìn riêng
Một head attention chỉ bắt được một kiểu quan hệ. Chạy nhiều head song song, mỗi head học một góc nhìn — ngữ pháp, đồng tham chiếu, vị trí — rồi ghép lại.
- 05~13 phút
Transformer block: ghép attention, FFN, residual thành khối
Attention tự nó không biết thứ tự — cần positional encoding. Ghép encoding, self-attention, FFN và residual thành một block, xếp chồng N lớp thành model.
- 06~13 phút
Từ transformer đến LLM: causal mask và train song song
Causal mask ép token chỉ nhìn quá khứ để train song song mọi vị trí, còn inference vẫn sinh tuần tự từng token, chậm dần theo số token sinh ra.
- 07~12 phút
Scaling laws — dự đoán loss khi tăng params, data, compute
Thêm params, data, compute thì loss giảm theo quy luật trơn — và Chinchilla chỉ ra model to mà thiếu data là lãng phí. Đọc định tính, không công thức.
- 08~15 phút
Mini-challenge: đọc sơ đồ kiến trúc LLM
Cầm sơ đồ kiến trúc và model card của một LLM thật: chỉ ra khối transformer, giải nghĩa layers/heads/params/context — bằng chính vốn từ vừa học trong module.
- 09~6 phút
Tổng kết: Transformer & attention
Ghép lại bức tranh: từ nỗi đau tuần tự đến attention, transformer block, decoder-only LLM và scaling laws — kèm self-assessment theo learning outcomes.