OLHub

Transformer & attention

Vì sao model tuần tự cũ đau, attention 'nhìn' token nào khi predict, big picture kiến trúc transformer, và scaling laws mức định tính. Một module, không PhD.

9 bài · ~100 phútMiễn phí

Nội dung

Danh sách bài học

  1. 01

    Tổng quan: Transformer & attention

    Bản đồ module: từ nỗi đau của model đọc tuần tự, qua attention và transformer block, đến decoder-only LLM và scaling laws — đủ để đọc sơ đồ kiến trúc, không cần PhD.

    ~5 phút
  2. 02

    Nỗi đau của model đọc tuần tự trước khi có transformer

    Trước transformer, model đọc văn bản từng token một: phụ thuộc xa bị quên dần, train không song song hoá được — hai nỗi đau attention sẽ giải quyết.

    ~12 phút
  3. 03

    Query/Key/Value: attention là phép tra cứu mềm có trọng số

    Attention để mỗi token tự hỏi các token khác qua query, key, value — lấy thông tin liên quan nhất, không cần đi qua nút cổ chai hidden state tuần tự.

    ~13 phút
  4. 04

    Multi-head attention — mỗi head một góc nhìn riêng

    Một head attention chỉ bắt được một kiểu quan hệ. Chạy nhiều head song song, mỗi head học một góc nhìn — ngữ pháp, đồng tham chiếu, vị trí — rồi ghép lại.

    ~11 phút
  5. 05

    Transformer block: ghép attention, FFN, residual thành khối

    Attention tự nó không biết thứ tự — cần positional encoding. Ghép encoding, self-attention, FFN và residual thành một block, xếp chồng N lớp thành model.

    ~13 phút
  6. 06

    Từ transformer đến LLM: causal mask và train song song

    Causal mask ép token chỉ nhìn quá khứ để train song song mọi vị trí, còn inference vẫn sinh tuần tự từng token, chậm dần theo số token sinh ra.

    ~13 phút
  7. 07

    Scaling laws — dự đoán loss khi tăng params, data, compute

    Thêm params, data, compute thì loss giảm theo quy luật trơn — và Chinchilla chỉ ra model to mà thiếu data là lãng phí. Đọc định tính, không công thức.

    ~12 phút
  8. 08

    Mini-challenge: đọc sơ đồ kiến trúc LLM

    Cầm sơ đồ kiến trúc và model card của một LLM thật: chỉ ra khối transformer, giải nghĩa layers/heads/params/context — bằng chính vốn từ vừa học trong module.

    ~15 phút
  9. 09

    Tổng kết: Transformer & attention

    Ghép lại bức tranh: từ nỗi đau tuần tự đến attention, transformer block, decoder-only LLM và scaling laws — kèm self-assessment theo learning outcomes.

    ~6 phút