Link gốc: jalammar.github.io/illustrated-transformer Tác giả: Jay Alammar - kỹ sư/nhà nghiên cứu, nổi tiếng với series blog “Illustrated…” giải thích các khái niệm machine learning bằng hình minh hoạ. Bài viết này sau đó được phát triển thành sách (bản mở rộng tại LLM-book.com). Hình thức: Bài viết (blog), miễn phí, bằng tiếng Anh - đã được dịch ra nhiều ngôn ngữ (Trung, Nhật, Hàn, Pháp, Nga, Tây Ban Nha… và cả tiếng Việt).
Tài liệu này nói gì
Phần tiêu đề “Tài liệu này nói gì”Bài viết năm 2018 giải thích cơ chế attention và kiến trúc Transformer - bài paper gốc “Attention Is All You Need” vốn khá khó đọc vì đầy công thức toán, còn bài viết này “dịch” kiến trúc đó sang hình minh hoạ từng bước: input được encode ra sao, self-attention tính toán thế nào, vì sao Transformer xử lý được ngữ cảnh dài mà vẫn train nhanh hơn kiến trúc cũ (RNN/LSTM).
Đây chính là kiến trúc nền - dù đã qua nhiều biến thể - mà Claude, GPT, Gemini và hầu hết LLM hiện đại đều dựa trên.
Vì sao đáng xem
Phần tiêu đề “Vì sao đáng xem”Được giảng dạy trong các khoá học tại Stanford, Harvard, MIT, Princeton, CMU - vì đây là cách dễ hiểu nhất để nắm được “bên trong LLM có gì” mà không cần đọc paper học thuật gốc. Đọc bài này trước khi xem Neural Networks: Zero to Hero sẽ giúp phần code dễ theo hơn nhiều.
Phù hợp với ai
Phần tiêu đề “Phù hợp với ai”Bất kỳ ai muốn hiểu kiến trúc Transformer ở mức khái niệm (không cần code) - từ người mới tìm hiểu AI tới developer đã dùng LLM nhưng chưa hiểu cơ chế bên trong.
lượt xem