Bỏ qua để đến nội dung

The Illustrated Transformer - Jay Alammar

Bài viết được dịch tự động từ bài viết gốc, chưa được kiểm tra lại bởi con người. Chỉ những bài viết có dấu tick xanh cạnh tiêu đề là đã được kiểm tra.

Link gốc: jalammar.github.io/illustrated-transformer Tác giả: Jay Alammar - kỹ sư/nhà nghiên cứu, nổi tiếng với series blog “Illustrated…” giải thích các khái niệm machine learning bằng hình minh hoạ. Bài viết này sau đó được phát triển thành sách (bản mở rộng tại LLM-book.com). Hình thức: Bài viết (blog), miễn phí, bằng tiếng Anh - đã được dịch ra nhiều ngôn ngữ (Trung, Nhật, Hàn, Pháp, Nga, Tây Ban Nha… và cả tiếng Việt).

Bài viết năm 2018 giải thích cơ chế attention và kiến trúc Transformer - bài paper gốc “Attention Is All You Need” vốn khá khó đọc vì đầy công thức toán, còn bài viết này “dịch” kiến trúc đó sang hình minh hoạ từng bước: input được encode ra sao, self-attention tính toán thế nào, vì sao Transformer xử lý được ngữ cảnh dài mà vẫn train nhanh hơn kiến trúc cũ (RNN/LSTM).

Đây chính là kiến trúc nền - dù đã qua nhiều biến thể - mà Claude, GPT, Gemini và hầu hết LLM hiện đại đều dựa trên.

Được giảng dạy trong các khoá học tại Stanford, Harvard, MIT, Princeton, CMU - vì đây là cách dễ hiểu nhất để nắm được “bên trong LLM có gì” mà không cần đọc paper học thuật gốc. Đọc bài này trước khi xem Neural Networks: Zero to Hero sẽ giúp phần code dễ theo hơn nhiều.

Bất kỳ ai muốn hiểu kiến trúc Transformer ở mức khái niệm (không cần code) - từ người mới tìm hiểu AI tới developer đã dùng LLM nhưng chưa hiểu cơ chế bên trong.