Trong bài này
Transformer là kiến trúc đứng sau nhiều mô hình ngôn ngữ hiện đại. Một ý tưởng quan trọng là attention — cơ chế giúp mô hình xem mối quan hệ giữa các phần khác nhau của chuỗi.
Vì sao cần xem quan hệ giữa các phần của câu?
Ý nghĩa của một từ thường phụ thuộc vào các từ xung quanh, nên mô hình cần biết phần nào có liên quan tới phần đang xử lý.
Self-attention trực quan
Self-attention cho phép mỗi vị trí trong chuỗi đánh giá mức liên quan với các vị trí khác và kết hợp thông tin từ nhiều phần của context.
Transformer xử lý context ra sao?
Nhiều lớp attention và xử lý được xếp chồng để tạo các biểu diễn ngày càng giàu thông tin.
Encoder và decoder
Một số kiến trúc dùng encoder, decoder hoặc kết hợp cả hai tùy loại nhiệm vụ và mô hình.
Điều cần nhớ
- Attention giúp mô hình xem quan hệ giữa các phần của chuỗi.
- Transformer xếp nhiều lớp xử lý để xây biểu diễn context.
- Có thể hiểu vai trò attention mà không cần toán ma trận.
Kiểm tra nhanh
- Self-attention giúp mô hình làm gì?
- Một từ có thể phụ thuộc từ ở xa trong câu không?
- Encoder và decoder có vai trò hoàn toàn giống nhau không?
- Transformer có liên hệ gì với nhiều LLM hiện đại?