Bắt đầu với AI

Transformer và Attention là gì?

Giải thích trực quan self-attention và Transformer: cách mô hình xem mối quan hệ giữa các phần của chuỗi mà không cần toán ma trận.

Trần Phương Nam Đăng 22 thg 9, 2026
Trong bài này

Transformer là kiến trúc đứng sau nhiều mô hình ngôn ngữ hiện đại. Một ý tưởng quan trọng là attention — cơ chế giúp mô hình xem mối quan hệ giữa các phần khác nhau của chuỗi.

Vì sao cần xem quan hệ giữa các phần của câu?

Ý nghĩa của một từ thường phụ thuộc vào các từ xung quanh, nên mô hình cần biết phần nào có liên quan tới phần đang xử lý.

Self-attention trực quan

Self-attention cho phép mỗi vị trí trong chuỗi đánh giá mức liên quan với các vị trí khác và kết hợp thông tin từ nhiều phần của context.

Transformer xử lý context ra sao?

Nhiều lớp attention và xử lý được xếp chồng để tạo các biểu diễn ngày càng giàu thông tin.

Encoder và decoder

Một số kiến trúc dùng encoder, decoder hoặc kết hợp cả hai tùy loại nhiệm vụ và mô hình.

Điều cần nhớ

  • Attention giúp mô hình xem quan hệ giữa các phần của chuỗi.
  • Transformer xếp nhiều lớp xử lý để xây biểu diễn context.
  • Có thể hiểu vai trò attention mà không cần toán ma trận.

Kiểm tra nhanh

  • Self-attention giúp mô hình làm gì?
  • Một từ có thể phụ thuộc từ ở xa trong câu không?
  • Encoder và decoder có vai trò hoàn toàn giống nhau không?
  • Transformer có liên hệ gì với nhiều LLM hiện đại?
Kiểm tra kiến thức

Kiểm tra nhanh những nội dung chính trong bài viết này.

Kiểm tra bài này