Trong bài này
Mô hình ngôn ngữ không xử lý văn bản theo đúng cách con người nhìn từng từ. Nội dung được chia thành các đơn vị gọi là token; một token có thể là một từ, một phần của từ hoặc dấu câu.
Token và tokenization
Tokenization là quá trình biến dữ liệu đầu vào thành các đơn vị mà mô hình có thể xử lý.
Một từ có thể thành nhiều token
Token không tương đương tuyệt đối với từ. Cách chia phụ thuộc tokenizer, ngôn ngữ và chuỗi ký tự.
Input và output đều dùng token
Token được dùng cho cả thông tin đưa vào và nội dung mô hình sinh ra.
Token liên quan context và chi phí
Context window thường được mô tả bằng số token mô hình có thể xử lý; với API, token cũng thường liên quan đến mức sử dụng.
Điều cần nhớ
- Token không nhất thiết bằng một từ.
- Cả input và output đều sử dụng token.
- Token liên hệ trực tiếp với context mà mô hình có thể xử lý.
Kiểm tra nhanh
- Một từ luôn bằng đúng một token đúng hay sai?
- Input token và output token khác nhau ở điểm nào?
- Context window thường liên quan đến đại lượng gì?
- Hình ảnh có nhất thiết được xử lý giống token văn bản không?