0

Token là gì và cách nó ảnh hưởng đến cửa sổ ngữ cảnh của mô hình lớn

Token là gì và cách nó ảnh hưởng đến cửa sổ ngữ cảnh của mô hình lớn Hiểu rõ Token và mối quan hệ với cửa sổ ngữ cảnh trong các mô hình ngôn ngữ lớn Giới thiệu Khi làm việc với các mô hình ngôn ngữ lớn (LLM), thuật ngữ "token" thường xuyên xuất hiện nhưng không phải ai cũng hiểu rõ bản chất của nó. Token không chỉ là đơn vị tính toán cơ bản mà còn là yếu tố quyết định trực tiếp đến kích thước cửa sổ ngữ cảnh — khả năng mô hình có thể "nhớ" bao nhiêu thông tin trong một cuộc hội thoại. Bài viết này sẽ đi sâu vào nguyên lý tính toán token và mối quan hệ mật thiết của nó với hiệu suất xử lý ngữ cảnh của LLM. Token không phải là từ Điểm quan trọng đầu tiên cần hiểu: một token không tương đương với một từ. Trong tiếng Việt, một từ có thể được chia thành nhiều token, đặc biệt là các từ ghép hoặc thuật ngữ chuyên ngành. Ví dụ, "mô hình ngôn ngữ lớn" có thể được tách thành 3-4 token tùy thuộc vào thuật toán mã hóa BPE (Byte Pair Encoding) của từng mô hình. Nguyên lý đằng sau là các mô hình không xử lý văn bản theo ký tự hoặc từ hoàn chỉnh, mà theo các "đơn vị con từ" đã được học từ hàng terabyte dữ liệu huấn luyện. Phương pháp này giúp cân bằng giữa hiệu quả tính toán và khả năng biểu đạt ngôn ngữ. Đối với tiếng Việt, do đặc điểm dấu thanh và cấu trúc từ, tỷ lệ token trên từ thường cao hơn tiếng Anh khoảng 1.5-2 lần. Cửa sổ ngữ cảnh = Giới hạn token Khi nhà sản xuất công bố GPT-4 có cửa sổ 128k token hoặc Claude 3 hỗ trợ 200k token, con số đó chính là giới hạn tổng số token mà mô hình có thể xử lý trong một lần suy luận — bao gồm cả prompt người dùng và câu trả lời của mô hình. Điều này có ý nghĩa thực tế quan trọng: nếu bạn gửi một tài liệu 100.000 token làm ngữ cảnh, mô hình chỉ còn khoảng 28.000 token để tạo câu trả lời trong trường hợp GPT-4 128k. Vượt quá giới hạn này, thông tin ở đầu prompt sẽ bị "bỏ quên" hoặc gây lỗi tràn bộ đệm. Các chiến thuật như sliding window (cửa sổ trượt) hay summary compression (nén tóm tắt) ra đời chính để giải quyết hạn chế vật lý này, giúp các ứng dụng có thể làm việc với tài liệu dài hàng trăm trang mà không cần mở rộng cứng kích thước cửa sổ ngữ cảnh. Kết luận Hiểu được token hoạt động như thế nào và giới hạn của cửa sổ ngữ cảnh giúp lập trình viên thiết kế hệ thống hiệu quả hơn. Thay vì cố gắng "đổ" toàn bộ dữ liệu vào prompt một lần, chiến lược tốt hơn là tối ưu cấu trúc ngữ cảnh, chỉ đưa thông tin cần thiết vào mỗi lần gọi API. Đây cũng là nền tảng để hiểu sâu hơn về chi phí và tốc độ suy luận — hai chủ đề chúng ta sẽ khám phá trong các bài viết tiếp theo.


All rights reserved

Viblo
Hãy đăng ký một tài khoản Viblo để nhận được nhiều bài viết thú vị hơn.
Đăng kí