Context window (cửa sổ ngữ cảnh) là lượng thông tin tối đa mà một mô hình AI có thể đọc và xử lý trong một lượt tương tác, tính bằng token. Đây là một trong những thông số quan trọng nhất khi đánh giá và chọn mô hình ngôn ngữ lớn, vì nó quyết định mức độ mà mô hình có thể "nhớ" và làm việc với nội dung dài.
Cập nhật: 2026-09-26
Context window là phạm vi ngữ cảnh mà một mô hình ngôn ngữ lớn có thể tiếp nhận trong một lần suy luận. Mọi câu hỏi, tài liệu đính kèm và nội dung sinh ra đều nằm gọn trong cửa sổ này. Khi vượt quá giới hạn, mô hình không còn "nhìn thấy" phần thông tin cũ hơn, dẫn đến việc quên ngữ cảnh hoặc trả lời lệch trọng tâm.
Đơn vị đo của context window là token, không phải từ hay ký tự. Một token có thể là một phần từ, một từ trọn vẹn hoặc một dấu câu, tùy vào ngôn ngữ và cách mã hóa của từng mô hình. Hiểu rõ khái niệm này giúp người dùng chọn đúng mô hình cho tác vụ đọc dài hạn, phân tích tài liệu hay viết mã.
Khái niệm ngữ cảnh có giới hạn xuất hiện từ những mô hình ngôn ngữ đầu tiên. GPT-2 và GPT-3 của OpenAI chỉ hỗ trợ cửa sổ ngữ cảnh khoảng 2.000 đến 4.000 token, gần như chỉ đủ cho một đoạn văn hoặc một trang văn bản ngắn. Người dùng buộc phải cắt nhỏ nội dung và liên tục tóm tắt để làm việc với tài liệu dài.
Bước nhảy lớn đầu tiên đến năm 2023 khi các mô hình đạt cửa sổ 32K và 128K token, mở ra khả năng xử lý cuốn sách hàng trăm trang trong một lượt. Đến năm 2026, nhiều mô hình tiên phong đã đạt 400K, thậm chí 1 triệu token, cho phép làm việc đồng thời với hàng loạt tệp mã nguồn hoặc bộ tài liệu kỹ thuật khổng lồ.
Khi bạn gửi yêu cầu, toàn bộ lời nhắc cùng tài liệu đính kèm được chuyển thành chuỗi token và đưa vào bộ chú ý (attention) của mô hình. Kiến trúc transformer cho phép mỗi token "nhìn" tất cả token khác trong cùng cửa sổ, tạo nên mối liên hệ ngữ nghĩa toàn cục. Độ dài cửa sổ càng lớn, chi phí tính toán càng cao vì độ phức tạp tăng theo bình phương của số token.
Phần thông tin vượt ra ngoài cửa sổ sẽ bị bỏ qua, khiến mô hình hoạt động như thể chúng chưa từng tồn tại. Đây là điểm khác biệt giữa cửa sổ ngữ cảnh và bộ nhớ dài hạn. Một số kỹ thuật như tổng hợp có chọn lọc hay nén ngữ cảnh ra đời để kéo dài hiệu quả sử dụng trong giới hạn cho phép.
| Mô hình | Nhà phát triển | Cửa sổ ngữ cảnh | Đặc điểm nổi bật |
|---|---|---|---|
| GPT-6 Astra | OpenAI | 400K token | Mạnh về lập luận và computer use, giá cao |
| Claude Fable 5.1 | Anthropic | Trên 272K token | Dẫn đầu tác vụ agent code dài hạn |
| Gemini 3.8 Flash | 1 triệu token | Giá rẻ, nhanh, hiệu năng theo giá tốt | |
| Claude 4 (thế hệ 2025) | Anthropic | 200K token | Cân bằng cho hội thoại và phân tích |
| GPT-4o (thế hệ cũ) | OpenAI | 128K token | Mốc phổ biến giai đoạn 2024-2025 |
Xu hướng chung là các mô hình đang tăng nhanh cửa sổ ngữ cảnh, nhưng mức độ hữu ích thực tế còn phụ thuộc vào cách mô hình "chú ý" vào phần thông tin quan trọng giữa một khối văn bản rất dài.
Chi phí tính toán là rào cản chính, vì bộ chú ý của transformer có độ phức tạp tăng theo bình phương số token. Cửa sổ càng dài, mỗi lượt suy luận càng tốn năng lượng và tiền bạc, đẩy giá API lên cao. Đây là lý do các mô hình có 1 triệu token thường được tối ưu theo hướng tiết kiệm chi phí.
Hiệu suất cũng không tăng tuyến tính với độ dài. Nhiều nghiên cứu cho thấy mô hình có xu hướng "quên" các chi tiết nằm ở giữa một cửa sổ rất dài, hiện tượng thường gọi là hiệu ứng trung tâm bị lấn át. Vì vậy cửa sổ lớn chưa chắc đã nghĩa là độ chính xác cao nếu không có cơ chế rút trích tốt.
Context window là thước đo cốt lõi quyết định khả năng làm việc với nội dung dài của một mô hình AI. Từ vài nghìn token của thập niên trước, công nghệ đã tiến tới hàng trăm nghìn và cả triệu token, mở ra những tác vụ hoàn toàn mới trong phân tích, lập trình và tự động hóa.
Khi chọn mô hình, người dùng nên cân bằng giữa độ dài cửa sổ, chi phí và chất lượng suy luận. Cửa sổ lớn không phải lúc nào cũng là lựa chọn tốt nhất nếu tác vụ chỉ cần xử lý văn bản ngắn, và ngược lại, tác vụ đọc dài hạn sẽ không thể hoàn thành tốt nếu cửa sổ quá nhỏ.
Cập nhật lần cuối: 2026-09-26