Ngày 21/09/2026, Hugging Face chính thức công bố phiên bản tokenizers v1, tập trung vào việc đo lường và đánh giá hiệu năng của các tác vụ mã hóa (encode), giải mã (decode) cùng khả năng mở rộng quy mô (scaling).
Theo bài đăng từ Hugging Face Blog, bản phát hành tokenizers v1 đưa ra các số liệu đo lường cụ thể xoay quanh quá trình xử lý chuỗi văn bản đầu vào và đầu ra trong quy trình huấn luyện cũng như suy luận của các mô hình ngôn ngữ lớn. Tokenizer vốn đóng vai trò là tầng chuyển đổi cơ sở giữa văn bản tự nhiên và các vector số nguyên mà mô hình có thể tiếp nhận. Do đó, tốc độ xử lý của khâu encode và decode ảnh hưởng trực tiếp đến thông lượng tổng thể của toàn bộ hệ thống xử lý ngôn ngữ tự nhiên.
Thông báo từ Hugging Face nhấn mạnh việc đo đạc định lượng khả năng mở rộng quy mô khi khối lượng dữ liệu hoặc số lượng luồng xử lý tăng lên. Việc chuẩn hóa các bài kiểm thử hiệu năng cho tokenizers v1 giúp các kỹ sư xây dựng hệ thống có dữ liệu tham chiếu rõ ràng khi tối ưu hóa đường ống nạp dữ liệu (data pipeline) quy mô lớn.
Hiện tại, bài đăng của Hugging Face chưa công bố chi tiết bảng thông số so sánh đầy đủ với các phiên bản tiền nhiệm hoặc các thư viện tokenizer cạnh tranh khác, cũng như chưa nêu rõ các thay đổi cụ thể về mặt kiến trúc phần mềm bên dưới bản phát hành này.