Ngày 1/9/2026, nền tảng Hugging Face chính thức giới thiệu gói thư viện mang tên @huggingface/kernels, cung cấp hơn 200 kernel WebGPU chuyên dụng phục vụ việc chạy các mô hình trí tuệ nhân tạo cục bộ (local AI). Bộ công cụ này hướng tới việc tối ưu hoá khả năng tính toán và suy luận trực tiếp trên phần cứng máy khách thông qua môi trường web hoặc các ứng dụng nền tảng JavaScript mà không nhất thiết phải gửi dữ liệu lên máy chủ đám mây.
Theo công bố từ Hugging Face Blog, tập hợp hơn 200 kernel này được xây dựng trên chuẩn WebGPU—giao diện lập trình ứng dụng (API) đồ hoạ và tính toán thế hệ mới. Chuẩn WebGPU cho phép các đoạn mã chạy trên trình duyệt hoặc môi trường runtime có thể khai thác trực tiếp sức mạnh xử lý song song của bộ xử lý đồ họa (GPU) trên máy tính cá nhân hoặc thiết bị di động. Việc trang bị sẵn các kernel viết riêng cho các phép toán ma trận, hàm kích hoạt và các lớp xử lý mạng nơ-ron giúp các nhà phát triển rút ngắn đáng kể thời gian lập trình và tối ưu mã nguồn từ đầu.
Việc đẩy mạnh các giải pháp WebGPU phản ánh xu hướng đưa mô hình AI về gần hơn với thiết bị đầu cuối của người dùng. Mô hình chạy cục bộ giúp tăng cường tính riêng tư của dữ liệu, giảm độ trễ phản hồi khi không phải truyền tải gói tin qua mạng Internet, đồng thời cắt giảm chi phí vận hành máy chủ suy luận cho các nhà phát triển ứng dụng. Thông qua gói @huggingface/kernels, hệ sinh thái công cụ chạy AI trên web của Hugging Face tiếp tục được mở rộng để phục vụ cộng đồng mã nguồn mở.
Hiện tại, bài công bố của Hugging Face chưa đưa ra bảng kết quả đo kiểm hiệu năng (benchmark) chi tiết cho từng loại phần cứng cụ thể hoặc danh sách các kiến trúc mô hình đã được tối ưu hoàn toàn với bộ kernel này. Những cập nhật tiếp theo về mức độ tương thích và tài liệu hướng dẫn tích hợp chi tiết vẫn đang được để ngỏ.