OpenAI vừa chính thức giới thiệu chế độ suy luận mang tên 'Ultrafast' dành cho mô hình GPT-5.6 Sol vào giữa tháng 8/2026, cho phép tốc độ xuất dữ liệu đạt tới 750 token mỗi giây. Theo thông báo từ OpenAI và ghi nhận của The Decoder, chế độ mới này giúp tăng tốc độ phản hồi của GPT-5.6 Sol lên tới 14 lần so với tốc độ tiêu chuẩn. Toàn bộ năng lực xử lý vượt trội này được vận hành dựa trên nền tảng phần cứng chuyên dụng của Cerebras, bắt nguồn từ thỏa thuận hợp tác thương mại trị giá 10 tỷ USD giữa hai doanh nghiệp.
Việc ra mắt Ultrafast đánh dấu một bước chuyển dịch rõ rệt trong mô hình thương mại hóa API của OpenAI. Theo The Decoder, hệ thống định giá hiện được chia thành cấu trúc ba tầng riêng biệt bao gồm 'Standard', 'Fast' và 'Ultrafast'. Thay vì chỉ tính phí dựa trên số lượng token đầu vào và đầu ra đơn thuần như trước, OpenAI đã chính thức biến tốc độ suy luận thành một gói sản phẩm và dịch vụ có thể định giá độc lập. Điều này giúp các nhà phát triển và doanh nghiệp có thêm tùy chọn tối ưu hóa chi phí dựa trên độ trễ cần thiết cho từng tác vụ cụ thể.
Về phương thức phát hành, OpenAI cho biết chế độ Ultrafast hiện đang được mở giới hạn qua OpenAI API cho một nhóm khách hàng doanh nghiệp được chọn lọc trước. Quyền truy cập sẽ tiếp tục được mở rộng cho nhiều doanh nghiệp khác khi hạ tầng và năng lực tính toán từ phía Cerebras được nâng cấp dần. Bản xem trước này tập trung giải quyết các bài toán đòi hỏi phản hồi theo thời gian thực và các hệ thống ứng dụng tự động cần chu kỳ suy luận cực ngắn.
Hiện tại, OpenAI chưa công bố bảng giá chi tiết theo từng token cho cả ba tầng Standard, Fast và Ultrafast, cũng như chưa xác định mốc thời gian cụ thể để mở rộng tính năng này ra toàn bộ người dùng phổ thông bên ngoài giao diện API.