Bỏ qua đến nội dung chính
Về trang chủ
AI 4 phút đọc

GPT-5.6 Sol vượt Claude 5 Opus trong bài test ARC-AGI-3 nhờ công cụ riêng 🤖

OpenAI tuyên bố GPT-5.6 Sol đạt 38,3% điểm ARC-AGI-3, vượt qua Claude 5 Opus, nhưng kết quả này chỉ đạt được khi sử dụng hệ thống kiểm thử tùy chỉnh của hãng.

Tier 1 · nguồn 64% độ tin cậy Đã được duyệt
Nguồn gốc the-decoder.com

OpenAI vừa công bố mô hình trí tuệ nhân tạo mới nhất GPT-5.6 Sol đã vượt qua đối thủ Claude 5 Opus của Anthropic trong bài kiểm tra trí tuệ nhân tạo tổng quát ARC-AGI-3 danh tiếng. Tuy nhiên, kết quả ấn tượng 38,3% này lập tức gây ra nhiều tranh cãi khi nó chỉ đạt được thông qua hệ thống thử nghiệm tùy chỉnh riêng của hãng. Trong môi trường thử nghiệm chính thức, mô hình của OpenAI chỉ ghi nhận mức điểm cực kỳ khiêm tốn là 7,8%.

Diễn biến chi tiết

Cuộc đua giành ngôi vị dẫn đầu về trí tuệ nhân tạo tổng quát (AGI) giữa OpenAI và Anthropic tiếp tục nóng lên với công bố mới nhất từ phía công ty do Sam Altman dẫn dắt. Theo thông tin từ The Decoder, OpenAI đã đưa ra phản hồi trực tiếp đối với kỷ lục trước đó do Anthropic nắm giữ trên bảng xếp hạng ARC-AGI-3. Anthropic trước đó đã tự hào tuyên bố mô hình hàng đầu của họ là Claude 5 Opus (Opus 5) đạt mức điểm 30,2% trong điều kiện kiểm thử tiêu chuẩn. Để khẳng định vị thế, OpenAI cho biết GPT-5.6 Sol đã đạt tới 38,3% điểm số, chính thức vượt qua đối thủ. Mặc dù vậy, sự chênh lệch khổng lồ giữa kết quả trong môi trường tùy chỉnh và môi trường chính thức của ARC-AGI-3 đang khiến giới quan sát đặt ra nhiều hoài nghi về tính thực tế của thành tích này.

Phân tích kỹ thuật & Công nghệ

Sự khác biệt cốt lõi nằm ở phương pháp tiếp cận kỹ thuật mà OpenAI áp dụng cho GPT-5.6 Sol trong quá trình thử nghiệm. Thay vì chạy trực tiếp trên môi trường chuẩn của ARC-AGI-3, OpenAI đã vận hành mô hình thông qua một API riêng được tích hợp các công nghệ tối ưu hóa đặc biệt. Cụ thể, hệ thống này sử dụng cơ chế lưu giữ suy luận (retained reasoning) và nén ngữ cảnh (context compaction) liên tục để giúp mô hình không bị mất dấu các dữ kiện phức tạp trong quá trình giải đố. Đây là những kỹ thuật tối ưu hóa phần mềm nâng cao, giúp cải thiện đáng kể khả năng xử lý của LLM nhưng lại không được cho phép trong môi trường đánh giá tiêu chuẩn của ARC-AGI. Ngược lại, đối thủ Claude 5 Opus của Anthropic đã đạt được mốc điểm 30,2% hoàn toàn bằng thực lực tự thân mà không cần đến bất kỳ công cụ hỗ trợ hay tinh chỉnh đặc biệt nào bên ngoài hệ thống kiểm thử chính thức.

Ý kiến chuyên gia & Nhận định

Nhiều chuyên gia trong ngành nhận định rằng tuyên bố của OpenAI phản ánh một xu hướng đáng lo ngại khi các phòng nghiên cứu AI bắt đầu "tối ưu hóa quá mức" cho các bài kiểm tra điểm chuẩn (benchmarks). Việc thay đổi môi trường thử nghiệm để đạt điểm số cao hơn có thể làm sai lệch bản chất của các bài kiểm tra độc lập như ARC-AGI-3, vốn được thiết kế để đo lường khả năng học hỏi các kỹ năng mới của AI trong các tình huống chưa từng gặp. Giới chuyên môn cho rằng nếu không có sự thống nhất về môi trường chạy thử nghiệm, các con số so sánh giữa các mô hình sẽ dần mất đi giá trị tham chiếu thực tế đối với người dùng cuối và các nhà phát triển ứng dụng.

Tác động & Tương lai

Sự việc này cho thấy các bài kiểm tra năng lực AI đang trở thành chiến trường tiếp thị khốc liệt hơn là thước đo kỹ thuật thuần túy. Đối với cộng đồng công nghệ tại Việt Nam và thế giới, việc hiểu rõ bối cảnh đằng sau các con số benchmark là vô cùng quan trọng để tránh rơi vào bẫy truyền thông của các gã khổng lồ công nghệ. Trong tương lai, các tổ chức độc lập đứng sau các bài kiểm tra như ARC-AGI chắc chắn sẽ phải siết chặt quy định về môi trường thử nghiệm để đảm bảo tính công bằng. Trận chiến giành ngôi vương AGI vẫn chưa thể ngã ngũ khi các bên liên tục đưa ra những lý lẽ kỹ thuật để bảo vệ thành quả của mình.