Bỏ qua đến nội dung chính
Về trang chủ
AI tools-ai 3 phút đọc

Loạt nghiên cứu mới trên arXiv tái định hình đánh giá AI agent

Đợt công bố ngày 7/9/2026 trên arXiv tập trung chuẩn hóa hạ tầng đo lường AI agent, giải mã tác động của môi trường chạy mã và bảo mật suy luận.

Tier 2 · nguồn 99% độ tin cậy Đã được duyệt
📚 Tổng hợp từ 10 nguồn arXiv cs.AI arXiv cs.AI arXiv cs.AI +7 khác

Đợt công bố nghiên cứu ngày 7/9/2026 trên kho lưu trữ arXiv cs.AI ghi nhận bước chuyển dịch lớn của giới nghiên cứu AI hướng vào hạ tầng đánh giá agent, độ tin cậy khi suy luận và hành vi đưa ra quyết định thực tế. Thay vì chỉ đo đạc các mô hình ngôn ngữ lớn (LLM) độc lập trên các bộ câu hỏi tĩnh, các công trình mới tập trung giải quyết độ phức tạp của các quy trình đa bước và môi trường thực thi chuyên biệt.

Ở mảng hạ tầng đánh giá, nhóm tác giả giới thiệu Harbor Adapters cùng bộ dữ liệu Harbor-Index để chuẩn hóa việc đo lường agent trên quy mô lớn. Công trình chuyển đổi hơn 80 benchmark nhằm cho phép kiểm thử thống nhất trên nhiều mô hình. Khi thử nghiệm 8 dòng mô hình qua 54 benchmark, kết quả từ Harbor-Index cho thấy cấu hình mạnh nhất là GPT-5.5 kết hợp Codex chỉ đạt tỷ lệ vượt qua 28,0%, trong khi không có cấu hình nào vượt ngưỡng 30%. Cùng hướng nghiên cứu về năng lực lập trình, một bài báo khảo sát phương pháp học tăng cường đa môi trường (Multi-Harness RL) trên mô hình nền Qwen3-8B chỉ ra rằng môi trường thực thi là biến số chi phối chính. Qua 24.000 lượt đánh giá trên SWE-bench Verified, việc thay đổi harness làm tỷ lệ giải quyết tác vụ dao động từ 2,14% đến 9,27% (tăng gấp 4,3 lần), trong khi quy tắc phân bổ điểm thưởng nhóm (GRPO) giữa các harness chỉ mang lại khác biệt không đáng kể là +0,25 điểm phần trăm trên môi trường kiểm thử độc lập.

Bên cạnh hiệu năng, các khía cạnh an toàn và hành vi ra quyết định cũng được lượng hóa bằng các thước đo mới. HarvestBench đưa ra môi trường mô phỏng nông trại để đo lường mức độ sẵn sàng đánh đổi chi phí nhiên liệu nhằm tránh đâm phải động vật của agent. Qua 7.201 quyết định định giá trên 9 mô hình, tỷ lệ gây tổn hại dao động từ 0,4% ở Terra và Sol lên tới 98,8% ở GPT-4o-mini; việc đưa hướng dẫn đạo đức vào bản tóm tắt nhiệm vụ giúp giảm tỷ lệ đâm xuống dưới 6% ở 5 trên 6 mô hình suy luận. Về mặt bảo mật và độ trung thực, các nghiên cứu khác phân tích tấn công chèn prompt gián tiếp dưới dạng bài toán tìm kiếm lúc suy luận (test-time search), đồng thời đề xuất phương pháp loại bỏ khái niệm không được trích dẫn để cải thiện tính trung thực trong lời giải thích của LLM mà không cần huấn luyện lại trọng số.