Ngày 28/9/2026, loạt nghiên cứu mới trên arXiv cs.AI đồng loạt công bố các giải pháp nhằm khắc phục điểm mù trong việc đánh giá và kiểm soát tác vụ của mô hình ngôn ngữ lớn (LLM). Các công trình tập trung giải quyết bài toán thiếu cơ chế từ chối khi thẩm định mã nguồn, độ trôi mục tiêu ở tác tử tự hành và lỗ hổng bảo mật phân tán qua chuỗi kỹ năng tích hợp.
Trong bài toán thẩm định mã nguồn, nghiên cứu về khung MARCH chỉ ra rằng việc so sánh trực tiếp khiến mô hình đánh giá ngang bằng nhau từ 78% đến 95% trường hợp, kéo độ chính xác xuống còn 4,4% so với mức 43,7% khi hỏi trực tiếp. Bằng cách bổ sung cơ chế kiểm soát dựa trên nhật ký nội bộ, hệ thống chủ động từ chối các phép so sánh thiếu căn cứ, nâng độ chính xác từ 20,7% lên 36,9% dù chỉ xử lý một nửa số lượng trường hợp. Cùng hướng đi về đo lường độ tin cậy, công cụ HARDEN sử dụng thuật toán tiến hóa có ràng buộc trên các tập dữ liệu FinQA, PubMedQA và ContractNLI, làm giảm độ chính xác của các mô hình Qwen3.5 từ 22,7% đến 49,9%, phơi bày giới hạn thực tế của mô hình trước các kịch bản phức tạp.
Ở cấp độ kiến trúc tác tử, nghiên cứu về hiện tượng kiên trì kém hiệu quả token giới thiệu mô hình Global Executive Control (GEC) v0.2. Trong thử nghiệm 24.000 tập nhiệm vụ với trần 40.000 token, GEC duy trì tỷ lệ hoàn thành mục tiêu 96,57% trong khi giảm 36,4% lượng token tiêu thụ trung bình, từ 19.782 xuống 12.574 token. Về mặt an ninh, dự án SkillCascade cảnh báo mối nguy từ các cuộc tấn công chuỗi kỹ năng trên các tác tử như OpenClaw hay Claude Code, nơi các đoạn mã độc hại phân tán qua nhiều module riêng lẻ vô hại nhưng khi kết hợp lại sẽ triệt tiêu các cảnh báo an toàn nghiêm trọng.
Các nghiên cứu bổ trợ như S3KG, Benchy và phương pháp nhắc lệnh trực giác tiếp tục mở rộng công cụ chuẩn hóa đánh giá và mô phỏng hành vi người dùng. Những kết quả thực nghiệm này cho thấy trọng tâm nghiên cứu AI đang dịch chuyển mạnh sang thiết lập rào chắn định lượng và phân tách quyền kiểm soát vận hành trong môi trường thực tế.