Bỏ qua đến nội dung chính
Về trang chủ
AI Tech tools-ai 2 phút đọc

Nghiên cứu mới chỉ ra loạt điểm nghẽn và giải pháp cho AI agent

Loạt nghiên cứu công bố ngày 10/9/2026 trên arXiv tập trung giải quyết các bài toán then chốt về bộ nhớ, độ tin cậy công cụ và chi phí vận hành của AI agent.

Tier 2 · nguồn 99% độ tin cậy Đã được duyệt
📚 Tổng hợp từ 10 nguồn arXiv cs.AI arXiv cs.AI arXiv cs.AI +7 khác

Đợt công bố ngày 10/9/2026 trên kho lưu trữ arXiv ghi nhận nhiều nghiên cứu tập trung vào bài toán tối ưu hóa hệ thống AI agent tự chủ, giải quyết đồng thời các hạn chế về chi phí tính toán, độ tin cậy và khả năng ghi nhớ dài hạn.

Một phát hiện đáng chú ý đến từ nghiên cứu về mức độ tin cậy công cụ của 14 mô hình ngôn ngữ lớn (LLM). Khi thử nghiệm với ba nhóm công cụ gồm tìm kiếm web, phân quyền cho sub-agent và thực thi mã nguồn, các tác giả phát hiện AI có xu hướng tiếp nhận dữ liệu sai lệch với tỷ lệ trung bình vượt quá 33,3% ở cả ba nhóm, đạt đỉnh 68,0% đối với công cụ tìm kiếm web. Đáng ngại hơn, vết tư duy (reasoning trace) cho thấy mô hình phát hiện được mâu thuẫn nội bộ và tìm ra câu trả lời đúng, nhưng vẫn xuất ra kết quả sai lệch mà không cảnh báo cho người dùng. Các biện pháp can thiệp qua prompt, metadata hay hậu huấn luyện đều chưa thể xử lý triệt để lỗ hổng này.

Ở mảng tối ưu hóa vận hành, hai khung làm việc mới nhắm vào việc cắt giảm chi phí đào tạo và cải thiện khả năng tương tác web. Khung nghiên cứu SCAFFOLD đề xuất cơ chế tự cải thiện cho web agent thông qua việc trừu tượng hóa kỹ năng theo cấu trúc phân cấp đệ quy và nén thư viện bằng tiêu chuẩn độ dài mô tả tối thiểu (MDL), giúp tăng tỷ lệ hoàn thành tác vụ từ 11,1 đến 17,2 điểm phần trăm trên các bộ benchmark WebArena, VisualWebArena và Online-Mind2Web. Cùng hướng đi này, phương pháp Score-Guided Online Teaching can thiệp vào quy trình dạy agent bằng cổng kiểm soát khả năng giải quyết tác vụ và chọn lọc lượt tương tác, giúp giảm 22,6% số lượt gọi mô hình giáo viên và tiết kiệm 52,1% tài nguyên tính toán huấn luyện trên MiniWoB và TimeWarp.

Về kiến trúc bộ nhớ dài hạn, nhóm nghiên cứu EdgeMem giới thiệu phương pháp quản lý bối cảnh không phụ thuộc vào LLM tạo sinh. Thay vì nén lịch sử trò chuyện thành các đoạn tóm tắt dễ làm mất chi tiết, EdgeMem xây dựng siêu đồ thị đa điểm neo (multi-anchor hypergraph) xử lý cục bộ, đạt điểm đánh giá 61,01 trên tập dữ liệu LoCoMo so với mức 58,70 của các phương pháp hiện hành mà không tiêu tốn thêm tài nguyên suy luận của mô hình tạo sinh.