Đợt công bố ngày 21/9/2026 trên kho lưu trữ arXiv ghi nhận 10 nghiên cứu nổi bật trong lĩnh vực trí tuệ nhân tạo, trải rộng từ tối ưu hoá phần cứng tự động, kiểm soát ảo giác mô hình ngôn ngữ lớn đến đo lường nhận thức máy tính.
Trong nhóm nghiên cứu về tự động hoá tác vụ phức tạp (agentic workflows), nhóm tác giả dự án AHRR giới thiệu quy trình kết hợp thiết kế tổng hợp cấp cao (HLS) và tinh chỉnh RTL trên nền tảng FPGA. Thử nghiệm trên 11 tác vụ chuẩn cho thấy phương pháp này đạt tốc độ tăng tốc trung bình nhân gấp 2,6 lần so với thiết kế RTL trực tiếp. Cùng hướng ứng dụng tác tử, nhóm phát triển SpecOpt công bố giải pháp tối ưu hoá tính đặc hiệu của phân tử thuốc nhỏ bằng suy luận tiếp xúc phân kỳ (contact-diff). Thử nghiệm trên 915 hợp chất từ ChEMBL cho thấy hệ thống cải thiện khoảng cách gắn kết đích ở 84,8% trường hợp, chuyển khoảng cách trung bình từ -0,72 lên +0,47 kcal/mol mà vẫn duy trì độ tương đồng Tanimoto trung bình 0,72.
Ở mảng cấu trúc bên trong và độ tin cậy của mô hình ngôn ngữ lớn, các nhà nghiên cứu đề xuất phương pháp phát hiện ảo giác dựa trên phân tích độ cong Forman-Ricci trong đồ thị chú ý. Kết quả cho thấy hiện tượng tạo thông tin sai lệch thường đi kèm sự đứt gãy chia sẻ ngữ cảnh giữa các token và hiện tượng dồn nén thông tin quá mức (over-squashing) tại tầng transformer cuối. Đối với kỹ thuật tinh chỉnh (fine-tuning), một nghiên cứu khác chỉ ra các thành phần quyết định hiệu năng theo phân tích EAP tập trung cục bộ ở một số tầng nhất định, nhưng không nhất thiết trùng với các tầng chịu biến đổi biểu diễn lớn nhất. Ngoài ra, trong bài toán y tế, nền tảng InterviewPlayground thử nghiệm trên 6 bác sĩ lâm sàng cho thấy mô hình GPT thu thập được 88,0% thông tin bệnh án (so với 38,9% của bác sĩ), nhưng đồng thời đưa ra 56,8% suy luận không có căn cứ từ buổi phỏng vấn.
Về đo lường năng lực tổng quát, nhóm tác giả CogGym thiết lập khung đánh giá hành vi chuẩn hoá gồm 258 thí nghiệm nhận thức từ 100 bài báo để so sánh 50 mô hình ngôn ngữ với con người. Kết quả ghi nhận mô hình tốt nhất chỉ đạt hệ số tương quan R2 là 0,59 trên văn bản và 0,43 trên video, thấp hơn nhiều so với độ tin cậy của con người (đều trên 0,92). Ở hướng thị giác và lập kế hoạch, mô hình thích ứng LoRA Rank 4 trên DINOv3 giúp nâng chỉ số AUPRC nhận dạng mục tiêu sonar dưới nước từ 0,300 lên 0,679 dù chỉ can thiệp 0,26% trọng số; trong khi khung lập trình mềm-ký hiệu giải quyết thành công 596 trên 600 tác vụ PlanBench-600.