Bỏ qua đến nội dung chính
Về trang chủ
AI 3 phút đọc

Nghiên cứu mới siết chặt độ tin cậy và kiểm soát rủi ro của AI

Loạt nghiên cứu trên arXiv công bố các kiến trúc chuyên biệt nhằm ngăn chặn ảo giác, kiểm soát rủi ro an toàn và nâng cao độ chính xác tính toán cho mô hình AI.

Tier 2 · nguồn 70% độ tin cậy Đã được duyệt
📚 Tổng hợp từ 10 nguồn arXiv cs.AI arXiv cs.AI arXiv cs.AI +7 khác

Ngày 28 tháng 8 năm 2026, kho lưu trữ arXiv công bố loạt nghiên cứu tập trung xử lý điểm yếu về độ tin cậy và ảo giác của mô hình ngôn ngữ lớn (LLM) trong các tác vụ chuyên sâu như y tế, tài chính và phân tích doanh nghiệp. Các giải pháp chủ yếu kết hợp kiến trúc đa tác tử, logic biểu trưng (symbolic reasoning) và tầng quản trị ngữ nghĩa để thay thế việc phụ thuộc hoàn toàn vào đầu ra tự do của mô hình.

Trong lĩnh vực y tế và chăm sóc sức khỏe, nhóm tác giả hệ thống Anian đề xuất kiến trúc đa phương thức bốn tầng nhằm hỗ trợ sức khỏe tâm thần chu sinh. Hệ thống áp dụng cơ chế hợp nhất rủi ro bảo thủ; khi phát hiện rủi ro ở mức trung bình hoặc cao, luồng phản hồi tự do sẽ bị chặn hoàn toàn và thay thế bằng nội dung an toàn định sẵn cùng hướng dẫn kết nối chuyên gia. Đánh giá nguyên mẫu trên hơn 858.000 bản ghi cho thấy quy tắc phát hiện rủi ro đạt độ thu hồi tuyệt đối 1,0 trong kịch bản kiểm thử giới hạn, dù tác giả lưu ý chưa chứng minh hiệu quả lâm sàng thực tế. Ở hướng tiếp cận kiểm toán sai số y tế, nghiên cứu trên tập dữ liệu đau TAME phát hiện các mô hình như Llama 3.1 8B và Gemini 2.5 Flash có tỷ lệ tự tin bịa đặt lần lượt 0,76 và 0,53 khi bị buộc trích xuất điểm đau từ văn bản hoàn toàn không chứa dữ kiện.

Đối với tác vụ định lượng và nghiệp vụ doanh nghiệp, khung làm việc CIFQA tách biệt xử lý ngôn ngữ và tính toán số học bằng cách điều hướng phép tính sang các công cụ Python tất định. Kết quả thử nghiệm trên bài toán tiền gửi định kỳ ghi nhận mô hình nguồn mở 17 tỷ tham số áp dụng CIFQA đạt độ chính xác 95,54% ở các truy vấn tính toán phức tạp, vượt trội so với các mô hình biên lớn hơn chạy đơn lẻ. Tương tự, hệ thống GROUND giải quyết lỗi truy vấn cơ sở dữ liệu doanh nghiệp thông qua lớp ngữ nghĩa chuẩn hóa, loại bỏ hoàn toàn các vi phạm bảo mật cấp dòng (row-level security) và lỗi ảo giác chỉ số trên tập kiểm thử 100 câu hỏi.

Ở mảng giáo dục và quy trình học thuật, khung neuro-symbolic EduRiskX kết hợp mạng Transformer thời gian với tập luật F-Logic trên tập dữ liệu OULAD, đạt độ chính xác 0,900 cùng điểm F1 0,894 ở tuần thứ 38. Trong khi đó, các khảo sát về khả năng tự động hóa tổng quan tài liệu học thuật cho thấy GPT-5.0 đạt độ chính xác cấp bài viết 81,67% nhưng vẫn bộc lộ hiện tượng lặp ý và thiếu hụt phân tích tổng hợp khi mở rộng cửa sổ ngữ cảnh.