Sự bùng nổ của các mô hình ngôn ngữ lớn (LLM) trong y tế đang vấp phải những rào cản lớn về độ an toàn khi áp dụng vào thực tế lâm sàng. Hai nghiên cứu mới được công bố trên arXiv vào tháng 8 năm 2026 đã gióng lên hồi chuông cảnh báo về khả năng chẩn đoán tự động của AI. Các nhà nghiên cứu khẳng định rằng LLM hiện tại chưa sẵn sàng cho việc tự chủ phân loại bệnh nhân cấp cứu do thiếu khả năng xử lý thông tin bất định và chưa thể vượt qua các bài kiểm tra thực tế khắc nghiệt.
Bối cảnh & Nguyên nhân
Trong môi trường phòng cấp cứu (ED), việc đưa ra chẩn đoán ban đầu đòi hỏi tốc độ cực nhanh từ những manh mối hạn chế và không đầy đủ. Theo nghiên cứu giới thiệu bộ thử nghiệm EarlyDx, các benchmark chẩn đoán hiện nay thường không thực tế khi chỉ giới hạn trong các bộ mã đóng, loại bỏ ghi chú văn bản tự do và sử dụng kết quả chẩn đoán xuất viện vốn đã tích hợp toàn bộ quá trình điều trị nội trú. Điều này tạo ra một khoảng trống lớn giữa năng lực thực tế của AI và các kịch bản mô phỏng lý thuyết vốn đã được tinh chỉnh sạch sẽ.
Phân tích kỹ thuật & Công nghệ
Để giải quyết khoảng cách này, bộ dữ liệu EarlyDx đã được xây dựng từ 154.834 ca cấp cứu trong cơ sở dữ liệu MIMIC-IV, chỉ giới hạn ở các hồ sơ có sẵn tại thời điểm nhập viện. Đáng chú ý, một hệ thống kiểm định LLM đã được sử dụng để xác minh từng nhãn văn bản tự do nhằm đảm bảo tính chính xác và loại bỏ các sai sót.
Kết quả đánh giá từ bộ dữ liệu này cho thấy không có hệ thống nào—từ các mô hình thương mại hàng đầu, mô hình chuyên biệt y khoa đến mô hình được tinh chỉnh—có thể tổng hợp bằng chứng nhập viện một cách đáng tin cậy. Các mô hình zero-shot phần lớn chỉ trích xuất thông tin có sẵn, chỉ phục hồi được từ 3% đến 31% các chẩn đoán cần phải suy luận trực tiếp từ bệnh án.
Ý kiến chuyên gia & Nhận định
Song song đó, một góc nhìn nghiên cứu khác trên arXiv cảnh báo rằng LLM được tối ưu hóa để dự đoán từ tiếp theo có khả năng cao sẽ bỏ sót các chẩn đoán ít gặp nhưng nguy hiểm tính mạng. Nhóm tác giả nhấn mạnh: 'Bản chất của việc phân loại bệnh an toàn không phải là chọn ra chẩn đoán có khả năng xảy ra cao nhất, mà là một chuỗi quyết định dưới chi phí bất đối xứng.'
Trong y tế, một sai sót nghiêm trọng đơn lẻ có thể tước đi mạng sống của bệnh nhân, vượt xa tác hại của nhiều cảnh báo giả. LLM thường thiếu các hành vi y khoa cốt lõi như chủ động tìm kiếm các dấu hiệu nguy hiểm còn thiếu hoặc hạ thấp ngưỡng chuyển tuyến khi chưa loại trừ được bệnh nguy kịch.
Tác động & Tương lai
Những phát hiện này cho thấy việc vội vã đưa LLM vào vai trò phân loại lâm sàng tự động mà không có sự giám sát chặt chẽ của bác sĩ là cực kỳ mạo hiểm. Đối với cộng đồng công nghệ và y khoa tại Việt Nam, đây là bài học quan trọng trong việc xây dựng các giải pháp AI hỗ trợ y tế. Thay vì tin tưởng tuyệt đối vào khả năng thi đỗ chứng chỉ y khoa của AI, các nhà phát triển cần tập trung vào việc cải thiện quy trình thu thập thông tin chủ động và thiết lập các rào cản an toàn nghiêm ngặt để bảo vệ tính mạng người bệnh.