Bỏ qua đến nội dung chính
Về trang chủ
AI tools-ai Tech 4 phút đọc

Xây dựng đồ thị tri thức chính xác hơn nhờ mô hình Qwen3.5 và ontology 🧠

Nghiên cứu mới đề xuất hệ thống trích xuất dữ liệu dùng Qwen3.5-9B giúp nâng tỷ lệ tìm kiếm chính xác lên 95% và tự động hóa việc chuẩn hóa thực thể.

Tier 2 · nguồn 99% độ tin cậy Đã được duyệt
Nguồn gốc arxiv.org

Các nhà nghiên cứu vừa công bố một kiến trúc hệ thống trích xuất dữ liệu mới, giúp chuyển đổi các luồng tài liệu hỗn hợp chưa cấu trúc thành đồ thị tri thức (Knowledge Graph) chuẩn hóa một cách tự động và nhất quán. Theo báo cáo nghiên cứu đăng tải trên arXiv ngày 3 tháng 8 năm 2026, giải pháp này giải quyết triệt để bài toán đồng nhất dữ liệu mà các mô hình ngôn ngữ lớn (LLM) thường gặp phải khi xử lý tài liệu thực tế. Bằng cách tích hợp mô hình Qwen3.5-9B tinh chỉnh nội bộ kết hợp cấu trúc ontology động, hệ thống mở ra hướng đi mới cho việc quản trị tri thức doanh nghiệp.

Diễn biến chi tiết

Trong thực tế vận hành doanh nghiệp, các mô hình ngôn ngữ lớn khi trích xuất thực thể và mối quan hệ thường gặp hiện tượng không nhất quán, như cùng một người nhưng xuất hiện dưới nhiều biến thể tên gọi khác nhau, hoặc trùng lặp thông tin giữa các tài liệu. Để giải quyết vấn đề này, hệ thống mới được thiết kế để tiêu thụ dữ liệu trực tiếp từ các luồng thông tin của Kafka. Dữ liệu đầu vào gồm nhiều định dạng hỗn hợp như tệp PDF, bảng tính, định dạng Office và hình ảnh sẽ được phân luồng qua các bộ xử lý chuyên biệt cho từng định dạng. Quá trình trích xuất sau đó được thực hiện qua hai giai đoạn, đảm bảo thông tin thô được làm sạch và chuyển đổi thành cấu trúc có nghĩa trước khi đưa vào đồ thị tri thức cuối cùng.

Phân tích kỹ thuật & Công nghệ

Trọng tâm công nghệ của hệ thống là cơ chế trích xuất định hướng bằng ontology (ontology-guided extraction). Thay vì sử dụng toàn bộ ontology của miền vốn rất cồng kềnh, hệ thống sẽ truy xuất động phân đoạn ontology phù hợp từ cơ sở dữ liệu đồ thị dựa trên độ tương đồng embedding và đưa trực tiếp vào prompt của mô hình Qwen3.5-9B. Phương pháp này giúp giảm tới 94% chi phí xử lý danh mục so với việc sử dụng các lát cắt miền tĩnh truyền thống. Sau khi trích xuất, kết quả đi qua một quy trình tinh chỉnh gồm năm giai đoạn, bao gồm làm sạch tất định, gộp phân đoạn, trích xuất quan hệ lần hai, sáu thuật toán khử trùng lặp không cần suy luận mô hình, và cuối cùng là hệ thống giải quyết thực thể bằng embedding đi kèm các cơ chế kiểm soát xung đột nghiêm ngặt.

Ý kiến chuyên gia & Nhận định

Theo nhóm tác giả nghiên cứu, các phương pháp trích xuất bằng LLM thông thường dù trôi chảy nhưng thiếu tính nhất quán nghiêm trọng, dễ dẫn đến hiện tượng trộn lẫn thông tin sai lệch giữa các thực thể trùng tên. Việc sử dụng mô hình Qwen3.5-9B được tinh chỉnh sâu (fine-tuned) trên chính cấu trúc ontology mục tiêu đã mang lại hiệu năng vượt trội nhưng vẫn tối ưu chi phí vận hành do có thể tự lưu trữ cục bộ (locally hosted). Các chuyên gia đánh giá cao việc tích hợp sáu thuật toán khử trùng lặp phi mô hình (no-inference), giúp hệ thống duy trì tốc độ xử lý thời gian thực mà không làm nghẽn tài nguyên phần cứng.

Tác động & Tương lai

Thử nghiệm thực tế trên các kho ngữ liệu thông minh cho thấy hệ thống đã nâng tỷ lệ thu hồi tìm kiếm (search recall) từ mức 70% lên tới 95% mà không xảy ra bất kỳ lỗi hợp nhất sai lệch nào. Đồng thời, kiến trúc này cũng tự động sửa đổi được bảy loại lỗi chất lượng ngầm thường gặp, từ các lỗi nhỏ như mất ký tự ở văn bản gốc cho đến lỗi trùng lặp thực thể hệ thống do tiền tố danh xưng. Đối với cộng đồng công nghệ và doanh nghiệp Việt Nam, giải pháp mã nguồn mở tận dụng mô hình kích thước nhỏ như Qwen 9B này mở ra cơ hội tối ưu hóa hệ thống quản trị tri thức nội bộ với chi phí hạ tầng thấp, giảm bớt sự phụ thuộc vào các API đám mây đắt đỏ của nước ngoài.