Bỏ qua đến nội dung chính
Về trang chủ
AI Tech 3 phút đọc

Khung xử lý tiêu đề bảng giúp chuẩn hóa dữ liệu đồ thị tri thức

Nghiên cứu mới trên arXiv công bố khung giải thích được giúp gán nhãn ngữ nghĩa và đánh giá chất lượng dữ liệu từ 120.000 tiêu đề cột.

Tier 2 · nguồn 51% độ tin cậy Đã được duyệt
Nguồn gốc arxiv.org

Ngày 9/10/2026, nhóm tác giả trên arXiv công bố một khung làm việc (framework) tập trung vào tiêu đề bảng nhằm phục vụ bài toán gán nhãn ngữ nghĩa cho cột dữ liệu (Column Type Annotation - CTA) và đánh giá chất lượng dữ liệu (Data Quality Assessment - DQA) ở quy mô lớn. Giải pháp này hướng tới việc chuẩn bị dữ liệu đầu vào cho đồ thị tri thức (Knowledge Graph - KG) trong bối cảnh chỉ có siêu dữ liệu (metadata), đặc biệt khi giá trị trong các ô dữ liệu bị thiếu, nhiễu hoặc không thể truy cập trực tiếp.

Theo bài báo mã số arXiv:2610.10541, chất lượng của đồ thị tri thức phụ thuộc đáng kể vào các bước xử lý siêu dữ liệu dạng bảng trước khi tích hợp, thay vì chỉ dựa vào khâu kiểm định biểu đồ ở hạ nguồn. Khung làm việc mới thực hiện ánh xạ các tiêu đề cột vào 39 kiểu dữ liệu cụ thể (FinalFormat types) thông qua các tài nguyên từ vựng được chọn lọc. Để bảo đảm tính giải thích được (explainability), hệ thống duy trì khả năng truy vết ở cấp độ từng token thông qua cơ chế SourceKeywords.

Mỗi kiểu dữ liệu khi được gán sẽ tự động kích hoạt các quy tắc kiểm tra tương ứng dựa trên phân loại các vấn đề chất lượng dữ liệu (Data Quality Issues - DQIs). Hệ thống có thể phát hiện nhiều lỗi phổ biến như thiếu dữ liệu, trùng lặp bản ghi, vi phạm miền giá trị, sai kiểu dữ liệu và sai lệch mốc thời gian. Các phát hiện này sau đó được tổng hợp thành HeadersIQ, một chỉ số đo lường chất lượng dữ liệu không trọng số ở cấp độ nguồn dữ liệu. Bên cạnh đó, hệ thống còn tích hợp một nhánh ánh xạ song song để liên kết trực tiếp với các bản thể học phổ biến như DBpedia và Schema.org.

Khung xử lý này đã được thử nghiệm trên khoảng 120.000 cột tiêu đề từ nhiều bộ dữ liệu thử nghiệm khác nhau, bao gồm UCI, Prague, Kaggle, VizNet/Sato, SOTAB, T2Dv2 và bảng Metadata-to-KG thuộc cuộc thi SemTab 2024. Báo cáo nghiên cứu chỉ ra rằng mặc dù điểm đánh giá nghiêm ngặt (GT-strict) chính thức tại SemTab 2024 ở mức khiêm tốn, quá trình kiểm tra chẩn đoán độc lập cho thấy nhiều điểm không khớp bắt nguồn từ độ chi tiết của bộ chuẩn (granularity), hiện tượng trùng tên bí danh (aliasing) và việc lựa chọn ontology của benchmark, thay vì do mô hình đưa ra dự đoán sai lệch hoàn toàn. Nhóm tác giả nhấn mạnh đây là công cụ hỗ trợ theo dõi chất lượng dữ liệu và chẩn đoán benchmark chứ không nhằm điều chỉnh lại điểm số xếp hạng chính thức.