Ngày 28 tháng 9 năm 2026, ba công bố mới trên chuyên trang arXiv cs.AI đã giới thiệu các kỹ thuật máy học tiên tiến nhằm giải quyết những thách thức cốt lõi trong mô hình hóa và phân tích cấu trúc protein.
Ở bài toán sinh cấu trúc protein, nghiên cứu mã số arXiv:2609.30456 đề xuất thuật toán Spectral Feedback nhằm khắc phục hạn chế của các mô hình khuếch tán rời rạc (discrete diffusion models). Thay vì chỉ định hướng quá trình sinh theo một chiều duy nhất thông qua logit hoặc chọn chuỗi trung gian, Spectral Feedback thiết lập một vòng lặp phản hồi cho phép mô hình chọn các vị trí cần sửa đổi (edit-positions), tái tạo mặt nạ (re-masking) và lấy mẫu lại. Phương pháp này tận dụng tính chất tương tác thưa trong sinh học để học hàm giá trị thông qua biểu diễn Fourier thưa. Khi ứng dụng vào bài toán gấp ngược protein (inverse folding) với hàm đánh giá độ ổn định, Spectral Feedback giúp tăng 32,3% số lượng protein ổn định đối với mô hình pretrained, 24,8% đối với phương pháp Best-of-10 và cải thiện 5,8% đối với mô hình đã tinh chỉnh bằng học tăng cường (RL fine-tuned).
Ở hướng phân tích dữ liệu thực nghiệm, nghiên cứu arXiv:2609.30569 giới thiệu khung tự giám sát Atelier nhằm xử lý bản đồ hiển vi điện tử nghiệm lạnh (cryoEM). Khác với các mô hình truyền thống trích xuất đặc trưng từ lưới voxel cố định, Atelier sử dụng mạng hypernetwork dựa trên kiến trúc Transformer để tạo ra các biểu diễn nơ-ron tiềm ẩn (implicit neural representations - INRs). Được huấn luyện trước trên 5.439 bản đồ từ Ngân hàng Dữ liệu Kính hiển vi Điện tử (EMDB), Atelier trích xuất trường đặc trưng liên tục, cục bộ tại bất kỳ tọa độ truy vấn không gian nào. Khi kết hợp làm kênh bổ trợ cho đầu chú giải 3D nested U-Net, hệ thống đã cải thiện độ chính xác trên 8 tác vụ dự đoán thuộc tính mức voxel so với baseline chỉ dùng thể tích thô.
Trong khi đó, nghiên cứu arXiv:2609.30446 tiếp cận bài toán dự đoán topo protein xuyên màng từ cấu trúc 3D bằng mạng nơ-ron đồ thị SchNet. Thay vì chỉ sử dụng chuỗi axit amin hoặc tọa độ carbon alpha như các phương pháp truyền thống (chẳng hạn DeepTMHMM), nhóm tác giả giải mã bộ phân loại để nhúng toàn bộ cấp độ nguyên tử mà không cần nạp trọng số huấn luyện trước. Kết quả kiểm thử chéo 5 lần (5-fold cross-validation) cho thấy mô hình GNN hoàn toàn có khả năng học hiệu quả các đặc trưng không gian phục vụ phân loại topo màng sinh học.