Bỏ qua đến nội dung chính
Về trang chủ
AI 4 phút đọc

DeepMind: LLM khó tạo đột phá khoa học, cơ hội mở ra cho world model

Nghiên cứu từ Google DeepMind chỉ ra các mô hình ngôn ngữ lớn thiếu cơ chế nhận thức để tạo ra đột phá mới, mở đường cho tiềm năng của mô hình thế giới.

Tier 1 · nguồn 60% độ tin cậy Đã được duyệt
Nguồn gốc the-decoder.com

Trong một báo cáo học thuật mới đây từ Google DeepMind, nhà nghiên cứu Tom Zahavy khẳng định các mô hình ngôn ngữ lớn (LLM) hiện nay không đủ khả năng kích hoạt một cuộc cách mạng khoa học thực sự. Theo bài luận có tiêu đề "LLMs can't jump" (tạm dịch: LLM không thể nhảy vọt), các công cụ này vẫn thiếu đi các cơ chế nhận thức cốt lõi cần thiết để sáng tạo ra những tri thức hoàn toàn mới cho nhân loại.

Bối cảnh & Nguyên nhân

Sự phát triển bùng nổ của các mô hình ngôn ngữ lớn trong thời gian qua đã dấy lên nhiều kỳ vọng về việc AI có thể tự động hóa các khám phá khoa học. Tuy nhiên, theo ghi nhận từ báo cáo của Tom Zahavy thuộc Google DeepMind, thực tế công nghệ hiện tại cho thấy LLM chỉ đang hoạt động dựa trên việc tái cấu trúc và dự đoán các dữ liệu đã có sẵn. Chúng không có khả năng thực hiện những bước "nhảy vọt" về mặt tư duy để thiết lập các lý thuyết khoa học mang tính cách mạng. Nghiên cứu nhấn mạnh rằng việc thiếu hụt các cơ chế nhận thức chiều sâu khiến AI dạng này chỉ dừng lại ở vai trò hỗ trợ thay vì trở thành chủ thể sáng tạo độc lập.

Phân tích kỹ thuật & Công nghệ

Về mặt kỹ thuật, các mô hình ngôn ngữ lớn hoạt động chủ yếu bằng cách tối ưu hóa xác suất từ ngữ tiếp theo dựa trên lượng dữ liệu khổng lồ được huấn luyện. Cơ chế này giúp chúng cực kỳ xuất sắc trong việc tổng hợp thông tin, viết mã nguồn hoặc giải quyết các bài toán có tiền lệ. Tuy nhiên, để tạo ra một cuộc cách mạng khoa học, hệ thống cần có khả năng xây dựng các mô hình giả thuyết về thế giới và kiểm chứng chúng trong thực tế. Đây chính là điểm mà các "mô hình thế giới" (world models) được kỳ vọng sẽ vượt trội hơn. Khác với LLM vốn chỉ xử lý ký tự, các mô hình thế giới hướng tới việc hiểu sâu sắc các quy luật vật lý, nguyên nhân - kết quả và có khả năng mô phỏng các kịch bản chưa từng xuất hiện trong dữ liệu huấn luyện.

Ý kiến chuyên gia & Nhận định

Trong bài nghiên cứu "LLMs can't jump", nhà khoa học Tom Zahavy lập luận rằng việc kỳ vọng LLM tự động tạo ra các lý thuyết mới là thiếu thực tế. Chuyên gia này chỉ ra rằng các cơ chế nhận thức phức tạp — như khả năng tự phản nghiệm, tư duy trừu tượng vượt ngoài ngôn ngữ và tương tác thực tế — là những mảnh ghép còn thiếu trong kiến trúc mạng transformer hiện tại. Giới phân tích công nghệ cũng đồng tình rằng, mặc dù các mô hình như GPT hay Claude rất hữu ích trong việc hỗ trợ nghiên cứu, chúng ta cần một sự chuyển dịch căn bản về mặt kiến trúc AI nếu muốn chứng kiến những phát kiến mang tính lịch sử do máy tính thực hiện.

Tác động & Tương lai

Cuộc tranh luận giữa giới hạn của LLM và tiềm năng của world model đang định hình lại hướng đi của các phòng thí nghiệm AI hàng đầu thế giới, bao gồm cả Google DeepMind. Đối với cộng đồng công nghệ và độc giả tại Việt Nam, nhận định này mang lại một góc nhìn thực tế, giúp giảm bớt những kỳ vọng thái quá vào làn sóng generative AI hiện tại. Thay vì tập trung hoàn toàn vào việc tinh chỉnh các mô hình ngôn ngữ, xu hướng nghiên cứu trong tương lai nhiều khả năng sẽ dịch chuyển mạnh mẽ sang việc phát triển các mô hình thế giới có khả năng tương tác và hiểu biết sâu sắc về môi trường vật lý xung quanh.