Bỏ qua đến nội dung chính
Về trang chủ
AI Tech 5 phút đọc

Cựu nhân sự OpenAI lập startup, dự báo chi 100 tỷ USD cho dữ liệu AI 🧠

Andrew Ho, cựu nghiên cứu viên OpenAI, vừa thành lập startup về dữ liệu chuyên biệt và dự báo các hãng AI sẽ phải chi 100 tỷ USD cho dữ liệu huấn luyện chất lượng cao.

Tier 1 · nguồn 64% độ tin cậy Đã được duyệt
Nguồn gốc the-decoder.com

Andrew Ho, một cựu nhà nghiên cứu tại OpenAI, cùng với nhà nghiên cứu Adam Hunt từ Đại học Cambridge, vừa chỉ ra một thách thức lớn mà các mô hình ngôn ngữ lớn (LLM) hiện nay đang phải đối mặt. Thay vì ngày càng trở nên đa năng và toàn diện như kỳ vọng ban đầu, các mô hình AI thế hệ mới lại đang có xu hướng chuyên biệt hóa quá mức, chỉ vượt trội ở một số lĩnh vực cụ thể như lập trình hoặc toán học, trong khi có dấu hiệu đình trệ hoặc thậm chí thụt lùi ở nhiều khía cạnh khác. Để giải quyết nút thắt này, Andrew Ho đã quyết định rời OpenAI để thành lập một startup chuyên tập trung vào việc thu thập dữ liệu huấn luyện chuyên biệt.

Bối cảnh & Nguyên nhân

Xu hướng phát triển của các mô hình AI trong những năm gần đây chủ yếu dựa vào giả thuyết mở rộng quy mô (scaling laws), tức là tăng kích thước mô hình và lượng dữ liệu thô đầu vào để đạt được hiệu suất cao hơn. Tuy nhiên, theo ghi nhận của The Decoder, thực tế đang chứng minh phương pháp này bắt đầu bộc lộ những giới hạn rõ rệt. Thay vì phát triển đồng đều các kỹ năng, các phòng thí nghiệm AI đang nhận thấy các mô hình chỉ tập trung tiến bộ mạnh mẽ ở các mảng có cấu trúc logic rõ ràng như viết code và giải toán.

Nguyên nhân của sự mất cân bằng này đến từ việc thiếu hụt nguồn dữ liệu huấn luyện chất lượng cao và có tính bao quát. Khi các mô hình ngốn hết lượng dữ liệu công khai trên Internet, việc tiếp tục nạp thêm các dữ liệu rác hoặc không chọn lọc chỉ khiến AI dậm chân tại chỗ, thậm chí làm suy giảm các khả năng suy luận phi kỹ thuật khác vốn đòi hỏi sự hiểu biết sâu sắc về ngữ cảnh xã hội và ngôn ngữ tự nhiên.

Phân tích kỹ thuật & Công nghệ

Về mặt kỹ thuật, việc huấn luyện một mô hình ngôn ngữ lớn đòi hỏi sự phân bổ tài nguyên hợp lý giữa dữ liệu huấn luyện trước (pre-training) và tinh chỉnh (fine-tuning). Khi việc mở rộng quy mô phần cứng (scaling) không còn mang lại hiệu quả vượt bậc như trước, trọng tâm công nghệ buộc phải chuyển dịch sang tối ưu hóa chất lượng của tập dữ liệu đầu vào. Andrew Ho nhận định rằng các phương pháp thu thập dữ liệu hiện tại đã quá lỗi thời và không còn đủ khả năng đáp ứng nhu cầu phát triển của các LLM thế hệ tiếp theo.

Startup mới của Andrew Ho sẽ tập trung giải quyết bài toán này bằng cách xây dựng hệ thống thu thập dữ liệu chuyên biệt (targeted data collection). Thay vì quét dữ liệu diện rộng một cách thụ động, quy trình mới đòi hỏi việc thiết kế các tập dữ liệu có chủ đích, giàu tính logic và có cấu trúc phức tạp để dạy cho AI cách tư duy thay vì chỉ học vẹt thông tin. Đây là một bước chuyển dịch kỹ thuật quan trọng từ số lượng sang chất lượng dữ liệu huấn luyện.

Ý kiến chuyên gia & Nhận định

Theo nhận định từ cựu nhà nghiên cứu OpenAI Andrew Ho, ngành công nghiệp trí tuệ nhân tạo đang đứng trước một làn sóng đầu tư khổng lồ mới nhưng không phải dành cho phần cứng siêu máy tính mà là cho dữ liệu. Ông dự đoán các phòng thí nghiệm AI hàng đầu thế giới sẽ phải chi ra một khoản kinh phí khổng lồ, ước tính vượt mốc 100 tỷ USD, chỉ riêng cho việc thu thập và tối ưu hóa các tập dữ liệu huấn luyện chuyên biệt này trong tương lai gần.

Sự đồng thuận từ nhà nghiên cứu Adam Hunt của Cambridge cũng củng cố thêm quan điểm cho rằng các mô hình ngôn ngữ lớn hiện nay đang gặp hiện tượng bão hòa về khả năng đa nhiệm. Việc các chuyên gia hàng đầu lựa chọn rời bỏ các tổ chức lớn như OpenAI để tự xây dựng giải pháp dữ liệu độc lập cho thấy thị trường đang định giá rất cao vai trò của dữ liệu sạch và chuyên sâu, coi đây là chìa khóa duy nhất để phá vỡ thế bế tắc công nghệ hiện tại.

Tác động & Tương lai

Khoản đầu tư dự kiến 100 tỷ USD vào dữ liệu huấn luyện sẽ tái định hình lại bản đồ phân bổ nguồn lực trong ngành AI toàn cầu. Điều này mở ra cơ hội lớn cho các công ty khởi nghiệp chuyên sâu về xử lý dữ liệu và tạo ra một thị trường lao động mới dành cho các chuyên gia học thuật trong nhiều lĩnh vực khác nhau, những người sẽ trực tiếp tham gia vào việc xây dựng tri thức chất lượng cao cho AI học hỏi.

Đối với cộng đồng công nghệ, sự chuyển dịch này báo hiệu rằng kỷ nguyên cạnh tranh thuần túy bằng năng lực tính toán của chip bán dẫn GPU sắp nhường chỗ cho cuộc đua về chất lượng và độ sâu của dữ liệu tri thức. Những quốc gia và doanh nghiệp nắm giữ nguồn dữ liệu chuyên biệt, được bản địa hóa và cấu trúc hóa tốt sẽ nắm lợi thế cạnh tranh vượt trội trong làn sóng AI tiếp theo.