Bỏ qua đến nội dung chính
Về trang chủ
AI 4 phút đọc

Weka ra mắt NeuralMesh 6: Caching token trên ổ flash để giảm tải cho GPU

Giải pháp lưu trữ mới của Weka giúp tối ưu hiệu năng GPU nhờ khả năng cache toàn bộ token đã tính toán của mô hình AI trên bộ nhớ flash NAND giá rẻ.

Tier 2 · nguồn 56% độ tin cậy Đã được duyệt
Nguồn gốc venturebeat.com

Công ty lưu trữ dữ liệu Weka vừa chính thức trình làng nền tảng phần mềm NeuralMesh 6 đi kèm dòng phần cứng tự thiết kế đầu tiên mang tên Wekapod 3. Giải pháp này hướng tới việc giải quyết bài toán thiếu hụt và chi phí đắt đỏ của bộ nhớ GPU bằng cách tận dụng công nghệ lưu trữ flash NAND giá rẻ làm bộ nhớ mở rộng cho các hệ thống AI. Đây được coi là một hướng đi thực tế giúp các doanh nghiệp tối ưu hóa tài nguyên phần cứng hiện có thay vì liên tục chạy đua mua thêm chip đồ họa mới.

Bối cảnh & Nguyên nhân

Trong môi trường vận hành AI thực tế, bộ nhớ GPU là tài nguyên đắt đỏ và dễ bị nghẽn nhất. Khi các mô hình ngôn ngữ lớn (LLM) ngày càng mở rộng cửa sổ ngữ cảnh (context window) và xử lý các cuộc hội thoại nhiều lượt (multi-turn), hệ thống buộc phải liên tục tính toán lại các thông tin đã xử lý trước đó. Quá trình này ngốn một lượng lớn tài nguyên tính toán và dung lượng bộ nhớ của GPU, làm giảm hiệu năng phục vụ người dùng mới. Theo CEO kiêm nhà đồng sáng lập Weka, ông Liran Zvibel, việc lặp đi lặp lại các bước tính toán này trong một phiên trò chuyện dài có thể khiến hệ thống phải tính toán thừa từ hàng chục đến hàng trăm lần nếu không có cơ chế lưu trữ đệm (caching) hiệu quả.

Phân tích kỹ thuật & Công nghệ

Để giải quyết triệt để nút thắt cổ chai này, NeuralMesh 6 giới thiệu kiến trúc mạng bộ nhớ mở rộng (Augmented Memory Grid). Công nghệ này cho phép gom các ổ flash NAND lại để hoạt động tương tự như bộ nhớ GPU với chi phí chỉ bằng một phần nhỏ, giúp lưu trữ tạm thời (cache) 100% các token đã được tính toán trước. Bên cạnh đó, nền tảng mới còn tích hợp khả năng lưu trữ hợp nhất cả tệp tin và đối tượng (unified file and object storage) mà không cần lớp chuyển dịch trung gian, giúp truy xuất dữ liệu trực tiếp và tăng hiệu năng lên gấp nhiều lần so với giao thức S3 truyền thống. Weka cũng áp dụng giải pháp AlloyFlash, tự động điều phối các tác vụ nhạy cảm với độ trễ sang chip nhớ TLC tốc độ cao và đẩy các tác vụ lưu trữ dung lượng lớn sang chip QLC giá rẻ nhằm tối ưu chi phí trên mỗi terabyte dữ liệu.

Ý kiến chuyên gia & Nhận định

Thị trường lưu trữ dành cho AI hiện đang chứng kiến sự cạnh tranh khốc liệt từ các ông lớn như Dell, NetApp, Pure Storage và VAST. Đánh giá về bước đi của Weka, Steve McDowell, nhà phân tích trưởng tại NAND Research nhận định: "Weka tiếp tục sở hữu giải pháp triển khai KV cache có khả năng kỹ thuật tốt nhất trên thị trường với công nghệ Augmented Memory Grid." Tuy nhiên, chuyên gia này cũng đưa ra lời khuyên thực tế cho các doanh nghiệp rằng họ nên đánh giá kỹ lưỡng năng lực thực tế của các nhà cung cấp thông qua các trường hợp sử dụng cụ thể có quy mô tương đương, thay vì chỉ tin vào những lời quảng cáo tiếp thị.

Tác động & Tương lai

Giải pháp mới của Weka hứa hẹn sẽ mang lại lợi ích ngay lập tức cho các tổ chức đang vận hành AI ở quy mô lớn, đặc biệt là các doanh nghiệp xây dựng trợ lý ảo (copilot), tổng đài chăm sóc khách hàng hoặc hệ thống tra cứu thông tin tích hợp. Khả năng triển khai nhanh chóng các cụm máy chủ GPU mới trong vòng một giờ thay vì phải chờ đợi nhiều tuần để sao chép dữ liệu sẽ giúp các đám mây GPU chuyên biệt tối ưu hóa tối đa hiệu suất đầu tư. Dù vậy, đối với các doanh nghiệp có quy mô triển khai AI nhỏ lẻ, lợi ích kinh tế thu về từ giải pháp này có thể chưa thực sự rõ rệt so với chi phí đầu tư ban đầu cho hệ thống lưu trữ chuyên dụng.