Bỏ qua đến nội dung chính
Về trang chủ
AI 5 phút đọc

Waymo đặt quy chuẩn đánh giá AI: Không có kiểm thử, không thể xuất xưởng 🚗

Cách tiếp cận "đặt kiểm thử làm trọng tâm" của Waymo mang lại bài học đắt giá cho các doanh nghiệp đang nỗ lực đưa mô hình AI từ phòng thí nghiệm ra thực tế một cách an toàn.

Tier 2 · nguồn 56% độ tin cậy Đã được duyệt
Nguồn gốc venturebeat.com

Tại hội nghị VB Transform 2026 diễn ra vào cuối tháng 7 năm 2026, bà Manasi Joshi, Giám đốc kỹ thuật mảng trí tuệ hệ thống và học máy tại Waymo, đã chia sẻ về phương pháp "phát triển lấy kiểm thử làm trọng tâm" (eval-centric development) của hãng xe tự hành này. Đối với Waymo, một dự án trí tuệ nhân tạo (AI) chưa thể coi là sẵn sàng vận hành chỉ dựa trên việc mô hình hoạt động tốt, mà tính sẵn sàng phải được đo lường bằng mức độ trưởng thành của chính hệ thống kiểm thử bao quanh nó. Đây là một triết lý vận hành nghiêm ngặt nhằm giảm thiểu tối đa rủi ro vật lý khi đưa AI vào các phương tiện giao thông tự hành.

Bối cảnh & Nguyên nhân

Khác với các ứng dụng AI tạo văn bản hoặc tự động hóa tác vụ văn phòng thông thường, các mô hình của Waymo trực tiếp điều khiển phương tiện di chuyển trên đường phố thực tế đầy biến động. Theo công bố từ phía Waymo, các xe tự hành của hãng đã hoàn thành hơn 220 triệu dặm lái hoàn toàn tự động (không có tài xế an toàn), với tỷ lệ chấn thương do tai nạn nghiêm trọng thấp hơn 17 lần so với người lái là con người trên cùng một quãng đường. Tuy nhiên, để đạt được chỉ số an toàn này, Waymo không chỉ dựa vào các đợt kiểm tra cuối cùng trước khi triển khai. Thay vào đó, quy trình đánh giá chất lượng đã được dịch chuyển sâu vào lõi của chu trình phát triển sản phẩm, biến việc đánh giá thành một quy trình liên tục từ lúc huấn luyện, sau huấn luyện, cho đến các kịch bản mô phỏng vòng lặp mở và đóng.

Phân tích kỹ thuật & Công nghệ

Về mặt kỹ thuật, hệ thống của Waymo được chia tách rõ ràng thành hai phần: hệ thống xử lý thời gian thực trên xe (onboard) và hạ tầng phát triển ngoại vi (off-board) phục vụ xử lý dữ liệu và mô phỏng. Bắt đầu áp dụng kiến trúc Transformer từ năm 2017, Waymo đã liên tục mở rộng sang các mô hình ngôn ngữ lớn (LLM), mô hình thị giác-ngôn ngữ (VLM) và mô hình thị giác-ngôn ngữ-hành động (VLA). Hiện nay, hãng đang tích hợp các mô hình đa phương thức tạo sinh (generative multimodal models) vào chiến lược mô hình nền tảng của mình. Để tối ưu hóa tài nguyên phần cứng vốn đang trở nên khan hiếm, Waymo tập trung mạnh mẽ vào "hiệu quả dữ liệu" (data efficiency) — tức là chọn lọc các mẫu dữ liệu huấn luyện hữu ích nhất thay vì chạy theo số lượng lớn một cách mù quáng. Đồng thời, hãng cũng sử dụng chính các đại lý AI (AI agents) nội bộ để phân tích phân phối dữ liệu và tìm lỗi trong quá trình chạy thử nghiệm.

Ý kiến chuyên gia & Nhận định

Theo bà Manasi Joshi, đánh giá không phải là một nhiệm vụ thực hiện một lần để kích hoạt mô hình. Waymo kết hợp các tập dữ liệu thực tế, các chỉ số hiệu suất chuẩn hóa cùng hạ tầng mô phỏng khổng lồ để tái hiện hàng tỷ dặm lái xe ảo. Tuy nhiên, bà nhấn mạnh rằng quy trình kiểm duyệt phát hành phần mềm của Waymo hoàn toàn không tự động hóa 100%. "Hệ thống này không được dẫn dắt hoàn toàn bởi AI và không thể thiếu sự giám sát của con người. Tính mạng con người đang là thứ được đặt cược ở đây," bà Joshi khẳng định. Sự tham gia của các lãnh đạo an toàn nội bộ và đội ngũ chuyên gia phê duyệt thủ công đóng vai trò chốt chặn cuối cùng trước khi bất kỳ bản cập nhật nào được triển khai trên diện rộng.

Tác động & Tương lai

Phương pháp tiếp cận của Waymo mở ra một bài học thực tiễn lớn cho cộng đồng doanh nghiệp Việt Nam và toàn cầu khi triển khai các hệ thống AI tác vụ (agentic AI). Bài học rút ra là việc sở hữu một mô hình nền tảng mạnh mẽ là chưa đủ; doanh nghiệp cần xây dựng được bộ dữ liệu đánh giá đặc thù, quy trình thử nghiệm liên tục chống lại các tình huống lỗi hiếm gặp nhưng nguy hiểm (corner cases), và quan trọng nhất là cơ chế trách nhiệm giải trình rõ ràng của con người. Trong tương lai, khi AI ngày càng thâm nhập sâu vào các ngành công nghiệp có độ rủi ro cao như y tế, tài chính hay logistics, triết lý "kiểm thử làm trọng tâm" này sẽ trở thành tiêu chuẩn bắt buộc chứ không còn là một lựa chọn tối ưu đơn thuần.