Bỏ qua đến nội dung chính
Về trang chủ
AI Tech 5 phút đọc

Sếp AI Expedia: Đánh giá hệ thống chính là bản đặc tả sản phẩm mới 🛠️

Giám đốc AI Expedia nhận định các bộ đánh giá (evals) đang thay thế bản đặc tả sản phẩm truyền thống trong kỷ nguyên AI agent.

Tier 2 · nguồn 56% độ tin cậy Đã được duyệt
Nguồn gốc venturebeat.com

Tại hội nghị VB Transform 2026 diễn ra tại Menlo Park, ông Xavi Amatriain, Giám đốc AI và Dữ liệu của Expedia Group, khẳng định các bộ đánh giá hệ thống (evals) đang trở thành bản đặc tả yêu cầu sản phẩm (PRD) thế hệ mới. Tuyên bố này được đưa ra trong bối cảnh các doanh nghiệp đang chật vật tìm cách kiểm soát và vận hành an toàn thế hệ AI agent tự chủ. Việc định hình sản phẩm thông qua evals trước khi viết mã được kỳ vọng sẽ giải quyết "hố sâu khoảng cách" về bảo mật và niềm tin công nghệ hiện nay.

Diễn biến chi tiết

Theo ông Amatriain, trong kỷ nguyên mà mã nguồn có thể được hỗ trợ hoặc tạo ra hoàn toàn bởi AI, phần lớn tư duy thiết kế của con người sẽ được dồn vào khâu xây dựng bộ đánh giá. Thay vì cố gắng áp đặt quá nhiều rào cản kỹ thuật (guardrails) - thứ mà ông gọi là "một tệ nạn bắt buộc" nhưng dễ làm suy giảm chất lượng vòng lặp phản hồi của người dùng - các tổ chức nên tích hợp sẵn các yêu cầu bảo mật và nghiệp vụ trực tiếp vào các bộ đánh giá ngay từ đầu. Điều này giúp hệ thống tự động hóa khâu kiểm thử mà không làm ảnh hưởng đến trải nghiệm thực tế.

Để hiện thực hóa triết lý này, Expedia áp dụng mô hình quản trị AI ba lớp bao gồm: nguyên tắc cốt lõi, quy trình kiểm soát tự động và các "chốt kiểm soát phát hành" (toll gates) được điều chỉnh linh hoạt theo mức độ rủi ro của từng tác vụ cụ thể.

Phân tích kỹ thuật & Công nghệ

Về mặt kiến trúc hệ thống, Expedia không đặt niềm tin vào một mô hình trí tuệ nhân tạo tổng hợp (AGI) nguyên khối duy nhất. Thay vào đó, doanh nghiệp này xây dựng một hệ sinh thái gồm các agent chuyên biệt hóa cao được kết hợp chặt chẽ với nhau. Hệ thống kỹ thuật của Expedia đi từ cấp độ thành phần nhỏ nhất: các công cụ (tools) cấu thành nên kỹ năng (skills), các kỹ năng lắp ghép thành các agent phụ (sub-agents), và cuối cùng các agent phụ này được điều phối bởi một hệ thống tổng thể.

Để xử lý các tác vụ thực tế như tra cứu giá phòng khách sạn hay vé máy bay biến động theo thời gian thực, kiến trúc của Expedia kết hợp linh hoạt giữa kỹ thuật tạo truy xuất tăng cường (RAG) và gọi trực tiếp API của nhà cung cấp. Quyết định lựa chọn phương thức nào sẽ phụ thuộc vào độ trễ. Các câu hỏi chung chung về xu hướng giá có thể sử dụng dữ liệu được lưu đệm (cache), trong khi các yêu cầu chi tiết hơn sẽ cần quy trình suy luận kéo dài hơn để đối chiếu chéo thông tin nhà cung cấp với cơ sở dữ liệu nhận xét của người dùng.

Ý kiến chuyên gia & Nhận định

Dù vậy, không phải ai cũng đồng ý với quan điểm hạn chế bớt rào cản kỹ thuật của Amatriain. Tại sự kiện VB Transform 2026, một số chuyên gia khác lập luận rằng các tác vụ có tính rủi ro cao vẫn đòi hỏi những rào cản vô cùng nghiêm ngặt để tránh thảm họa.

Sự hoài nghi này là có cơ sở nếu nhìn vào số liệu thực tế từ khảo sát VB Pulse của VentureBeat. Theo báo cáo, có tới 66% trong số 157 doanh nghiệp được khảo sát đã cho phép hoặc đang hướng tới việc triển khai AI agent vào sản xuất mà không cần con người đánh giá lại trong vòng 12 tháng tới. Tuy nhiên, chỉ vỏn vẹn 5% doanh nghiệp hoàn toàn tin tưởng vào các hệ thống đánh giá tự động này. Đáng chú ý hơn, một nửa số doanh nghiệp tham gia khảo sát thừa nhận họ từng phát hành những AI agent vượt qua khâu kiểm thử nội bộ nhưng lại thất bại thảm hại khi đối mặt với khách hàng thực tế.

Tác động & Tương lai

Nhìn về tương lai, Amatriain cảnh báo các mối đe dọa bảo mật sẽ không chỉ đến từ tin tặc là con người, mà ngày càng có nhiều cuộc tấn công được thực hiện bởi các hệ thống AI đối thủ tinh vi khác. Việc chuyển dịch khâu bảo mật "về bên trái" (shift left) - tức là đưa bảo mật và quy trình đánh giá vào sâu trong khâu thiết kế ban đầu - sẽ là chìa khóa sống còn.

Đối với các hệ thống giao dịch phức tạp như du lịch, Expedia vẫn giữ nguyên tắc không thể thương lượng: AI có thể gợi ý và thảo luận, nhưng người dùng luôn là người thực hiện cú nhấp chuột cuối cùng để thanh toán. Điều này không chỉ bảo vệ người tiêu dùng mà còn là một quyết định kiến trúc an ninh cốt lõi giúp loại bỏ các rủi ro phát sinh sau khi vận hành.