Tại hội nghị VB Transform 2026 diễn ra gần đây, Ryan Phillips, Giám đốc sản phẩm doanh nghiệp của Runway ML, đã chia sẻ một câu chuyện thú vị về cách hãng xử lý lỗi công nghệ. Thay vì tiếp tục tốn thời gian vá lỗi thuật toán khiến các avatar AI bị lệch khỏi trung tâm khi tạo video thời gian thực, Runway đã biến giới hạn này thành một tính năng hữu ích ở giao diện người dùng. Quyết định này mang lại bài học lớn cho các nhà phát triển trong việc tối ưu hóa sản phẩm AI thay vì chỉ tập trung vào nâng cấp mô hình gốc.
Diễn biến chi tiết
Theo chia sẻ của Phillips tại sự kiện, Runway đã phát triển tính năng "Runway Characters" cho phép người dùng tương tác trực tiếp với các avatar do AI tạo ra mà không có độ trễ. Tuy nhiên, trong quá trình phát triển, đội ngũ kỹ sư phát hiện ra một lỗi nghiêm trọng: các nhân vật liên tục bị lắc lư hoặc trôi lệch khỏi trung tâm khung hình. Họ đã dành nhiều tuần cố gắng can thiệp vào mã nguồn của mô hình nhưng không mang lại kết quả như ý.
Nhận thấy nếu hình ảnh đầu vào được căn giữa hoàn hảo thì video đầu ra sẽ ổn định, Runway quyết định ra mắt tính năng giao diện "Optimize for Image Quality" (Tối ưu hóa chất lượng hình ảnh) để tự động căn giữa ảnh đầu vào. Giải pháp này giúp người dùng cảm thấy đây là một tiện ích hỗ trợ đắc lực thay vì một lỗi kỹ thuật chưa thể khắc phục của hệ thống.
Phân tích kỹ thuật & Công nghệ
Để đạt được tốc độ hiển thị video thời gian thực lên đến 24 khung hình/giây (fps), Runway phải giải quyết bài toán hạ tầng vô cùng phức tạp. Đầu tiên, họ áp dụng kỹ thuật chắt lọc tri thức (distillation) để huấn luyện một mô hình "học trò" nhỏ gọn bắt chước mô hình "giáo viên" khổng lồ, giúp cắt giảm từ 80% đến 90% thời gian tạo video. Tiếp theo, mô hình này trải qua quá trình hậu huấn luyện đối kháng (adversarial post-training - APT) nhằm khôi phục độ sắc nét hình ảnh bị mất đi trong giai đoạn chắt lọc. Tuy nhiên, chính sự kết hợp giữa chắt lọc và APT đã vô tình tạo ra lỗi trôi lệch khung hình nói trên.
Bên cạnh đó, để giám sát hiệu năng hệ thống, Runway còn sử dụng một tác nhân AI (agent) phát triển trên nền Claude cùng các công cụ như Datadog và Sentry để phát hiện lỗi. Khi phát hiện một lỗi tụt hiệu năng xuống 16 fps tại một trung tâm dữ liệu ở vùng us-east-1, nguyên nhân được xác định là do phần cứng và họ đã phải thay thế vật lý các chip GPU của Nvidia tại cơ sở để giải quyết triệt để sự cố.
Ý kiến chuyên gia & Nhận định
Theo đại diện của Runway, việc đánh giá chất lượng sản phẩm AI (evals) không chỉ thuần túy là công việc của đội ngũ kỹ sư phần mềm. Quá trình này đòi hỏi sự phối hợp chặt chẽ giữa các phòng ban từ thiết kế, nghiên cứu cho đến kinh doanh để định nghĩa thế nào là một sản phẩm "đạt chuẩn". Runway thậm chí sử dụng các công cụ rất đơn giản như bảng tính Excel để theo dõi các lỗi hàng ngày và đặt ra một tỷ lệ vượt qua thử nghiệm cụ thể trước khi phát hành mô hình. Phillips nhận định rằng các nhà phát triển doanh nghiệp hoàn toàn có thể sử dụng chính các mô hình ngôn ngữ lớn (LLM) để tự động hóa quy trình đánh giá trực quan này, giúp giảm tải đáng kể khối lượng công việc thủ công.
Tác động & Tương lai
Câu chuyện của Runway cho thấy hành trình phát triển AI hiếm khi là một đường thẳng mà luôn phải đi qua giai đoạn khó khăn mà Phillips gọi là "địa ngục thất bại". Việc linh hoạt biến giới hạn kỹ thuật thành tính năng sản phẩm mở ra lối tư duy mới cho các doanh nghiệp công nghệ trong kỷ nguyên Generative AI. Trong tương lai, vai trò của những nhà sáng tạo sẽ dịch chuyển từ việc thiết kế một sản phẩm quảng cáo hay hình ảnh đơn lẻ sang việc thiết lập các tham số, phong cách thẩm mỹ để các mô hình thời gian thực tự động tạo ra nội dung. Đây là một gợi ý quan trọng cho các kỹ sư và doanh nghiệp công nghệ tại Việt Nam khi tiếp cận và ứng dụng các giải pháp AI vào thực tiễn.