Tài khoản @ClaudeDevs trên mạng xã hội X công bố kết quả thử nghiệm cài cắm 70 lỗi lập trình vào một kho mã nguồn (codebase) gồm 116.000 dòng lệnh để so sánh hiệu năng giữa một AI agent đơn lẻ và một quy trình làm việc dạng workflow. Kết quả được nhóm phát triển ghi nhận cho thấy sự chênh lệch đáng kể về tính nhất quán và tỷ lệ phát hiện lỗi giữa hai cách tiếp cận.
Cụ thể, theo báo cáo từ @ClaudeDevs, khi để một agent đơn lẻ tự vận hành qua 3 lần chạy độc lập, số lượng lỗi tìm được lần lượt là 14, 15 và 27 lỗi trên tổng số 70 lỗi ban đầu. Con số này không chỉ dừng ở mức thấp so với toàn bộ số lỗi được cấy vào mà còn biến thiên thất thường qua từng lượt quét.
Ngược lại, khi chuyển sang thiết lập dạng workflow — tức quy trình phối hợp có cấu trúc thay vì để agent hoạt động tự do — hệ thống đạt hiệu suất cao và ổn định hơn hẳn. Trong cả 3 lượt thử nghiệm riêng biệt, workflow này đều tìm chính xác 66 trên tổng số 70 lỗi cài sẵn.
Dù kết quả trên cho thấy tiềm năng của việc tổ chức quy trình làm việc đa tầng cho mô hình ngôn ngữ lớn, bài đăng ngắn gọn của @ClaudeDevs vẫn để ngỏ nhiều chi tiết quan trọng. Đơn vị này chưa công bố cụ thể mô hình nền tảng đứng sau, cấu trúc chi tiết của workflow, loại ngôn ngữ lập trình của 116.000 dòng mã cũng như mức độ phức tạp của các lỗi được cài cắm trong thử nghiệm.