Ngày 2 tháng 8 năm 2026, cộng đồng công nghệ trên Hacker News xôn xao trước một phương pháp đánh giá (benchmark) năng lực AI vô cùng độc đáo từ trang frogs.vaguespac.es. Thay vì sử dụng các bộ dữ liệu tiêu chuẩn vốn dễ bị học vẹt, tác giả đã yêu cầu các mô hình ngôn ngữ lớn (LLM) tự viết mã SVG để vẽ một chú ếch có đặc điểm 'cằm Habsburg' - một dị dạng móm đặc trưng của hoàng gia châu Âu thời xưa. Bài thử nghiệm kỳ lạ này đã bộc lộ những giới hạn bất ngờ về khả năng tư duy không gian và kết hợp ngữ cảnh lịch sử của trí tuệ nhân tạo hiện nay.
Bối cảnh & Nguyên nhân
Các bộ công cụ đánh giá AI truyền thống như MMLU hay HumanEval đang dần mất đi tính khách quan khi các nhà phát triển liên tục tinh chỉnh mô hình dựa trên chính các tập dữ liệu này. Điều này dẫn đến hiện tượng 'học vẹt' (overfitting), khiến AI đạt điểm số tối đa trên lý thuyết nhưng lại lúng túng trước các tác vụ thực tế đòi hỏi sự sáng tạo sâu sắc. Để giải quyết vấn đề đó, xu hướng tự tạo các bài kiểm tra thực tế mang tính trực quan đang ngày càng phổ biến trong giới lập trình. Thử thách vẽ ếch bằng mã nguồn SVG là một ví dụ điển hình, buộc AI phải tự hình dung ra bố cục hình học mà không thể sao chép trực tiếp từ cơ sở dữ liệu có sẵn.
Phân tích kỹ thuật & Công nghệ
Yêu cầu vẽ đồ họa vector (SVG) bằng mã code XML thuần túy là một bài kiểm tra cực kỳ khắc nghiệt đối với khả năng tư duy không gian của các LLM. Mô hình không chỉ phải hiểu cấu trúc cú pháp của thẻ <svg>, <path>, <ellipse> mà còn phải tính toán chính xác tọa độ x, y trên một hệ trục ảo để các hình khối không bị chồng chéo lên nhau một cách hỗn loạn. Đặc biệt hơn, việc tích hợp yếu tố 'cằm Habsburg' đòi hỏi AI phải chuyển đổi một khái niệm trừu tượng thuộc về lịch sử và sinh học thành các đường cong Bezier cụ thể. Điều này kiểm tra mức độ liên kết đa tầng giữa kiến thức lịch sử và kỹ năng lập trình đồ họa trực quan của mô hình.
Ý kiến chuyên gia & Nhận định
Theo các thảo luận trên diễn đàn Hacker News, phần lớn các mô hình AI hiện nay đều gặp khó khăn lớn khi đối mặt với thử thách này. Trong khi một số mô hình tiên tiến nhất có thể tạo ra mã SVG hợp lệ và hiển thị được hình dáng cơ bản của một sinh vật, thì việc định hình chính xác chiếc cằm dị tật của dòng họ Habsburg vẫn là một rào cản quá lớn. Đa số kết quả cho ra những hình ảnh méo mó, các bộ phận nằm rải rác hoặc hoàn toàn phớt lờ chi tiết 'chiếc cằm' đặc biệt kia. Điều này chứng minh rằng khả năng hiểu ngữ cảnh không gian thực tế và kết xuất đồ họa gián tiếp qua mã nguồn của AI vẫn còn khoảng cách rất xa so với con người.
Tác động & Tương lai
Phương pháp benchmark cá nhân và có phần hài hước này đã mở ra một hướng đi mới trong việc đánh giá AI một cách thực tế và khách quan hơn. Thay vì chạy đua theo những điểm số benchmark vô hồn do các hãng công nghệ lớn công bố, người dùng có thể tự kiểm tra giới hạn của AI bằng những yêu cầu mang tính liên ngành độc đáo. Đối với giới phát triển tại Việt Nam, bài thử nghiệm này là một gợi ý tuyệt vời để xây dựng các kịch bản đánh giá năng lực suy luận thực tế của AI, từ đó chọn lựa được mô hình tối ưu nhất cho các dự án tự động hóa thiết kế hoặc lập trình giao diện trực quan trong tương lai.