Trang blog công nghệ TryAI.dev vừa công bố kết quả thử nghiệm độc đáo mang tên "AI Drawing Arena", nơi các mô hình ngôn ngữ lớn (LLM) hàng đầu hiện nay bao gồm GPT-5.6, Claude, Gemini và Grok cùng tranh tài tái hiện lại bức họa Mona Lisa nổi tiếng dưới phong cách tranh bút chì màu. Thay vì sử dụng các mô hình tạo ảnh trực tiếp như Midjourney hay DALL-E, các LLM này phải tự "vẽ" bằng cách xuất mã nguồn đồ họa (như SVG hoặc HTML5 Canvas) để trình duyệt hiển thị. Thử nghiệm này nhanh chóng thu hút sự chú ý lớn từ cộng đồng phát triển phần mềm trên Hacker News nhờ cách tiếp cận trực quan trong việc đánh giá năng lực tư duy không gian của AI.
Diễn biến chi tiết
Trong khuôn khổ cuộc thử nghiệm của TryAI.dev, mỗi mô hình nhận được một prompt yêu cầu tạo mã nguồn để dựng lại bức chân dung Mona Lisa theo phong cách "bút chì màu" (colored pencils). Điểm đặc biệt là các mô hình không được phép sử dụng bất kỳ thư viện ngoài nào mà phải tự tối ưu hóa cấu trúc vector hoặc mã vẽ canvas gốc để giả lập chất liệu bút chì. Theo báo cáo từ nền tảng này, các mô hình khác nhau thể hiện hướng tiếp cận và kết quả hoàn toàn khác biệt. Trong khi một số mô hình tập trung vào việc tạo cấu trúc hình học chi tiết của khuôn mặt, số khác lại chú trọng vào việc phối màu và giả lập nét bút để đạt được hiệu ứng giống tranh vẽ tay nhất.
Phân tích kỹ thuật & Công nghệ
Về mặt kỹ thuật, việc yêu cầu một mô hình ngôn ngữ thuần túy tạo ra đồ họa vector phức tạp đòi hỏi khả năng hiểu và ánh xạ không gian hai chiều cực kỳ chính xác. Mô hình phải tính toán tọa độ của hàng ngàn nét vẽ, độ phủ của màu sắc và cách xếp chồng các lớp (layers) để tạo chiều sâu. Các nhà phân tích chỉ ra rằng GPT-5.6 và phiên bản mới nhất của Claude thể hiện sự vượt trội nhờ khả năng quản lý mã nguồn SVG dung lượng lớn mà không bị đứt gãy giữa chừng. Ngược lại, Gemini và Grok đôi khi gặp khó khăn trong việc duy trì tính nhất quán của tọa độ khi số lượng phần tử vẽ (drawing elements) tăng lên, dẫn đến việc bức chân dung bị méo mó hoặc mất đi phong cách bút chì màu mong muốn.
Ý kiến chuyên gia & Nhận định
Nhiều kỹ sư trên diễn đàn Hacker News nhận định rằng, thử nghiệm này không chỉ là một trò tiêu khiển thú vị mà thực chất là một bài kiểm tra nghiêm ngặt về khả năng lập luận không gian (spatial reasoning) và giới hạn độ dài ngữ cảnh (context window) của mô hình. Việc render thành công một bức tranh phức tạp dưới dạng mã nguồn đòi hỏi mô hình phải ghi nhớ vị trí của từng điểm ảnh đã vẽ trước đó để điều chỉnh nét vẽ tiếp theo. Một chuyên gia bình luận: "Sự khác biệt giữa các mô hình nằm ở chỗ chúng hiểu thế nào là 'nét bút chì'. Một số chỉ đơn giản là tô các dải màu gradient, trong khi những mô hình thông minh hơn biết cách tạo các đường đứt nét ngẫu nhiên để mô phỏng chất liệu giấy và bút."
Tác động & Tương lai
Thành công bước đầu của các LLM trong việc tạo hình ảnh thông qua mã nguồn vector mở ra hướng đi mới cho việc thiết kế đồ họa lập trình và giao diện người dùng tự động. Người dùng không chỉ nhận về một bức ảnh tĩnh mà có được toàn bộ mã nguồn có thể chỉnh sửa, phóng to vô hạn mà không vỡ hình. Đối với cộng đồng phát triển công nghệ tại Việt Nam, phương pháp này gợi mở cách tận dụng AI để tối ưu hóa quy trình thiết kế giao diện (UI/UX) và tạo tài nguyên game trực tiếp bằng code, giảm bớt sự phụ thuộc vào các công cụ đồ họa truyền thống và mở rộng biên giới sáng tạo của lập trình viên.