Bỏ qua đến nội dung chính
Về trang chủ
AI Tech Robotics 4 phút đọc

🧩 Điểm yếu chí mạng của LLM và xu hướng tối ưu hóa bằng Agentic Workflow

Nghiên cứu mới chỉ ra LLM cực kỳ kém ổn định trước cách dùng từ, nhưng các giải pháp Agentic Workflow và tối ưu hóa prompt đang giúp khắc phục triệt để điểm yếu này.

Tier 2 · nguồn 70% độ tin cậy Đã được duyệt
📚 Tổng hợp từ 10 nguồn arXiv cs.AI arXiv cs.AI arXiv cs.AI +7 khác

Một loạt nghiên cứu học thuật mới công bố trên hệ thống arXiv đã phơi bày những điểm yếu cố hữu của các mô hình ngôn ngữ lớn (LLM) hiện nay, đặc biệt là sự thiếu ổn định khi đối mặt với các cách diễn đạt khác nhau cho cùng một câu hỏi. Tuy nhiên, thay vì chạy đua tăng tham số, giới nghiên cứu đang chuyển hướng sang tối ưu hóa thiết kế prompt và áp dụng quy trình tác nhân (Agentic Workflow) để khai thác hiệu quả tài nguyên. Những phát hiện này đánh dấu một bước chuyển dịch quan trọng từ việc sùng bái các mô hình khổng lồ sang việc tinh chỉnh cách thức tương tác và vận hành hệ thống thông minh.

Bối cảnh & Nguyên nhân

Theo nghiên cứu từ Đại học Cornell (arXiv:2607.22554), khi thay đổi cách diễn đạt của cùng một câu hỏi mà vẫn giữ nguyên ngữ nghĩa, câu trả lời của các LLM thường bị thay đổi đáng kể. Tỷ lệ không đồng nhất (mismatch rate) giữa các câu trả lời đạt tới hơn 23%, cho thấy độ chính xác dựa trên một prompt duy nhất không hề phản ánh đúng độ tin cậy thực tế của mô hình. Điều này chứng tỏ LLM sở hữu tri thức ẩn nhưng việc truy xuất lại thiếu nhất quán do nhạy cảm với cách hành văn.

Không chỉ ảnh hưởng đến tính chính xác, thiết kế prompt còn trực tiếp tác động đến hiệu năng phần cứng. Một nghiên cứu thực nghiệm đo lường điện năng trên điện thoại thông minh (arXiv:2607.22568) tiết lộ rằng, việc lựa chọn các từ khóa mệnh lệnh và cấu trúc câu lệnh khác nhau sẽ làm thay đổi độ dài giải mã (decoding length) và tổng năng lượng tiêu thụ của LLM chạy trực tiếp trên thiết bị (on-device). Điều này đặt ra bài toán kinh tế lớn cho các nhà phát triển ứng dụng di động tích hợp AI.

Phân tích kỹ thuật & Công nghệ

Để giải quyết các rào cản này, các giải pháp kỹ thuật mới tập trung vào kiến trúc hệ thống thay vì đào tạo lại mô hình. Nổi bật là hệ thống DeepLens Diagnosis Agent (arXiv:2607.22555), tích hợp mô hình y tế nhỏ JSL Medical Small 7B v2 vào một quy trình gồm 5 giai đoạn: trích xuất dữ liệu lâm sàng, truy xuất thông tin (RAG), tạo danh sách chẩn đoán, đối chiếu bằng chứng và đưa ra quyết định cuối cùng. Nhờ quy trình kiểm soát chặt chẽ này, mô hình 7B nhỏ gọn đạt độ chính xác chẩn đoán lên tới 60,14% trên benchmark DiagnosisArena, tăng vọt so với mức 23,99% của phương pháp prompt một lần (single-shot), thậm chí đánh bại các siêu mô hình như Claude Sonnet 4.5 và Gemini 3.1 Pro với chi phí rẻ hơn từ 35-45%.

Song song đó, khung Schema-Aware Localisation (SAL) dành cho tác vụ chuyển đổi ngôn ngữ tự nhiên sang SQL (NL2SQL) trên cơ sở dữ liệu Oracle (arXiv:2607.22572) lại tiếp cận bằng cách can thiệp trung gian. SAL tự động truy vấn danh mục hệ thống để xây dựng bản đồ schema thời gian thực, loại bỏ tình trạng ảo tưởng (hallucination) về bảng và cột mà không cần tinh chỉnh mô hình, nâng tỷ lệ thực thi chính xác từ mức thảm hại 2,2% lên đến 62,6%.

Ý kiến chuyên gia & Nhận định

Nhiều chuyên gia công nghệ nhận định rằng kỷ nguyên của việc phụ thuộc hoàn toàn vào các mô hình khổng lồ (frontier LLMs) thông qua các prompt đơn giản đang dần khép lại. Việc tinh chỉnh quy trình tương tác không chỉ giúp tối ưu chi phí vận hành mà còn mang lại khả năng kiểm chứng và giải thích được (explainability) – yếu tố sống còn trong các lĩnh vực nhạy cảm như y tế hay tài chính. Trọng tâm nghiên cứu hiện tại là làm thế nào để xây dựng các "vỏ bọc" quy trình đủ thông minh xung quanh các mô hình nhỏ nhằm đạt hiệu năng tương đương hoặc vượt trội đàn anh lớn.

Tác động & Tương lai

Xu hướng này mở ra cơ hội lớn cho các nhà phát triển tại Việt Nam, nơi tài nguyên tính toán và ngân sách cho hạ tầng AI còn hạn chế. Thay vì tốn kém chi phí cho API của các mô hình độc quyền lớn, việc làm chủ các kỹ thuật như Agentic Workflow, tối ưu hóa năng lượng prompt trên thiết bị và các lớp trung gian định tuyến thông minh sẽ là chìa khóa để xây dựng các ứng dụng AI chuyên biệt vừa rẻ, vừa bảo mật lại có độ tin cậy vượt trội trong tương lai gần.