Vào ngày 20/07/2026, các nhà nghiên cứu từ startup AI Writer đã công bố một nghiên cứu mới về việc tối ưu hóa lớp điều phối (harness) bao quanh mô hình nền tảng. Phương pháp này giúp giảm tới 38% lượng token tiêu thụ trên mỗi tác vụ và giảm chi phí vận hành thực tế lên đến 41% mà không cần tinh chỉnh (fine-tune) mô hình gốc. Đây được xem là lời giải cho bài toán chi phí vận hành đắt đỏ đang cản trở các doanh nghiệp triển khai AI đại trà trong sản xuất thực tế.
Bối cảnh & Nguyên nhân
Hiện nay, ngành kỹ thuật AI đang rơi vào tình trạng lạm dụng tài nguyên mà giới chuyên môn gọi là "tokenmaxxing". Theo báo cáo của Writer, xu hướng này xuất phát từ việc các nhà phát triển quá phụ thuộc vào cửa sổ ngữ cảnh khổng lồ và xử lý thô bạo bằng lượng token lớn để thay thế cho thiết kế hệ thống tốt. Thay vì xây dựng các luồng công việc tinh gọn, lập trình viên thường nạp toàn bộ tài liệu gốc vào prompt hoặc để các vòng lặp tác vụ (agentic loops) tự do thử sai vô tội vạ. Việc này khiến chi phí sử dụng API tăng vọt một cách âm thầm, đặc biệt khi token đầu ra (output token) luôn có giá đắt hơn nhiều so với token đầu vào. Mặc dù các nhà cung cấp liên tục giảm giá dịch vụ, nhưng chi phí trên mỗi tác vụ của doanh nghiệp vẫn phình to do sự lãng phí trong khâu thiết kế lớp điều phối.
Phân tích kỹ thuật & Công nghệ
Để giải quyết vấn đề, Writer đề xuất tối ưu hóa "harness" – lớp phần mềm trung gian chịu trách nhiệm định tuyến, định dạng và biến mô hình ngôn ngữ lớn (LLM) thành hệ thống hoạt động thực tế. Giải pháp này bao gồm hai kỹ thuật cốt lõi: cấu trúc prompt hai vùng ("Two-Zone Prompt") và giảm tải ngữ cảnh ("Context Offloading"). Cấu trúc prompt hai vùng phân chia nội dung thành vùng tĩnh (quy tắc cốt lõi, sơ đồ công cụ) đặt ở đầu để kích hoạt tính năng bộ nhớ đệm (prompt caching), và vùng động (truy vấn của người dùng) đặt ở cuối. Trong khi đó, kỹ thuật giảm tải ngữ cảnh sẽ di chuyển lịch sử trò chuyện và dữ liệu trung gian ra khỏi cửa sổ ngữ cảnh chính vào bộ nhớ lưu trữ có thể truy xuất, chỉ giữ lại những thông tin tối thiểu mà bước xử lý hiện tại cần.
Ý kiến chuyên gia & Nhận định
Ông Waseem AlShikh, CTO và đồng sáng lập của Writer, nhấn mạnh rằng doanh nghiệp thường dành nhiều tháng để đánh giá mô hình nhưng lại đi thuê ngoài hoặc dùng sẵn lớp điều phối, vốn là đòn bẩy lớn hơn quyết định chi phí vận hành. Ông chia sẻ thêm: "Ai sở hữu lớp điều phối sẽ sở hữu tính kinh tế của từng đơn vị vận hành, và các khung nguồn mở dùng thử nghiệm vốn không được tối ưu hóa cho hóa đơn của bạn." Nghiên cứu thực nghiệm trên 6 mô hình khác nhau, bao gồm Claude Sonnet 4.6 và Palmyra X6 của Writer, cho thấy hệ thống tối ưu giúp giảm thời gian phản hồi trung bình từ 48 giây xuống còn 27 giây. Tuy nhiên, các nhà nghiên cứu cũng cảnh báo rằng cơ chế phân rã tác vụ cho sub-agent chỉ hoạt động hiệu quả trên các mô hình mạnh mẽ, trong khi các mô hình nhẹ như Gemini Flash 3.5 hay Qwen 3.6 vẫn chưa đủ độ tin cậy.
Tác động & Tương lai
Nghiên cứu này mở ra một lối đi thực tế cho các kỹ sư AI tại Việt Nam và toàn cầu, chuyển trọng tâm từ việc chạy đua kích thước mô hình sang tối ưu hóa kiến trúc phần mềm xung quanh. Việc kiểm soát ngân sách token nghiêm ngặt bằng mã code chuyên biệt thay vì phó thác cho mô hình tự quản lý sẽ là tiêu chuẩn bắt buộc cho các dự án AI quy mô lớn. Về lâu dài, khi các mô hình nền tảng tự tích hợp khả năng lập kế hoạch trực tiếp, vai trò của lớp điều phối sẽ dịch chuyển dần từ sửa lỗi mô hình sang thực thi chính sách quản trị của doanh nghiệp.