Bỏ qua đến nội dung chính
Về trang chủ
AI Tech 3 phút đọc

OpenAI tích hợp công nghệ giọng nói GPT-Live vào ứng dụng máy tính

OpenAI đã mang tính năng điều khiển bằng giọng nói full-duplex của GPT-Live lên ứng dụng desktop, hỗ trợ lập trình viên điều phối đa tác nhân trên Codex và ChatGPT Work.

Tier 1 · nguồn 68% độ tin cậy Đã được duyệt
📚 Tổng hợp từ 2 nguồn X — @sama VentureBeat – AI

OpenAI vừa chính thức phát hành tính năng điều khiển bằng giọng nói toàn phần (full-duplex) thông qua mô hình GPT-Live trên ứng dụng máy tính cho macOS và Windows. Bản cập nhật này cho phép người dùng, đặc biệt là các lập trình viên, điều phối trực tiếp các hệ thống tác nhân (agent) như Codex và ChatGPT Work bằng giọng nói thay vì phải gõ phím thủ công.

Diễn biến chi tiết

Theo thông tin từ bài đăng của OpenAI trên mạng xã hội X và trang VentureBeat, công nghệ này được tung ra toàn cầu vào ngày 23/7/2026, chỉ hai tuần sau khi mô hình âm thanh GPT-Live ra mắt vào ngày 8/7/2026. Với bản cập nhật mới nhất (build 26.715), các nhà phát triển hiện có thể thực hiện nhiều tác vụ lập trình phức tạp như duyệt pull request, debug ứng dụng hay chạy song song nhiều luồng công việc khác nhau mà không cần chạm tay vào bàn phím. OpenAI cũng đã trình diễn khả năng tương tác nhóm khi nhiều kỹ sư cùng thảo luận và ra lệnh cho một phiên làm việc duy nhất trên ứng dụng desktop mà không bị chồng chéo.

Phân tích kỹ thuật & Công nghệ

Về mặt kiến trúc kỹ thuật, hệ thống này hoạt động dựa trên việc tách biệt lớp xử lý giọng nói thời gian thực khỏi các công cụ thực thi logic bên dưới. Trong khi GPT-Live đảm nhiệm việc duy trì cuộc đối thoại hai chiều liên tục nhờ khả năng nói và nghe đồng thời (full-duplex), các tác vụ tính toán nặng hoặc suy luận phức tạp được đẩy xuống cho các mô hình nền tảng xử lý ngầm (chẳng hạn như GPT-5.5). Riêng trên hệ điều hành macOS, ứng dụng còn tích hợp tính năng "Appshots" và thu thập ngữ cảnh màn hình, cho phép trợ lý giọng nói phân tích trực tiếp cửa sổ đang hiển thị, cấu trúc mã nguồn nội bộ cũng như các file cục bộ để đưa ra phản hồi chính xác.

Ý kiến chuyên gia & Nhận định

Sự ra mắt này đã nhận được nhiều phản hồi tích cực từ cộng đồng phát triển công nghệ. Chuyên gia phân tích @ChrisGPT nhận định trên mạng xã hội X rằng việc mang cơ chế hướng dẫn từ xa và điều khiển giọng nói lên Codex là "một bước gần hơn tới trí tuệ nhân tạo tổng quát (AGI) cá nhân". Tuy nhiên, do đây là sản phẩm thương mại độc quyền của OpenAI, người dùng sẽ phải trả phí thông qua các gói Plus, Pro, Business hoặc Enterprise để trải nghiệm. Hơn nữa, việc thực thi qua giọng nói vẫn sẽ tiêu tốn hạn ngạch (quota) sử dụng thông thường của tài khoản, khiến doanh nghiệp cần cân nhắc kỹ về chi phí vận hành.

Tác động & Tương lai

Việc thương mại hóa công cụ lập trình rảnh tay này hứa hẹn sẽ mở ra một phương thức làm việc mới, giảm thiểu sự mệt mỏi cho các lập trình viên khi phải chuyển đổi liên tục giữa các cửa sổ ứng dụng. Với tệp người dùng hoạt động hàng tuần của Codex đã vượt mốc 5 triệu, bước đi này của OpenAI không chỉ củng cố vị thế dẫn đầu trong mảng hỗ trợ lập trình AI mà còn định hình lại cách con người tương tác với máy tính thông qua các hệ thống đa tác nhân tự trị trong tương lai gần.