Bỏ qua đến nội dung chính
Về trang chủ
AI 4 phút đọc

Black Forest Labs ra mắt FLUX 3: Tạo video 20 giây kèm âm thanh 🤖

FLUX 3 đánh dấu bước tiến lớn của Black Forest Labs khi hợp nhất khả năng tạo video kèm âm thanh bản xứ và hỗ trợ điều khiển robot chỉ với một kiến trúc duy nhất.

Tier 1 · nguồn 68% độ tin cậy Đã được duyệt
📚 Tổng hợp từ 2 nguồn The Decoder VentureBeat – AI

Black Forest Labs (BFL) vừa chính thức công bố FLUX 3, mô hình nền tảng đa phương thức (multimodal foundation model) thế hệ mới có khả năng tạo video kèm âm thanh bản xứ (native audio) dài tối đa 20 giây từ một câu lệnh. Đây là bước đi đột phá đánh dấu lần đầu tiên startup đứng sau Stable Diffusion mở rộng dòng mô hình FLUX từ tạo ảnh tĩnh sang lĩnh vực video, âm thanh và cả điều khiển robot. Hiện tại, FLUX 3 mới chỉ được phát hành giới hạn dưới dạng chương trình thử nghiệm sớm (Early Access) trước khi mở rộng rộng rãi trong vài tuần tới.

Diễn biến chi tiết

Sự kiện ra mắt FLUX 3 diễn ra trong bối cảnh cuộc đua AI đa phương thức đang trở nên vô cùng khốc liệt giữa các phòng nghiên cứu lớn. Theo VentureBeat, FLUX 3 sẽ được cung cấp qua bốn dòng sản phẩm chính bao gồm: FLUX 3 Video, FLUX 3 Image, FLUX 3 Action và phiên bản mã nguồn mở được mong đợi FLUX 3 Dev. Trong đợt ra mắt này, FLUX 3 Video và FLUX 3 Action sẽ bước vào chương trình truy cập sớm có kiểm duyệt, trong khi phiên bản tạo ảnh FLUX 3 Image dự kiến ra mắt trong vài tuần tới. Tuy nhiên, các nhà phát triển ưa chuộng việc tải trọng số mô hình (weights) về máy cá nhân sẽ phải kiên nhẫn chờ đợi, bởi FLUX 3 Dev dự kiến chỉ được phát hành vào cuối năm nay.

Phân tích kỹ thuật & Công nghệ

Điểm cốt lõi tạo nên sức mạnh của FLUX 3 nằm ở phương pháp huấn luyện đồng thời (joint training) trên một kiến trúc thống nhất, thay vì ghép nối các mô hình ảnh, video và âm thanh riêng lẻ lại với nhau. BFL đã xây dựng mô hình này dựa trên kỹ thuật Self-Flow—một phương pháp căn chỉnh đa phương thức do hãng công bố vào tháng 3 năm 2026—và nâng cấp mạnh mẽ tài nguyên tính toán cũng như dữ liệu huấn luyện. Nhờ đó, mô hình có khả năng tạo ra các clip video 20 giây ở độ phân giải 720p đồng bộ hoàn hảo với âm thanh tự nhiên. Thậm chí, cấu trúc này còn được mở rộng sang cả nhiệm vụ thị giác máy tính và hành động robot thông qua phiên bản thử nghiệm FLUX-mimic, hợp tác cùng hãng Mimic Robotics của Thụy Sĩ.

Ý kiến chuyên gia & Nhận định

BFL đã công bố một số kết quả thử nghiệm sơ bộ cho thấy FLUX 3 được người dùng ưa thích hơn các đối thủ như Runway Gen-4.5 (77%), Luma Ray 3.2 (93%), và ngang ngửa với Gemini Omni Flash của Google (52%). Dù vậy, giới phân tích doanh nghiệp tỏ ra thận trọng vì BFL chưa công bố chi tiết về giá cả hay các bài kiểm tra hiệu năng độc lập (benchmarks). Robin Rombach, đồng sáng lập kiêm CEO của BFL, nhấn mạnh triết lý của công ty: "Một mô hình chỉ học từ hình ảnh thì chỉ có thể tạo ra hình ảnh. Nhưng thế giới không được tạo nên từ các khung hình tĩnh. Nó chuyển động, phát ra âm thanh, thay đổi và phản hồi."

Tác động & Tương lai

Sự xuất hiện của FLUX 3 với khả năng tích hợp "trí tuệ thị giác" đồng nhất hứa hẹn sẽ định hình lại cách các doanh nghiệp sản xuất nội dung số và phát triển robot. Đối với giới công nghệ tại Việt Nam, khả năng tối ưu hóa của FLUX-mimic—giúp robot học một tác vụ gắp thả mới chỉ với 30 phút dữ liệu thay vì 30 giờ như trước—sẽ là một công cụ cực kỳ giá trị để đẩy nhanh tiến độ thử nghiệm tự động hóa. Khi phiên bản FLUX 3 Dev mở nguồn hoàn toàn vào cuối năm, đây chắc chắn sẽ là bệ phóng cho nhiều ứng dụng AI nội địa mang tính đột phá.