Thứ sáu, 28/08/2026

Alibaba hé lộ kiến trúc Qwen4 qua Qwen3.8-Flash-Next

Qwen3.8-Flash-Next mở trọng số với kiến trúc mới về attention, residual, embedding và tối ưu hóa, đồng thời là bản xem trước sớm của kiến trúc sẽ được sử dụng cho Qwen4.

Alibaba hé lộ kiến trúc Qwen4 qua Qwen3.8-Flash-Next

Kiến trúc mô hình

Qwen Team công bố Qwen3.8-Flash-Next, một mô hình Mixture-of-Experts (MoE) đa phương thức được mở trọng số, đồng thời đóng vai trò là bản xem trước sớm của kiến trúc sẽ được sử dụng trong Qwen4. Mô hình giữ vai trò tương tự Qwen3-Next trước đây đối với Qwen3.5: thiết kế lai Gated DeltaNet + Gated Attention được giới thiệu khi đó sau này đã được dùng xuyên suốt các dòng Qwen3.5, Qwen3.6, Qwen3.7 và Qwen3.8.

Qwen3.8-Flash-Next nâng cấp mô hình một cách có hệ thống theo bốn khía cạnh - attention, residual, embedding và optimization - cải thiện năng lực mô hình, đồng thời tiếp tục tối ưu hiệu quả tính toán, dung lượng mô hình và độ ổn định huấn luyện.

Full Attention truyền thống cho phép truy cập trực tiếp mọi token trước đó, nhưng khi ngữ cảnh dài hơn, cả chi phí tính toán và chi phí truy cập bộ nhớ KV Cache đều tăng đáng kể.

Open-weight và tích hợp vào hệ sinh thái AI agent

Tiếp nối thiết kế kiến trúc được giới thiệu trong Qwen3.5, Qwen3.8-Flash-Next dùng kiến trúc lai GDN + Attention. Sparse Attention giảm tính toán trên chuỗi dài bằng cách chỉ chú ý đến ngữ cảnh quan trọng. Tuy nhiên, các phương pháp hiện có như DSA vẫn phụ thuộc vào indexer cấp token để xác định vị trí quan trọng; khi ngữ cảnh dài hơn, chính indexer trở thành nguồn chi phí tính toán không thể bỏ qua.

Qwen3.8-Flash-Next được cung cấp dưới dạng open-weight trên Hugging Face và ModelScope, cùng API do QwenCloud quản lý. Qwen cho biết model được thiết kế để cân bằng giữa năng lực, độ trễ và chi phí, phù hợp với ứng dụng có khối lượng lớn, workflow sử dụng công cụ, cùng trợ lý lập trình và cộng tác công việc.

Qwen3.8-Flash-Next cũng tích hợp với các framework agent và trợ lý coding. QwenWork đã tích hợp Qwen3.8-Flash-Next để vận hành chế độ “Standard” mới, tận dụng năng lực của model để hướng tới trải nghiệm AI agent cho môi trường làm việc với chi phí thấp hơn.

TheoBáo Công Thương

Bạn thấy bài này thế nào?

Phản hồi ẩn danh — chúng tôi không lưu thông tin cá nhân.