Vào ngày 2 tháng 4, Alibaba đã phát hành Qwen3.6-Plus.
Lần này không phải là một bản phát hành thông thường kiểu "mô hình lớn hơn", mà là một bản nâng cấp có mục tiêu dành riêng cho các tình huống tác nhân AI doanh nghiệp. Từ góc nhìn định vị sản phẩm, Alibaba lần này đã hiểu ra một điều: không thể thắng trong cuộc chạy đua vũ trang năng lực tổng quát, vậy thì hãy làm "tầng thực thi thực sự có thể làm việc trong môi trường sản xuất".
Ba thay đổi quan trọng nhất
1. Khả năng mã hóa: Kỹ năng kỹ thuật cấp kho lưu trữ
Các mô hình lớn viết mã trước đây về cơ bản là "đưa cho bạn một hàm, bạn sử dụng nó". Định vị của Qwen3.6-Plus khác biệt — nó có thể làm việc trong toàn bộ kho lưu trữ mã: lập kế hoạch, viết mã, chạy thử nghiệm, phát hiện vấn đề, sửa mã, một vòng lặp thực thi hoàn chỉnh.
Phương thức làm việc này khá giống với Claude Code, mô hình không phải là "người cung cấp đề xuất" trong lời nhắc, mà là người tham gia.
Hỗ trợ mặc định cửa sổ ngữ cảnh 1 triệu token, việc đưa toàn bộ mã của một dự án quy mô vừa vào là không có áp lực.
2. Hiểu thị giác: Ảnh chụp màn hình trực tiếp thành mã
Đưa cho nó một ảnh chụp màn hình giao diện người dùng, bản phác thảo tay, hoặc bản mẫu sản phẩm, nó có thể trực tiếp tạo ra mã frontend có thể chạy được. Không phải tạo ra một khung sườn đại khái, mà là một vòng lặp khép kín "xem hình viết mã".
Ngoài hình ảnh tĩnh, nó còn hỗ trợ hiểu nội dung tài liệu và video, điều này khá hữu ích cho các tình huống xây dựng công cụ nội bộ doanh nghiệp.
3. Gọi công cụ và lập kế hoạch dài hạn
Đây là nơi khoảng cách năng lực tác nhân AI giữa các công ty hiện nay lớn nhất. Qwen3.6-Plus đã đạt được kết quả tốt nhất trên nhiều benchmark lập kế hoạch dài hạn, và độ chính xác gọi công cụ cũng được cải thiện.
Về số liệu cụ thể, nó có hiệu suất cạnh tranh trên các đánh giá lập trình chuyên biệt như SWE-Bench, Terminal-Bench, nhưng Alibaba không công bố đầy đủ tất cả dữ liệu benchmark.
Một tính năng API mới: preserve_thinking
Tham số này duy trì ngữ cảnh suy luận trong các cuộc hội thoại nhiều vòng, thay vì suy luận lại từ đầu mỗi vòng.
Rất hữu ích cho các tình huống tác nhân: giảm suy luận dư thừa đồng nghĩa với giảm tiêu thụ token, đồng nghĩa với giảm chi phí sử dụng thực tế. Trong các tác vụ tự động hóa quy trình dài, sự khác biệt này sẽ được khuếch đại.
Tại sao nói đây là mô hình "Alibaba tự dùng trước"?
Qwen3.6-Plus sẽ được tích hợp vào hai sản phẩm nội bộ của Alibaba:
- Wukong: Nền tảng doanh nghiệp AI gốc của Alibaba, sử dụng hệ thống đa tác nhân để tự động hóa các tác vụ kinh doanh phức tạp
- Qwen App: Ứng dụng AI tiêu dùng hàng đầu của Alibaba
Tự dùng trước, sau đó mở ra bên ngoài, logic này thường có nghĩa là mô hình này đã trải qua các bài kiểm tra áp lực gần với tình huống thực tế hơn so với các benchmark bên ngoài thuần túy.
Khả năng tương thích môi trường lập trình khá tốt: hỗ trợ OpenClaw, Claude Code, Qwen Code, Kilo Code, đồng thời tương thích với hai bộ giao diện API của OpenAI và Anthropic, nhà phát triển có thể tích hợp mà không cần thay đổi lớn.
So sánh ngang: Hướng đi của Qwen có đúng không?
Nhìn vào lộ trình phát triển của dòng Qwen, từ hội thoại tổng quát đến ngữ cảnh dài, rồi đến chuyên biệt mã hóa, đa phương thức, và bây giờ là thực thi tác nhân, mỗi bước đều đi theo hướng "có thể làm việc nhiều hơn".
Hướng đi này ngày càng giống với chiến lược sản phẩm của Anthropic (Claude Code) và OpenAI (Codex). Điểm khác biệt là Alibaba có lợi thế bẩm sinh về khách hàng doanh nghiệp Trung Quốc và sự ràng buộc sâu sắc với hệ sinh thái Alibaba Cloud — đây là không gian khác biệt hóa trên thị trường nội địa, không thắng bằng điểm số benchmark, mà thắng bằng tích hợp hệ sinh thái.
Nguồn tham khảo: Qwen3.6-Plus: Towards Real World Agents (Alibaba Cloud Community); Alibaba Unveils Qwen3.6-Plus to Accelerate Agentic AI Deployment for Enterprises (Alibaba Cloud); CocoLoop; Beyond Passive Assistance: How Qwen3.6-Plus Is Advancing Agentic AI (The Tech Revolutionist)