Ngày 9/10, Microsoft giới thiệu Microsoft-Decision-1 trên tạp chí kỹ thuật Command Line của hãng. Đây là mô hình chỉ chuyên làm "câu hỏi trắc nghiệm": định tuyến, phân loại, xếp hạng, kiểm định và điều khiển luồng công việc. Tác giả bài viết là Achint Srivastava, phó chủ tịch phụ trách kỹ thuật phần mềm tại Văn phòng Giám đốc Công nghệ của Microsoft. Mô hình đã có mặt trên Microsoft Foundry và cũng được tích hợp vào OpenRouter.
Đầu ra của nó rất hẹp. Bên gọi đưa trước một tập lựa chọn cố định, mô hình trả về cho mỗi lựa chọn một xác suất đã được hiệu chỉnh, và phần mềm nhận kết quả rồi thực thi ngay. Mô hình hỗ trợ câu hỏi có/không, nhiều lựa chọn, chấm điểm và chấm theo thang tiêu chí (rubric); viết văn bản dài hay suy luận phức tạp không nằm trong phần việc của nó.
Thành tích do Microsoft tự công bố
Microsoft cho biết Decision-1 đạt độ chính xác cao nhất trong phép so sánh trên 36 bộ benchmark với gần 150.000 câu hỏi, còn độ trễ P50 chỉ khoảng 1/35 của GPT-6 Sol. Bài viết nêu một ví dụ: một quy trình nối 20 quyết định, mỗi quyết định chậm thêm 100 mili giây thì cả chuỗi chậm thêm 2 giây.
Về độ ổn định, khi cùng một yêu cầu bị nhiễu theo 8 cách khác nhau, tỷ lệ quyết định bị đảo ngược trung bình là 1,3%; nếu chỉ diễn đạt lại, đảo ngược hoặc xáo trộn thứ tự các lựa chọn thì tỷ lệ này bằng 0. Nguyên tắc Microsoft đặt ra cho phép thử này là:
"Equivalent inputs should produce equivalent decisions." (Những đầu vào tương đương phải cho ra những quyết định tương đương.)
Phần kiểm thử an toàn bao gồm 11 bộ benchmark và 5.250 yêu cầu, thuộc các loại nội dung có hại, vượt rào (jailbreak) và tiêm lệnh (prompt injection), nhưng bài viết không nêu tỷ lệ từ chối.
Có vài nhóm số liệu từ đợt dùng thử nội bộ. Nhóm nghiên cứu Xbox dùng nó xử lý hơn một vạn phản hồi của người dùng, chất lượng tương đương GPT-6 Sol, nhanh hơn trên 14 lần và rẻ hơn trên 200 lần; nhóm Copilot đo được chất lượng tương đương GPT-5.6 Luna và nhanh hơn 100 lần. Tất cả đều do Microsoft tự đo. Bài viết không liệt kê tên từng benchmark trong số 36 bộ kia hay độ chính xác cụ thể, và hiện chưa có bên thứ ba nào tái lập kết quả. Còn mô hình xếp thứ hai là mô hình nào và chậm hơn bao nhiêu, thì bài gốc của Microsoft và bản thuật lại bằng tiếng Trung đưa ra hai cách nói không khớp nhau, nên cần lấy cập nhật chính thức sau này làm chuẩn.
Giá bán bám sát cách sử dụng
Giá là 0,042 USD cho mỗi triệu token đầu vào, đầu ra miễn phí; theo quy đổi của ITHome, khoảng 0,28 nhân dân tệ. Đầu ra của các lệnh gọi kiểu quyết định thường chỉ vài token, tiền chủ yếu tiêu vào phần ngữ cảnh đầu vào, nên cách định giá này khớp với cách dùng thực tế.
Loại mô hình này trong ứng dụng thường được đặt trước mô hình lớn: trước hết xác định một yêu cầu nên giao cho mô hình nào, đi theo quy trình nào, hoặc đánh giá kết quả của một bước do tác tử (agent) thực hiện có đạt hay không, rồi mới quyết định bước tiếp theo. Những phán đoán này trước đây phần nhiều do mô hình lớn đa dụng làm kiêm nhiệm; chuyển sang một mô hình chuyên dụng nhỏ và nhanh thì thứ tiết kiệm được là độ trễ và chi phí gọi.
Nền tảng đến từ Qwen
Trong bài có một câu khá nặng ký: Decision-1 được hậu huấn luyện (post-training) trên Qwen3.5-9B mã nguồn mở của Alibaba. Microsoft cho biết thêm rằng sau này sẽ chuyển cùng phương pháp sang các nền tảng khác, và nêu tên các mô hình tự phát triển của Microsoft AI (MAI) cùng mô hình của OpenAI.
Với các nhà phát triển ở Trung Quốc, thông tin này có thể nhìn từ ba góc. Thứ nhất, trọng số mở của Qwen đã đi vào sản phẩm chính thức của Microsoft, và Microsoft ghi rõ xuất xứ ngay trong bài công bố. Thứ hai, với nhóm nào muốn làm thứ tương tự, con đường gần như đã được bày ra: lấy một mô hình mã nguồn mở cỡ 9B, hậu huấn luyện xoay quanh mô hình "lựa chọn cố định cộng xác suất đã hiệu chỉnh", rồi cho kết quả chỉ sau một lượt suy luận. Thứ ba, bản thân Decision-1 không mở trọng số, nên ở Trung Quốc chỉ có thể dùng qua giao diện của Foundry hoặc OpenRouter; còn nền tảng của nó là Qwen3.5-9B thì có thể tải về trực tiếp.
Năm nay Microsoft đã lần lượt tung ra nhiều mô hình tự phát triển MAI. Decision-1 khởi đầu bằng một nền tảng mã nguồn mở bên ngoài; còn thành tích có giữ được hay không sau khi chuyển sang nền tảng MAI thì phải chờ số liệu ở phiên bản kế tiếp.
Nguồn tham khảo: bài công bố trên Command Line của Microsoft, CocoLoop, ITHome; số lượng benchmark, bội số độ trễ và giá mỗi triệu token được đối chiếu theo cách tính do Microsoft tự đo.