StepFun ra mắt Step 5 Preview, tự nhận chi phí chỉ bằng 1/8 Opus 5

Ngày 20/9, StepFun phát hành mô hình nền tảng chủ lực thế hệ mới Step 5 Preview, có thể sử dụng ngay trên các sản phẩm và API của hãng, còn bộ trọng số đầy đủ dự kiến mở nguồn vào ngày 15/10.

Mô hình đi theo hướng MoE thưa, tổng tham số 600 tỷ, mỗi token kích hoạt 27 tỷ, cửa sổ ngữ cảnh 1 triệu token, hỗ trợ gốc cả đầu vào văn bản lẫn hình ảnh. Thông báo phát hành nêu rất cụ thể các hướng ứng dụng: lập trình AI, kỹ thuật phần mềm, công việc tri thức chuyên môn và các tình huống tài chính.

Thành tích trên bảng xếp hạng và các benchmark tự xây dựng

Trên chỉ số trí tuệ tổng hợp của Artificial Analysis, Step 5 Preview đạt 44 điểm, lọt top 3 mô hình mã nguồn mở toàn cầu. Các benchmark công khai khác cho kết quả: GPQA Diamond 93,5%, Terminal-Bench v2.1 85,0%, BrowseComp 88,7%, còn MMMU-Pro đa phương thức đạt 76,0%. StepFun cũng cho biết đạt kết quả tốt nhất hoặc thứ nhì trên các benchmark như AA-LCR, CyberGym.

Có một nhóm số liệu khác cần nhìn tách biệt. StepFun đồng thời công bố hai kết quả trên StepCodeBench và FinStepBench, hai benchmark do chính hãng tự xây dựng: StepCodeBench bao phủ 553 kho mã, 9 loại tác vụ, 20 lĩnh vực ứng dụng và 33 ngôn ngữ lập trình, dùng để đo các tác vụ phát triển thực tế như sửa lỗi, phát triển tính năng, tái cấu trúc mã và cấu hình môi trường. Bản thân StepFun cũng ghi rõ trong tài liệu rằng mục đích thiết kế của benchmark tự xây khác với bảng xếp hạng công khai, và kết quả ở các thiết lập khác nhau không thể so sánh trực tiếp.

Về năng lực agent, StepFun cho biết mô hình có thể tự chủ thực hiện các tác vụ liên tục kéo dài hơn 3 giờ, hỗ trợ gỡ lỗi mã, truy cập cổng nối tiếp, chụp ảnh màn hình, gọi camera và mô phỏng thao tác chuột. Những mô tả này hiện chưa có bên thứ ba tái lập, những gì bên ngoài có thể kiểm chứng chỉ là vài kết quả trên bảng xếp hạng công khai.

Một phép tính, và cách tính ra con số đó

Câu được trích dẫn nhiều nhất trong thông báo phát hành là: chi phí cho mỗi tác vụ chỉ bằng một phần tám so với Claude Opus 5 của Anthropic. Câu này do chính StepFun đưa ra, tài liệu công khai không ghi rõ căn cứ tính toán — bao nhiêu tác vụ, phân bố độ khó thế nào, tính theo giá niêm yết API hay theo mức sử dụng thực tế — không một chi tiết nào được nêu.

Thử đặt cách tính này vào một tình huống cụ thể: nếu một đội ngũ chi 100.000 nhân dân tệ mỗi tháng cho suy luận trên Opus 5, theo tỷ lệ một phần tám thì chuyển sang Step 5 Preview sẽ vào khoảng 12.500 nhân dân tệ, tiết kiệm cả năm ở mức hàng triệu. Con số này chỉ đúng nếu phân bố tác vụ giống với lúc StepFun đo lường, mà đây chính là phần chưa được công khai. Với các đội ngũ đang cân nhắc chuyển đổi, sau khi trọng số được công bố vào ngày 15/10, tự chạy lại một bộ tác vụ tương đương sẽ đáng tin hơn là trích dẫn con số tám lần này.

Việc chọn đối tượng so sánh cũng nói lên định vị. StepFun không lấy một mô hình mã nguồn mở khác làm chuẩn, mà chọn ngay mẫu đắt nhất trong nhóm mô hình mã nguồn đóng hàng đầu.

Khung thời gian một tháng

Phiên bản Preview lên API trước, còn trọng số chính thức phải chờ thêm một tháng — nhịp độ này ngày càng được nhiều hãng trong nước áp dụng trong năm nay: chiếm lĩnh bảng xếp hạng và sự chú ý của dư luận trước, rồi mới mở trọng số sau. Rủi ro là trong khoảng một tháng đó, một mô hình mã nguồn mở cùng tầm có thể ra mắt bất cứ lúc nào, và không ai dám chắc vị trí 44 điểm này còn giữ được đến ngày 15/10 hay không.

Xét về mặt kỹ thuật, cấu hình 600 tỷ tham số tổng cộng với 27 tỷ tham số kích hoạt tương đối thân thiện với bên triển khai; mức kích hoạt 27 tỷ đồng nghĩa suy luận đa card trên một máy là khả thi, không cần chuẩn bị tài nguyên như với một mô hình dense 600 tỷ. Đây cũng là điều kiện tiên quyết để mở trọng số ra công khai — nếu quy mô tham số tiếp tục tăng, ý nghĩa thực tế của việc mã nguồn mở sẽ bị ngưỡng triển khai bào mòn đáng kể.

Giấy phép sử dụng và mức giá API, lần này StepFun đều chưa công bố. Hai yếu tố này sẽ quyết định sau ngày 15/10 có bao nhiêu người thực sự cài đặt và sử dụng mô hình.

Nguồn tham khảo: Thông báo chính thức của StepFun, Phoenix New Media (Ifeng), CocoLoop, Sina Tech; quy mô tham số, điểm chỉ số trí tuệ tổng hợp AA và thời điểm mở nguồn được đối chiếu theo thông tin chính thức, còn tỷ lệ chi phí và kết quả benchmark tự xây đều là số liệu một phía từ StepFun.