OpenAI công bố benchmark Jalapeño, 700W vượt GB300

OpenAI tại hội nghị Hot Chips đã công bố loạt dữ liệu benchmark đầu tiên của chip suy luận tự phát triển Jalapeño. Chip này được phát triển cùng Broadcom, công suất định mức 700W, công suất liên tục thực đo dưới 550W, đối chuẩn với Nvidia GB200 NVL72 và GB300 NVL72 — hai accelerator này có công suất định mức lần lượt là 1200W và 1400W mỗi chip.

Bài test dùng bộ InferenceX do SemiAnalysis công khai, với ba mô hình: GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 của Moonshot AI (1 nghìn tỷ tham số). Theo kết quả OpenAI công bố, ở mức thông lượng đỉnh, lượng công việc AI xử lý được trên mỗi kilowatt cao gấp 1,5 đến 1,9 lần hệ thống đối chứng, độ trễ đầu-cuối thấp hơn 1,7 đến 3,6 lần, hiệu năng ở kịch bản tương tác cao vượt trội 2,1 đến 4,1 lần. Ở mức khoảng cách giữa các token nhanh nhất mà GB300 từng đạt được trước đây, chênh lệch thông lượng trên mỗi kilowatt mà OpenAI công bố được nới rộng lên 8,6 đến 104,3 lần.

Thông số một chip đơn: 13,4 PFLOPS (độ chính xác MXFP4), 216GB HBM4, băng thông bộ nhớ 15,4TB/s. Ghép 128 chip thành một rack cho tổng cộng 1,7 EFLOPS, 27,5TB HBM4, băng thông gần 2PB/s.

"The bottom line is that the results show a very, very significant performance advance over state of the art."

Nói ngắn gọn, các kết quả này cho thấy một bước tiến hiệu năng rất, rất đáng kể so với trình độ hiện tại.

700W này được vạch ra như thế nào

Jalapeño không huấn luyện mô hình, chỉ làm suy luận. Chỉ riêng lựa chọn này đã làm thay đổi hoàn toàn cách phân bổ ngân sách thiết kế của chip. Huấn luyện ngốn băng thông đồng bộ gradient và kết nối liên node, còn suy luận ngốn dung lượng bộ nhớ, tỷ lệ trúng cache KV và thời gian phản hồi từng request. Sự kết hợp 216GB HBM4 với 13,4 PFLOPS vì vậy cũng dễ hiểu — mật độ tính toán không hề mạnh, nhưng bộ nhớ và băng thông thì rất rộng rãi.

Giải thích thiết kế chính thức của OpenAI là "We designed Jalapeño to minimize data movement and communication delays" (chúng tôi thiết kế Jalapeño để giảm thiểu việc di chuyển dữ liệu và độ trễ giao tiếp), với các biện pháp cụ thể gồm bố trí và cục bộ hóa cache KV một cách tường minh, loại bỏ hẳn các điểm nghẽn ở giai đoạn prefill và giai đoạn giao tiếp.

Tính nhẩm một chút: cùng một ngân sách công suất rack 1400W, có thể nhét vừa hai chip Jalapeño hoặc một chip GB300. Nếu mức thông lượng trên mỗi kilowatt cao hơn 1,5 đến 1,9 lần là đúng, khoảng cách sản lượng ở cùng mức công suất sẽ còn được nhân đôi thêm một lần nữa. Với một công ty dồn phần lớn năng lực tính toán cho suy luận, thứ tiết kiệm được không chỉ là tiền điện, mà còn là phần công suất mà họ không mua được chip để lấp đầy.

Bản thân quá trình thiết kế chip cũng đáng ghi nhận: từ ý tưởng đến tape-out chỉ mất chín tháng, quá trình thiết kế có sự hỗ trợ của AI.

Ba mô hình chuẩn, hai đến từ Trung Quốc

Các mô hình được chọn để benchmark khá thú vị. GPT-OSS 120B là mô hình trọng số mở của chính OpenAI, còn DeepSeek R1 670B và Kimi K2.5 lần lượt đến từ DeepSeek và Moonshot AI. Một chip tăng tốc tự phát triển của công ty Mỹ, lại lấy trọng số mở của hai đội Trung Quốc làm thước đo.

Lý do khá đơn giản: kết quả suy luận của mô hình đóng nguồn bên thứ ba không thể tái hiện được, nhà sản xuất phần cứng muốn benchmark có người tin thì chỉ có thể chọn những trọng số mà ai cũng tải về và tự chạy lại được. Mô hình mã nguồn mở vì thế trượt từ vị trí "kẻ đuổi theo" sang vị trí thước đo công khai cho việc đánh giá phần cứng. Các đội trong nước hai năm qua công khai trọng số để đổi lấy hệ sinh thái, giờ đây phần thưởng bắt đầu được trả ở những nơi không ai ngờ tới.

Vài chỗ cần trừ điểm

The Register nhắc rằng bộ dữ liệu này cần được chiết khấu bớt: phần so sánh loại trừ các tối ưu như giải mã suy đoán (speculative decoding), phạm vi test chưa thể coi là đầy đủ. So sánh ngang, hệ thống Helios của AMD có băng thông bộ nhớ thấp hơn Jalapeño 15%, nhưng năng lực tính toán lại cao hơn 1,46 đến 2 lần; GPU của Nvidia và AMD vẫn có lợi thế về khả năng lập trình, chip suy luận chuyên dụng đổi lấy hiệu suất năng lượng thì cũng đánh đổi luôn cả sự linh hoạt.

Điểm quan trọng hơn: đợt so sánh này chưa đưa Vera Rubin — dòng chip vừa mới bắt đầu xuất xưởng — vào cuộc. Jalapeño đang đối đầu với Blackwell thế hệ trước, còn bản thân Vera Rubin phải đến cuối năm 2026 mới được triển khai "số lượng cực nhỏ" tại các cơ sở của chính OpenAI, quy mô hóa thì rơi vào năm 2027. Đến lúc nó thực sự lên máy, đối thủ đứng bên kia sẽ không còn là GB300 nữa.

Về nhịp độ, OpenAI không có ý định dừng lại: thế hệ thứ hai đang được phát triển sâu, thế hệ thứ ba đang trong giai đoạn thiết kế.

Nguồn tham khảo: Thông báo chính thức của OpenAI, TechCrunch, CocoLoop, The Register, Tom's Hardware; các chỉ số benchmark của bộ InferenceX (SemiAnalysis), thông số từng chip và số liệu công suất đều đã được đối chiếu theo từng mục với các nguồn tin công khai.