Giám đốc tài chính của OpenAI, bà Sarah Friar, phát biểu tại hội nghị Communacopia của Goldman Sachs ngày 8/9 rằng công ty đã dùng chính các mô hình tiên phong của mình vào việc thiết kế chip, giúp chip suy luận tự phát triển Jalapeno chỉ mất 9 tháng từ khi thiết kế đến khi hoàn thiện. Bà cũng liệt kê thiết kế chip, khoa học sự sống và dịch vụ tài chính là ba ngành mà công ty muốn đẩy mạnh, với lý do nhu cầu về AI được xây dựng riêng cho từng quy trình làm việc trong các lĩnh vực này đang tăng lên.
Jalapeno là chip suy luận được OpenAI phát triển cùng Broadcom, công bố ra công chúng vào tháng 6 năm nay, với mục đích chạy các mô hình của chính OpenAI với chi phí thấp hơn. Theo thông tin công khai, mẫu thử sớm có thể tiết kiệm khoảng một nửa chi phí so với các bộ xử lý đồ họa AI thông thường. Thời điểm xuất xưởng của chip chưa được công bố.
Tốc độ 9 tháng được xem là ngắn đối với chip tùy chỉnh. Một con chip ASIC suy luận mới, từ khi chốt kiến trúc đến khi tape-out, thường mất từ một năm rưỡi đến hai năm theo tiêu chuẩn ngành. Bà Friar cho rằng nguyên nhân của việc rút ngắn này nằm ở chính các mô hình của công ty, nhưng không nói rõ mô hình đã đảm nhận công đoạn cụ thể nào — bố trí và đi dây (layout, routing), kiểm chứng, hay giai đoạn khám phá kiến trúc sớm hơn.
So Luna với GLM-5.3
Phần về giá là nội dung cụ thể hơn trong bài phát biểu lần này. Bà Friar cho biết sau khi Luna giảm giá 80%, giá đầu vào giảm xuống còn 0,20 USD/triệu token, giá đầu ra là 1,20 USD, và lượng sử dụng sau đó tăng khoảng 10 lần. Bà tiếp tục chỉ đích danh đối tượng so sánh giá là một mô hình mã nguồn mở của Trung Quốc:
"If you're deploying Luna and compare that to (Z.ai's) GLM 5.3, for example, on a cloud layer, we are cheaper."
Nếu bạn triển khai Luna và so sánh nó với GLM-5.3 của Zhipu AI chẳng hạn, ở tầng đám mây, chúng tôi rẻ hơn.
Cách tính trong câu này cần được lưu ý. Bà so sánh việc "triển khai GLM-5.3 trên đám mây", tức là mức giá thực tế sau khi trọng số mã nguồn mở được một bên thứ ba lưu trữ trên đám mây, trong khi mức giá công khai của API chính chủ Zhipu AI lại là một con số khác: khi ra mắt, GLM-5.3 công bố giá đầu ra là 4,4 USD/triệu token. Cùng một mô hình nhưng chạy qua API chính chủ và chạy qua đám mây bên thứ ba có thể chênh lệch giá vài lần, vì bên thứ ba phải phân bổ chi phí cho việc chiếm dụng GPU, bộ nhớ và mức sử dụng đồng thời. OpenAI không công bố đầy đủ cách tính của phép so sánh giá này, cũng không nói rõ mức thông lượng giả định khi so sánh.
Áp lực thực sự lên phía mã nguồn mở trong nước
Cách lập luận này nhắm vào kịch bản doanh nghiệp tự triển khai. Trong hai năm qua, lý do chính khiến doanh nghiệp trong và ngoài Trung Quốc chọn trọng số mã nguồn mở có hai điểm: dữ liệu không rời khỏi phạm vi kiểm soát, và tính toán ra thì rẻ hơn khi tự làm. Lý do thứ nhất không bị ảnh hưởng, nhưng lý do thứ hai đang bị bên mô hình đóng nguồn ép giá. Khi giá đầu ra của Luna giảm xuống 1,20 USD, và còn có một con chip suy luận tự phát triển phía sau tiếp tục kéo giá xuống nữa, thì bài toán "tự lưu trữ tiết kiệm hơn" cần được tính lại từ đầu — đặc biệt với những đội không có mức đồng thời cao và không tận dụng hết GPU.
Cần nói rõ rằng những gì bà Friar đưa ra là góc nhìn từ phía người bán, bên thứ ba hiện chưa công bố phép tính đơn giá công khai nào so sánh Luna với GLM-5.3 trong cùng điều kiện thông lượng, và phía Zhipu AI cũng chưa phản hồi về phép so sánh này.
Nguồn tham khảo: Reuters, Qz, CocoLoop; nhiều nguồn tin đã đối chiếu đơn giá đầu vào/đầu ra và mức giảm giá của Luna, tỷ lệ giữa chu kỳ thiết kế và chi phí mẫu thử của Jalapeno, cùng nguyên văn phát biểu tiếng Anh của bà Friar.