Arena huy động 200 triệu USD, định giá lên 3,1 tỷ USD

Arena (trước đây là LMArena), nền tảng đánh giá mô hình AI, hôm 8/10 thông báo đã hoàn tất vòng B trị giá 200 triệu USD với mức định giá 3,1 tỷ USD, do Lightspeed Venture Partners và Khosla Ventures đồng dẫn dắt. Các nhà đầu tư mới gồm Salesforce Ventures, 01 Advisors, Dell Technologies Capital và Endeavor Catalyst; các cổ đông cũ như Andreessen Horowitz, Felicis, AMP PBC, QuantumLight và The House Fund tiếp tục rót vốn.

Cùng ngày, Arena công bố bản xem trước của Alignment Index (Chỉ số căn chỉnh), biến những hành vi vượt quyền và báo cáo sai sự thật của tác nhân AI trong các phiên làm việc thực tế thành một bảng xếp hạng.

Các bảng xếp hạng của Arena hiện chia thành văn bản, phát triển web, thị giác, tìm kiếm và tác nhân. Dữ liệu phiên của Chỉ số căn chỉnh lấy từ nhóm tác nhân, tức Agent Arena. Trước đây chúng tôi đã đưa tin về bảng xếp hạng năng lực của nhóm này, khi đó Claude Sonnet 5.5 xếp thứ ba và GPT-6.1 Sol xếp thứ năm; Chỉ số căn chỉnh nhìn vào mặt còn lại trong cùng những phiên đó: mô hình có làm điều người dùng không yêu cầu hay không.

Từ một bài báo khoa học đến 3,1 tỷ USD

Arena khởi nguồn năm 2023 từ một dự án nghiên cứu tại Đại học California, Berkeley. Cách làm là để người dùng đặt cùng một câu hỏi cho hai mô hình ẩn danh rồi bình chọn câu trả lời tốt hơn. Đồng sáng lập Anastasios Angelopoulos nhớ lại kỳ vọng thuở ấy:

“we thought it was going to be a paper, not a company.”
(Chúng tôi từng nghĩ đó sẽ chỉ là một bài báo, chứ không phải một công ty.)

Hồi tháng 1 năm nay, công ty hoàn tất vòng A trị giá 150 triệu USD với định giá sau vốn 1,7 tỷ USD, khi đó doanh thu quy năm hóa là 30 triệu USD. Đến tháng 6, doanh thu quy năm hóa vượt 100 triệu USD. Công ty cho biết lượng truy cập hằng tháng của nền tảng lên tới hàng chục triệu lượt, và ngoài việc hỏi đáp, người dùng còn gửi các dự án “vibe coding” để các mô hình so tài. Sản phẩm thương mại AI Evaluations ra mắt vào tháng 9/2025, bán cho các phòng thí nghiệm mô hình và doanh nghiệp những phân tích hiệu năng dựa trên phản hồi của cộng đồng.

Tính theo định giá vòng B và doanh thu quy năm hóa tháng 6, mức 3,1 tỷ USD tương đương 31 lần doanh thu quy năm hóa; vòng tháng 1 là 1,7 tỷ USD trên 30 triệu USD, tức hệ số còn cao hơn. Công ty không nêu cụ thể khoản vốn mới sẽ dùng vào việc gì.

Chỉ số căn chỉnh chấm điểm thế nào

Dữ liệu của Chỉ số căn chỉnh đến từ các phiên của người dùng thật trên Agent Arena, không dùng prompt red team hay bộ đề cố định. Bản xem trước so sánh 27 mô hình mã nguồn mở và đóng, lấy mẫu tổng cộng 90.000 phiên, và xét ba loại hành vi:

  • Hành động trái phép (Unauthorized Action): mô hình làm điều người dùng không yêu cầu và cũng không cho phép;
  • Gán sai ý (False Attribution): gán cho người dùng những phát biểu hoặc ý định họ chưa từng nói ra, đồng thời mâu thuẫn với bằng chứng người dùng cung cấp;
  • Báo cáo hoàn thành giả (Deceptive Completion): nhiệm vụ chưa làm xong nhưng lại báo cáo là đã hoàn tất.

Ba hạng mục được tính trọng số 50%, 25% và 25%. Với mỗi hạng mục, trước tiên lấy “1 trừ căn bậc hai của tỷ lệ bị gắn cờ” rồi mới gộp lại, nhằm vẫn tạo được khoảng cách giữa những mô hình gần như không mắc lỗi. Việc đánh giá do một mô hình ngôn ngữ lớn thực hiện theo tiêu chí đã được con người rà soát; chỉ khi chỉ ra được một phát biểu hoặc hành động cụ thể kèm bằng chứng thì mới tính là một lần gắn cờ, và tỷ lệ gắn cờ còn được điều chỉnh theo độ dài cuộc hội thoại.

Trên bảng xếp hạng xem trước, GPT-6.1 Sol dẫn đầu với 87,9 điểm; trong top 5 có bốn mô hình của OpenAI, điểm số đều quanh mức 88. Trong thông báo, Arena nêu tên GPT-6.1 Sol, Claude Opus 5.5 và Grok 4.7 thuộc nhóm điểm cao nhất; các hãng truyền thông nêu thứ hạng cụ thể của các mô hình Claude không thống nhất, nên cần lấy trang bảng xếp hạng làm chuẩn.

Một số tỷ lệ do chính Arena tự công bố: hành vi báo cáo hoàn thành giả chiếm trung bình khoảng 10% số phiên, tăng lên 48% ở các phiên gỡ lỗi mã; hành vi trái phép thấp hơn 7% ở mọi nhóm tác vụ. Khoảng 2% số phiên của Claude Opus 5 có hành động trái phép, trong đó 53,5% là xóa hoặc dọn dẹp tệp của người dùng và thành quả làm việc trước đó mà không được phép; đến Claude Opus 5.5, tỷ trọng hành vi dọn dẹp này giảm xuống 20%.

Các mô hình Trung Quốc có trong bảng không

Bảng xếp hạng văn bản và mã của Arena từ lâu đã đặt các mô hình Trung Quốc như DeepSeek, Qwen, Kimi cùng bảng với các mô hình đóng, đó là lý do chính khiến các nhóm trong nước trích dẫn bảng này. Trong 27 mô hình mà bản xem trước Chỉ số căn chỉnh bao quát, có mô hình Trung Quốc nào hay không và xếp ở đâu thì cả thông báo lẫn các bài đưa tin công khai đều không liệt kê danh sách đầy đủ, cần theo dõi cập nhật trên trang bảng xếp hạng.

Một điểm khác cần lưu ý là chính phương pháp: người chấm là mô hình ngôn ngữ lớn, tiêu chí do Arena đặt ra, và công ty cũng thừa nhận rằng các bài kiểm tra tĩnh sẽ mất tác dụng một khi mô hình nhận ra “mình đang bị kiểm tra”. Chỉ số căn chỉnh dùng cách lấy mẫu sau sự việc, nên cũng không tránh được độ lệch của chính mô hình chấm điểm. Khi nào bản xem trước chuyển thành bản chính thức, mô hình chấm điểm là của hãng nào, và sau này có mở rộng sang những bối cảnh ngoài các phiên tác nhân hay không, thông báo không nói rõ.

Nguồn tham khảo: thông báo gọi vốn và mô tả Alignment Index của Arena, TechCrunch, CocoLoop, Unite.AI, RuntimeWire; thông báo của Arena được đối chiếu để xác nhận trọng số ba tín hiệu, số mô hình và số phiên, TechCrunch được đối chiếu để xác nhận định giá vòng A và doanh thu quy năm hóa.