Mistral phát hành mô hình giọng nói 4B mã nguồn mở, đánh giá vượt ElevenLabs

Ngày 26 tháng 3, Mistral đã phát hành Voxtral TTS, mô hình giọng nói đầu tiên của họ.

Với 4B tham số, trọng số mở, độ tự nhiên trong đánh giá thủ công vượt qua ElevenLabs Flash v2.5, giá API 0,016 USD/1.000 ký tự và có thể chạy trực tiếp trên máy chủ của riêng bạn – đây là những điểm bán hàng cốt lõi của sản phẩm này.

Kiến trúc của 4B tham số

Kiến trúc của Voxtral TTS bao gồm ba mô-đun:

Thành phần Số tham số Chức năng
Xương sống bộ giải mã biến áp 3,4B Dựa trên Ministral 3B, xử lý hiểu ngôn ngữ và xử lý văn bản
Bộ biến đổi âm thanh 390M Kiến trúc flow-matching, xử lý tạo đặc trưng âm thanh
Bộ mã hóa-giải mã âm thanh thần kinh 300M Thiết kế mã hóa-giải mã đối xứng, nén và khôi phục âm thanh

Dữ liệu độ trễ: Với 500 ký tự văn bản và 10 giây âm thanh tham chiếu, khung âm thanh đầu tiên xuất hiện trong vòng 70 mili giây. Hệ số thời gian thực khoảng 9,7x, nghĩa là tạo 1 giây giọng nói chỉ cần khoảng 0,1 giây tính toán.

So sánh với ElevenLabs ở mức nào

Theo tuyên bố trong thông báo phát hành của Mistral: Đánh giá thủ công cho thấy độ tự nhiên của giọng nói Voxtral TTS vượt quá ElevenLabs Flash v2.5 và ngang bằng với chất lượng ElevenLabs v3.

ElevenLabs hiện là người chơi hàng đầu trong lĩnh vực AI giọng nói, v3 là sản phẩm hàng đầu của họ. Vị thế "ngang bằng hàng đầu, vượt qua thứ hạng" này, đặt trên một mô hình trọng số mở 4B, là một tuyên bố khá táo bạo.

Về nhân bản giọng nói, 3 giây âm thanh tham chiếu là đủ. Nó không chỉ đơn giản sao chép âm sắc mà còn có thể nắm bắt giọng điệu, ngữ điệu lên xuống, thói quen ngắt nghỉ và thậm chí cả nhịp điệu của các thói quen ngôn ngữ như "uh" và "um". Ngoài ra, nó hỗ trợ chuyển đổi đa ngôn ngữ zero-shot – cùng một cấu hình giọng nói, chuyển đổi ngôn ngữ để đọc, giọng nói về mặt lý thuyết có thể nhất quán.

Ngôn ngữ được hỗ trợ

Tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Tây Ban Nha, tiếng Hà Lan, tiếng Bồ Đào Nha, tiếng Ý, tiếng Hindi, tiếng Ả Rập, tổng cộng 9 ngôn ngữ.

Tiếng Trung không có trong danh sách – đối với người dùng Trung Quốc, đây là một thiếu sót lớn và ở giai đoạn hiện tại, có thể bỏ qua sản phẩm này.

Cần làm rõ mức độ mở

Có một chi tiết đáng chú ý ở đây: Giao thức trọng số của Voxtral TTS là CC BY NC 4.0, không phải Apache 2.0.

"NC" là viết tắt của Non-Commercial – mục đích phi thương mại có thể tự do tải xuống, sửa đổi và phân phối, mục đích thương mại cần sử dụng API. Nếu bạn đang làm nghiên cứu học thuật, dự án cá nhân hoặc trình diễn nội dung, hãy trực tiếp tải trọng số từ Hugging Face, không có giới hạn hạn mức. Nếu bạn muốn tích hợp vào sản phẩm thương mại, hãy sử dụng API: 0,016 USD/1.000 ký tự.

Tham khảo giá đối thủ cạnh tranh: ElevenLabs Flash v2.5 khoảng 0,066 USD/1.000 ký tự, API của Voxtral khoảng một phần tư giá đó, lợi thế về giá khá rõ ràng.

Ai sẽ bị ảnh hưởng bởi sản phẩm này

Bối cảnh AI giọng nói đã thay đổi đáng kể trong hai năm qua. ElevenLabs gần như là lựa chọn mặc định trước đây, sau đó Deepgram, OpenAI và Microsoft lần lượt bổ sung khả năng TTS, và các sản phẩm giọng nói của ByteDance cũng cạnh tranh trong nước. Mistral tham gia với chiến lược "trọng số mở + API giá rẻ" – giống hệt chiến lược của họ với các mô hình ngôn ngữ.

Voice agent, sản xuất podcast, học ngôn ngữ và hệ thống dịch vụ khách hàng là những kịch bản triển khai chính cho TTS. Đối với các doanh nghiệp muốn kiểm soát chi phí và không muốn dữ liệu rời khỏi quốc gia, tùy chọn tự triển khai thực sự hấp dẫn – ngay cả khi bạn muốn sử dụng thương mại, trước tiên bạn có thể sử dụng trọng số mở để thử nghiệm, xác nhận hiệu quả và sau đó chuyển sang API.

Nhưng nhắc lại: Tiếng Trung không được hỗ trợ. Đối tượng chính của sản phẩm này hiện tại là các nhóm ở châu Âu, Nam Á hoặc các nhóm đa ngôn ngữ ra nước ngoài, và có rất ít kịch bản sử dụng trực tiếp trong nước.

Nguồn tham khảo: Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat); Mistral releases a new open source model for speech generation (TechCrunch); CocoLoop; Speaking of Voxtral (Blog chính thức của Mistral AI)