Từ ngày 12 tháng 9, nhiều người dùng lần lượt phát hiện góc trên bên phải của DeepSeek App xuất hiện thêm một nút loa nhỏ, bấm vào là vào trò chuyện bằng giọng nói. Những tài khoản được cấp quyền thử nghiệm còn thấy mục "giọng đọc" mới xuất hiện trong phần cài đặt giọng nói.
Có bốn giọng đọc, tên và mô tả đều ngắn gọn: Vỏ Sò (biến hóa, vui tươi), Sóng Bạc (rõ ràng, dứt khoát), Sao Biển (tinh nghịch, ngọt ngào), Sóng Ngầm (trầm, dày). Cả bốn cái tên đều lấy từ biển.
Đợt cập nhật này không có thông báo chính thức, tin tức đến từ phản hồi của người dùng. Tỷ lệ thử nghiệm diện hẹp, các dòng máy được phủ sóng, thời điểm mở rộng toàn bộ — DeepSeek hiện chưa có giải thích nào.
Hai việc cách nhau hai ngày
Lùi lại hai ngày, ngày 10 tháng 9 DeepSeek đã phát hành V4.1 Flash, phiên bản nhỏ gọn nhất trong dòng kiến trúc mô hình mới, có khả năng hiểu thị giác đa phương thức gốc. Lần đó đi theo quy trình phát hành chính thức, có thông báo, có tài liệu kỹ thuật.
Hai việc xảy ra sát nhau nhưng cách làm hoàn toàn khác. Phía mô hình công khai, có tài liệu, có thể kiểm chứng lại; phía ứng dụng thì âm thầm đẩy ra, không tuyên bố, để người dùng tự phát hiện. Đây là cách DeepSeek vẫn thường phân chia: mô hình là thứ cần nói ra, sản phẩm là thứ làm trước đã.
Xét về hình thái tính năng, lần này ra mắt là combo đọc văn bản và trò chuyện, vẫn còn khoảng cách so với trò chuyện giọng nói thời gian thực đang phổ biến hiện nay. Cách gọi "giọng đọc" tự nó đã chỉ về chuyển văn bản thành giọng nói, tức là mô hình viết xong rồi mới đọc, khác với kiểu tương tác song công hoàn toàn — ngắt lời, chen ngang, vừa nghe vừa nghĩ. Có chế độ giọng nói đầy đủ hơn đang xếp hàng phía sau hay không, hiện chưa thấy dấu hiệu.
Vài khác biệt thực tế với người dùng trong nước
Thứ nhất là có dùng được hay không. Trong giai đoạn thử nghiệm diện hẹp, cách duy nhất để biết là mở App xem góc trên bên phải có nút loa hay không. Không có nghĩa là chưa tới lượt, cài lại hay đổi tài khoản cũng không giải quyết được. Cách triển khai này khá phổ biến ở các App trong nước, ưu điểm là nếu có lỗi thì phạm vi ảnh hưởng nhỏ, cái giá phải trả là người dùng không có bất kỳ mốc thời gian dự kiến nào.
Thứ hai là vị trí so với các đối thủ. Vài App AI chủ lực trong nước đã có tính năng giọng nói sớm hơn nhiều, Doubao, Tongyi, Yuanbao, Kimi đều đã chạy được một thời gian, trong đó vài cái còn làm được ngắt lời thời gian thực. DeepSeek bổ sung mảng này là đang lấp một khoảng trống về độ hoàn thiện sản phẩm.
Thứ ba là sự thay đổi trong kịch bản sử dụng. Cơ cấu người dùng của DeepSeek nghiêng về văn bản dài, code và các tác vụ suy luận, những kịch bản này vốn dĩ lợi ích của giọng nói không cao, đọc code chẳng có ý nghĩa gì, đọc quá trình suy luận dài còn mệt hơn. Giọng nói ở đây nhiều khả năng rơi vào hai tình huống: nghe kết quả lúc đi làm hoặc làm việc nhà, và nói ra câu hỏi khi bất tiện gõ chữ. Thiết kế bốn giọng đọc cũng giống như điều chỉnh sở thích nghe hơn là thay thế kiểu tương tác.
Thứ tư là một thông tin mà đợt cập nhật này để lộ ra. Nhịp độ cập nhật sản phẩm của DeepSeek trước nay chậm hơn các đối thủ, mảng App trong thời gian dài chỉ giữ khung chat cơ bản nhất. Giọng nói vào diện hẹp, cộng thêm khả năng hiểu thị giác gốc của V4.1 Flash, gộp hai đường lại thì thấy bảng năng lực của App đang trải dần sang phía đa phương thức. Trải tới mức nào, có tiến tới tương tác thời gian thực hay không, phía chính thức chưa đưa ra bất kỳ định hướng nào.
Với người dùng đang muốn dùng ngay tính năng giọng nói, lời khuyên thực tế chỉ có một: chờ. Thử nghiệm diện hẹp không có kênh đăng ký, cũng không có quy tắc xếp hàng công khai.
Nguồn tham khảo: IT Home, Sina Tech, CocoLoop, trang cài đặt DeepSeek App; đã kiểm chứng tên và mô tả bốn giọng đọc, ngày bắt đầu thử nghiệm diện hẹp và mốc phát hành V4.1 Flash.