MiniMax Hailuo AI devient le cheval noir chinois de la génération vidéo

MiniMax est une entreprise qui a toujours été discrète dans le cercle de l'IA chinois, mais la capacité de génération vidéo de Hailuo AI a déjà acquis une réputation considérable dans le secteur.

Forme du produit

Hailuo AI est le produit destiné au grand public de MiniMax, couvrant le dialogue textuel, la synthèse vocale et la génération vidéo. La génération vidéo est son point le plus fort.

Les utilisateurs peuvent créer de courtes vidéos à partir de descriptions textuelles, avec des styles couvrant le réaliste, l'animation, l'artistique et bien d'autres. La qualité de génération se situe dans le premier échelon des outils nationaux et, dans certains scénarios, peut rivaliser avec les premières versions de Sora.

Base technologique

Derrière la génération vidéo se trouve le modèle de base multimodal développé en interne par MiniMax. Similaire à Sora, il suit l'approche Modèle de Diffusion (Diffusion) + Modélisation Temporelle.

Les caractéristiques de MiniMax incluent :

  • Compréhension plus précise des scénarios en chinois (les prompts en chinois n'ont pas besoin d'être traduits en anglais avant la génération)
  • Bonne cohérence des personnages (l'apparence du même personnage ne change pas aléatoirement dans la vidéo)
  • Vitesse de génération relativement rapide parmi les produits similaires

Paysage de la course à la génération vidéo

Ce domaine n'a pas encore de vainqueur absolu :

  • Sora (OpenAI) : La plus connue, mais avec un chemin de commercialisation semé d'embûches
  • Kling (Kuaishou) : Probablement la plus utilisée en Chine
  • Runway : Beaucoup utilisée par les créateurs étrangers
  • Hailuo AI : Rattrape rapidement en termes de qualité et d'expérience

La génération vidéo est différente de la génération de texte ; les utilisateurs ont une tolérance plus faible pour les résultats "approximatifs". Un doigt en trop, un objet qui disparaît soudainement, et la vidéo entière est inutilisable. Cela exige une compréhension du monde physique et une cohérence temporelle extrêmement élevées de la part du modèle.

La stratégie de MiniMax est l'avancée multimodale parallèle — le texte, la voix et la vidéo utilisent une architecture de base unifiée, permettant à la compréhension entre différentes modalités de se renforcer mutuellement. Cette approche pourrait être plus avantageuse à long terme que de développer des modèles vidéo isolément.

Source de référence : Page officielle du produit MiniMax, CocoLoop, reportage de 36Kr