#model-release
306 articles - Page 21

Présentation de Google Gemini 2.5 Flash Image Text-to-Image sur WaveSpeedAI
Google Gemini 2.5 Flash Image offre une génération de texte à image avancée et l'édition d'images avec des contrôles créatifs pour des images de qualité. API d'inférence REST prête à l'emploi, meilleures performances, pas de démarrages à froid, prix abordables.

Présentation de Kuaishou Kling LipSync Audio To Video sur WaveSpeedAI
Kling LipSync convertit l'audio en vidéo de tête parlante en générant des mouvements de lèvres réalistes parfaitement synchronisés avec l'audio d'entrée. API d'inférence REST prête à l'emploi, performances optimales, pas de démarrages à froid, tarification abordable.

Présentation de Luma Ray 2 Flash T2V sur WaveSpeedAI
Luma Ray 2 Flash transforme le texte en vidéos de haute qualité avec des tailles flexibles et une optimisation intégrée des invites pour des résultats précis. API d'inférence REST prête à l'emploi, meilleures performances, sans démarrages à froid, tarification abordable.

Présentation de Luma Ray 2 T2V sur WaveSpeedAI
Luma Ray 2 est un modèle Text-to-Video qui crée des vidéos de haute qualité à partir de prompts textuels, avec optimisation avancée des prompts et support de diverses résolutions vidéo. API d'inférence REST prête à l'emploi, meilleures performances, sans démarrages à froid, tarification abordable.

Présentation de Steady Dancer sur WaveSpeedAI
SteadyDancer est un framework d'animation d'images humaines avec 14 milliards de paramètres qui transforme les images statiques en vidéos de danse cohérentes. Offre la préservation de la première image, une cohérence d'identité robuste et une cohérence temporelle pour une génération de mouvements réaliste. API d'inférence REST prête à l'emploi, meilleures performances, sans démarrage

Présentation de MiniMax Speech 2.5 Hd Preview sur WaveSpeedAI
MiniMax Speech 2.5 HD Preview offre une synthèse vocale HD avec expressivité multilingue améliorée, clonage vocal précis et support de 40 langues. API REST prête à l'emploi, meilleures performances, pas de démarrages à froid, tarification abordable.

Présentation de MiniMax Speech 2.6 Hd sur WaveSpeedAI
MiniMax Speech 2.6 HD : TTS ultra-humain, à très faible latence (< 250ms) avec clonage vocal, normalisation de texte et support de plus de 40 langues. API d'inférence REST prête à l'emploi, meilleures performances, pas de démarrages à froid, tarification abordable.

Présentation de MiniMax Speech 2.6 Turbo sur WaveSpeedAI
MiniMax Speech 2.6 Turbo est un modèle Text-to-Speech offrant un clonage vocal ultra-humain, une normalisation de texte de pointe, une latence inférieure à 250 ms et un support de plus de 40 langues. Tarification : 0,06 $ pour 1000 caractères. API d'inférence REST prête à l'emploi, meilleures performances, pas de démarrages à froid, tarification abordable.

Présentation de Clarity AI Crystal Upscaler sur WaveSpeedAI
Clarity AI Crystal Upscaler améliore la résolution des images avec l'upscaling IA et les détails ajustables pour les portraits et les paysages. API d'inférence REST prête à l'emploi, meilleures performances, pas de démarrages à froid, tarification abordable.

Présentation de MiniMax Speech 2.5 Turbo Preview sur WaveSpeedAI
MiniMax Speech 2.5 Turbo Preview : TTS HD avec support multilingue, réplication vocale précise dans 40 langues. 0,04 $/1000 caractères. API d'inférence REST prête à l'emploi, meilleures performances, pas de démarrages à froid, tarification abordable.

Présentation de OpenAI Whisper sur WaveSpeedAI
Whisper Large v3 speech-to-text : transcriptions multilingues instantanées et précises avec détection automatique de la langue et ponctuation. Téléchargez l'audio pour obtenir les transcriptions. API REST prête à l'emploi, sans démarrages à froid, tarification abordable.

Présentation de la génération d'images à partir de texte OpenAI GPT Image 1.5 sur WaveSpeedAI
GPT Image 1.5 text to image est le générateur d'images à partir de texte rapide et économique d'OpenAI, alimenté par la guidance GPT-5. Créez des photos photorréalistes, des rendus de produits, des concept arts et des graphiques stylisés à partir d'invites en langage naturel (optionnellement conditionnés par une image). Supporte les rapports d'aspect personnalisés, seed