
Molmo2 Video Captioner de ahora disponible en WaveSpeedAI
Molmo2-4B Video Captioner: Genera títulos detallados y precisos para videos con niveles de detalle personalizables (bajo, medio, alto). Modelo de visión-lenguaje de código abierto

Presentando Molmo2 Video Content Moderator en WaveSpeedAI
Molmo2-4B Video Content Moderator analiza contenido de video para seguridad, adecuación y cumplimiento de políticas. Detecta violencia, desnudez, gore y otros contenidos dañinos

Molmo2 Video QA de ahora disponible en WaveSpeedAI
Molmo2-4B Video QA: Responde preguntas sobre contenido de video con comprensión temporal. Modelo de visión-lenguaje de código abierto. API REST lista para usar, sin inicios en frío.

Presentamos Molmo2 Video Understanding en WaveSpeedAI
Molmo2-4B Video Understanding: Analiza videos con tareas especializadas (general, resumen, análisis, conteo, descripción de escenas). Modelo de visión-lenguaje de código abierto

Presentando OpenAI Whisper Con Video en WaveSpeedAI
OpenAI Whisper Large v3 (Video-to-Text) ofrece transcripción multilingüe de alta precisión directamente desde archivos de video, con detección automática de idioma y opciones

Presentando Paddle Ocr en WaveSpeedAI
PaddleOCR-VL es un modelo visión-lenguaje ultracompacto de 0,9B parámetros para análisis de documentos, compatible con 109 idiomas e incluyendo reconocimiento de texto, tablas, fórmulas y gráficos

Presentamos Qwen Image 2512 LoRA Trainer en WaveSpeedAI
Qwen-Image-2512 LoRA Trainer te permite entrenar modelos LoRA personalizados 10 veces más rápido con entrenamiento de estilos, personajes y objetos. Del concepto al modelo en minutos, no en horas

Presentando Qwen Image Text-to-Image 2512 LoRA en WaveSpeedAI
Qwen-Image-2512 LoRA es un modelo MMDiT mejorado de 20B text-to-image con soporte LoRA para personalización rápida y generación de imágenes refinada. REST infer listo para usar

Presentando Video Background Remover en WaveSpeedAI
WaveSpeed Video Background Remover reemplaza o elimina fondos de video con una imagen personalizada. Carga o pega un enlace a tu video, luego proporciona una imagen de fondo

Presentando Z Image Turbo Controlnet en WaveSpeedAI
Z-Image-Turbo ControlNet genera imágenes guiadas por señales de control estructural (profundidad, canny edge, pose) para un control de composición preciso. Inferencia REST lista para usar

Presentamos xAI Grok 2 Image en WaveSpeedAI
Grok 2 Image es el último modelo de generación de imágenes de xAI que convierte simples indicaciones de texto en imágenes fotorrealistas y nítidas en segundos. Desde fotos de productos hasta redes sociales

Presentando Z AI Glm Image Edit en WaveSpeedAI
GLM-Image Edit es un potente modelo de edición de imagen a imagen que transforma imágenes basándose en indicaciones de texto. API REST de inferencia lista para usar, mejor rendimiento, sin co