LTX 2.3 GGUF: Flujo de Trabajo Local de Audio y Video

Planifica un flujo de trabajo local de LTX 2.3 GGUF con ComfyUI-GGUF, Hugging Face y modelos cuantizados de la comunidad, mientras gestionas el soporte y el riesgo de licencia.

By Dora 12 min read

He recibido el mismo mensaje privado dos veces por semana: “¿Dónde descargo LTX 2.3 GGUF?” La gente busca, encuentra dos páginas de la comunidad en Hugging Face y luego se detiene — ninguna es de Lightricks. Esa vacilación es correcta. Ambas páginas son reales, la comunidad las ha mantenido activamente, pero el soporte, las licencias y la cadencia de actualizaciones no son iguales a las de una versión oficial.

LTX 2.3 GGUF es un conjunto de cuantizaciones comunitarias del modelo de audio y video LTX-2.3 de Lightricks. Los pesos originales son abiertos pero de precisión completa. Las versiones GGUF están reempaquetadas para inferencia local con menor VRAM. Este artículo documenta de dónde provienen los archivos, cómo ejecutarlos en ComfyUI o mediante un lanzador local, y en qué punto dejaría de depender de la inferencia local para cambiar a la ejecución alojada.

De dónde viene LTX 2.3 GGUF

El panorama de cuantizaciones comunitarias se redujo a dos mantenedores principales a principios de 2026. Ambos publican en la misma plataforma, ambos siguen el mismo origen — los checkpoints LTX-2.3 de Lightricks — pero adoptan enfoques ligeramente diferentes.

Cuantización comunitaria: QuantStack y Unsloth

La página de Hugging Face LTX-2.3-GGUF de QuantStack es una conversión directa de los pesos originales. Incluye variantes Q2_K hasta Q8_0 de las versiones destilada y completa de 22B. Simple. Si quieres el archivo viable más pequeño, aquí es donde vas.

La página LTX-2.3-GGUF de Unsloth utiliza lo que denominan metodología Dynamic 2.0 — las capas importantes se mantienen en mayor precisión, el resto se cuantiza agresivamente. El repositorio incluye conjuntos dev y distilado, además de sus propios archivos de flujo de trabajo de ejemplo. La tarjeta del modelo menciona las herramientas ComfyUI-GGUF de city96, que es el mismo paquete de nodos que necesitarás de cualquier manera.

No he ejecutado una comparación lado a lado lo suficientemente larga como para publicar números sobre cuál produce mejores resultados en un nivel de cuantización dado. Ese es un proyecto diferente.

Pesos oficiales de Lightricks vs. compilaciones GGUF comunitarias

Lightricks publica los pesos originales de LTX-2.3 — safetensors de precisión completa, pipelines de inferencia oficiales, nodos oficiales de ComfyUI (el paquete ComfyUI-LTXVideo, separado de GGUF). También publican extensiones de control de cámara como LTX Director que dependen del formato de pesos original. Esas funciones no funcionan o funcionan de forma imperfecta con las compilaciones GGUF. Eso es una pérdida real, dependiendo de lo que estés haciendo.

Las versiones GGUF intercambian paridad de funciones con el original por mayor margen de VRAM. Ese es todo el trato. Si necesitas todas las funciones que Lightricks lanza, usa los pesos completos. Si tu máquina no puede, GGUF es el intercambio.

Por qué el estado de lanzamiento no oficial importa para el soporte y la revisión de licencias

Lo que los resultados de búsqueda no dicen claramente: QuantStack y Unsloth son colaboradores de la comunidad. No son Lightricks. Si algo falla, estás reportando un problema en un repositorio comunitario, no obteniendo soporte del proveedor. La licencia en ambas páginas comunitarias es ltx-2-community-license-agreement — las mismas restricciones sobre uso comercial que se aplican a los pesos originales también se aplican a las versiones cuantizadas. La cuantización no elimina las licencias.

Vale la pena detenerse en esto. Trata la revisión de licencias como un paso real, no como una casilla que marcar.

Rutas de configuración local para desarrolladores

Hay aproximadamente tres formas de ejecutar estas compilaciones GGUF localmente. No son equivalentes. Son para audiencias diferentes.

Acceso a modelos en Hugging Face

Los archivos de QuantStack y Unsloth viven en Hugging Face. Puedes obtenerlos con git lfs clone o mediante huggingface-cli download. Si solo quieres el archivo viable más pequeño, toma una de las variantes de rango medio — los nombres siguen las convenciones estándar de llama.cpp (Q3_K_M, Q4_K_S, Q4_K_M, etc.). Elige uno, descárgalo y sigue adelante.

Lo que la plataforma no te da es un entorno de ejecución. Solo los archivos.

ComfyUI + nodo ComfyUI-GGUF de city96

Este es el camino que veo que la mayoría de la gente termina siguiendo. El paquete de nodos en el repositorio ComfyUI-GGUF de city96 extiende ComfyUI para cargar modelos UNet GGUF. Instálalo en ComfyUI/custom_nodes, coloca el archivo GGUF en ComfyUI/models/unet, reinicia ComfyUI y el cargador GGUF Unet aparece en la categoría bootleg. Desde ahí lo conectas a un flujo de trabajo de generación de video de la misma manera que conectarías un UNet normal.

Vale la pena señalar: el nodo de city96 fue escrito antes de que LTX-2 existiera. Maneja la carga GGUF de forma genérica. Si un archivo LTX-2.3 GGUF específico funciona de extremo a extremo depende del flujo de trabajo y de los archivos de codificador de texto y VAE que espera junto al modelo principal. Ambas páginas comunitarias publican flujos de trabajo de ejemplo por esta razón — comienza desde los suyos.

Pinokio o flujo de trabajo de lanzador local como ruta secundaria

El lanzador de código abierto de Pinokio empaqueta aplicaciones de IA con instalación con un clic, gestionando entornos Python, dependencias y descargas de modelos detrás de una interfaz gráfica. No es un reemplazo de ComfyUI. Es una forma de omitir la configuración manual si ya existe un script para tu aplicación objetivo en su directorio.

Para estos modelos cuantizados específicamente, el valor de Pinokio depende de si hay un script mantenido que apunte a la versión actual. Verifica antes de asumir. Si ya estás en ComfyUI, el lanzador no añade mucho. Si estás empezando desde cero en una máquina Windows sin configuración de Python, elimina horas de dolor.

Cómo evaluar variantes GGUF

Elegir un nivel de cuantización no es simplemente “más pequeño = menor calidad”. Las compensaciones no son lineales y cambian según el modelo.

Opciones de cuantización como Q4KM y variantes similares

Q4_K_M es un punto de partida común porque se ubica en el medio del rango estándar de llama.cpp — lo suficientemente pequeño para caber en GPUs de consumo, lo suficientemente grande para preservar la mayor parte del comportamiento original. Las variantes Q3 te llevan a envelopes de VRAM más pequeños, pero la caída de calidad se vuelve visible en los detalles finos. Q8 conserva más del original, pero el archivo se vuelve tan grande que has anulado en parte el objetivo de ejecutar GGUF localmente.

Por defecto uso Q4_K_M para las primeras ejecuciones. Si los resultados parecen aceptables, me quedo. Si no, subo antes de bajar.

Registro de prompts, semillas y salidas

Las ejecuciones de prueba sin control de semilla no son pruebas. Son conjeturas. Fija la semilla, escribe el prompt en un archivo, guarda el nombre del archivo de salida con ambos. Cuando cambies niveles de cuantización o flujos de trabajo, querrás comparar como con como, y “creo que la versión Q4 se veía peor” no ayuda si no puedes reproducir la comparación.

Mantengo un CSV plano: prompt, semilla, nivel de cuantización, archivo de flujo de trabajo, ruta de salida, juicio de una línea. Aburrido. Efectivo.

Verificaciones de sincronización audio-video

LTX-2 genera audio y video sincronizados en un solo modelo — esa es la función principal. La sincronización es lo que la cuantización GGUF tiene más probabilidades de degradar sutilmente, porque la cuantización afecta todas las capas, incluidas las que manejan la alineación audiovisual. Observa las salidas de principio a fin, no solo los primeros 1-2 segundos. El desajuste del movimiento de labios respecto a la pista de audio por una fracción de segundo es el modo de fallo que he visto con más frecuencia.

Aquí es donde terminan mis datos. No he realizado mediciones controladas de deriva, y desconfiaría de cualquiera que las publique sin mostrar la metodología.

Evita declaraciones de hardware codificadas sin contexto de prueba

Verás hilos de Reddit que afirman “Q4_K_M funciona a X tokens/seg en una 3090” o “12GB de VRAM son suficientes”. No los tomes como portables. Son un único punto de datos en un único flujo de trabajo con tamaños de lote, resoluciones y recuentos de fotogramas no declarados. Prueba en tu hardware, con tu flujo de trabajo, y anota lo que mediste.

Compensaciones de producción de la inferencia local

Ejecutar estos modelos localmente está bien para la experimentación. La pregunta es si escala a producción. La respuesta es: a veces.

Control local y privacidad

El argumento a favor de lo local es real. Los prompts permanecen en tu máquina. Las salidas permanecen en tu máquina. Sin telemetría de uso, sin límites de velocidad, sin sorpresas en la facturación mensual. Para flujos de trabajo que involucran material sensible de clientes o propiedad intelectual antes de su lanzamiento, eso no es una consideración menor.

Riesgo de mantenimiento, controladores y dependencias

El argumento en contra de lo local también es real, y aparece más tarde. Las actualizaciones de ComfyUI pueden romper la compatibilidad de los nodos personalizados. Las actualizaciones de controladores CUDA pueden romper PyTorch. Una actualización de Windows puede mover rutas de archivos. La pila local que funcionó el martes puede que no funcione el viernes. Eso no es un problema de calidad del software — es el costo de ejecutar una pila de grado investigación fuera de un entorno gestionado.

Para trabajo individual esto es molesto. Para producción en equipo se convierte en un trabajo a tiempo parcial que nadie pidió.

Cuándo la inferencia alojada es más segura

Hay un umbral de uso por encima del cual ejecutar LTX-2.3 — cuantizado o no — en tu propio hardware deja de tener sentido. Las señales: estás generando varios videos por día, necesitas salida consistente entre miembros del equipo en diferentes máquinas, o necesitas rendimiento que no dependa de si la actualización de controladores de la noche anterior rompió ComfyUI. Pasado ese punto, la inferencia alojada — donde alguien más gestiona la GPU, los archivos del modelo y la pila de dependencias — generalmente gana.

Lo alojado tiene sus propias compensaciones: los datos salen de tu máquina, el costo por generación se mide, la elección del modelo es lo que el proveedor soporta. Pero la carga de mantenimiento llega a cero, lo que para los equipos de producción suele ser el intercambio correcto.

Búsquedas GGUF adyacentes que conviene manejar con cuidado

Si has estado buscando LTX 2.3 GGUF, probablemente también hayas visto aparecer Sulphur 2 GGUF en los mismos resultados. No son la misma cosa.

Por qué Sulphur 2 GGUF es probablemente una intención separada

Sulphur 2 GGUF es un ajuste fino comunitario de LTX-2.3 distribuido a través de Civitai en lugar de los mantenedores anteriores, orientado a contenido NSFW con su propia dependencia de nodo personalizado (smthemex/ComfyUI_LTX2_SM, no el paquete de city96). Modelo diferente, flujo de trabajo diferente, audiencia diferente. Si llegaste aquí buscando eso, estás en el artículo equivocado.

Cuándo dividir la comparación GGUF en otro artículo

Escribiría Sulphur 2 GGUF por separado. La audiencia, la revisión de licencias y la configuración del entorno de ejecución son lo suficientemente diferentes como para que mezclar la comparación diluiría ambas piezas. Pendiente de verificación — no lo he probado personalmente, y cualquier artículo futuro comenzaría con esa advertencia.

Preguntas frecuentes

¿Es LTX 2.3 GGUF una versión oficial de Lightricks?

No. El término se refiere a cuantizaciones mantenidas por la comunidad publicadas por QuantStack y Unsloth en Hugging Face. Son conversiones directas de los pesos LTX-2.3 originales de Lightricks, pero Lightricks en sí solo publica checkpoints de precisión completa. Consulta la documentación oficial de Lightricks para conocer el estado actual de cualquier versión GGUF directa.

¿Cómo ejecuto LTX 2.3 GGUF en ComfyUI?

Instala el nodo ComfyUI-GGUF de city96 en ComfyUI/custom_nodes, coloca el archivo GGUF en ComfyUI/models/unet, reinicia ComfyUI y usa el cargador GGUF Unet en la categoría bootleg. También necesitarás el codificador de texto y los archivos VAE correspondientes referenciados en el flujo de trabajo comunitario que estés siguiendo. Las páginas de Unsloth y QuantStack incluyen flujos de trabajo de ejemplo desde los que vale la pena comenzar.

¿Cuáles son los riesgos de usar modelos cuantizados por la comunidad?

Tres principales. Sin soporte del proveedor si algo falla — estás en los rastreadores de problemas de la comunidad. La revisión de licencias sigue siendo tu responsabilidad: la licencia comunitaria LTX-2 sigue aplicando, y los términos oficiales de licencia están publicados en el repositorio LTX-2 de Lightricks. Y brechas de funciones respecto a los pesos oficiales — extensiones como LTX Director o nuevas actualizaciones oficiales de pipeline pueden no funcionar correctamente con las compilaciones GGUF. Consulta la documentación más reciente de Lightricks para conocer el estado actual de la paridad de funciones oficial.

¿Debo usar Pinokio, Hugging Face, ComfyUI o inferencia alojada?

Depende de lo que estés haciendo. Pinokio para omitir la configuración si existe un script para tu aplicación objetivo. Hugging Face para obtener archivos directamente. ComfyUI con el nodo GGUF de city96 para ejecutar y ajustar flujos de trabajo. Inferencia alojada cuando la sobrecarga de mantenimiento local supera el valor de mantener la ejecución en tu propia máquina. El límite suele ser si estás entregando salidas a alguien más que tú mismo.

Artículos anteriores: