<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Generación De Video on SoloSoft</title><link>https://www.solosoft.dev/es/tags/generaci%C3%B3n-de-video/</link><description>Recent content in Generación De Video on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/generaci%C3%B3n-de-video/index.xml" rel="self" type="application/rss+xml"/><item><title>LTX-2: Modelo Fundamental de Audio-Video 4K de Código Abierto de Lightricks</title><link>https://www.solosoft.dev/es/post/ltx2-video-generation-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/ltx2-video-generation-2026/</guid><description>&lt;p&gt;&lt;strong&gt;LTX-2&lt;/strong&gt; es el primer modelo fundamental de audio-video basado en &lt;strong&gt;Diffusion Transformer (DiT)&lt;/strong&gt; de código abierto, capaz de generar contenido de audio-video 4K sincronizado a hasta 50 fotogramas por segundo.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Repositorio&lt;/strong&gt;: &lt;a href="https://github.com/Lightricks/LTX-2"&gt;github.com/Lightricks/LTX-2&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="arquitectura"&gt;Arquitectura&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Característica&lt;/th&gt;
 &lt;th&gt;LTX-2 (DiT)&lt;/th&gt;
 &lt;th&gt;Modelos U-Net Tradicionales&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Sincronización Audio-Video&lt;/td&gt;
 &lt;td&gt;Generación conjunta nativa&lt;/td&gt;
 &lt;td&gt;Pipelines separados&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Escalado de Resolución&lt;/td&gt;
 &lt;td&gt;Escala a 4K&lt;/td&gt;
 &lt;td&gt;Típicamente limitado a 1080p&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Fotogramas por segundo&lt;/td&gt;
 &lt;td&gt;Hasta 50fps&lt;/td&gt;
 &lt;td&gt;Típicamente 24-30fps&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Coherencia Temporal&lt;/td&gt;
 &lt;td&gt;Atención Transformer entre fotogramas&lt;/td&gt;
 &lt;td&gt;Capas temporales añadidas&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;GPU de consumo&lt;/td&gt;
 &lt;td&gt;Sí (16-24 GB VRAM)&lt;/td&gt;
 &lt;td&gt;Varía ampliamente&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;graph TD
 subgraph &amp;#34;Arquitectura LTX-2&amp;#34;
 A[Entrada: Texto / Imagen / Video / Audio] --&amp;gt; B[Codificador Espaciotemporal]
 B --&amp;gt; C[Backbone DiT]
 C --&amp;gt; D[Decodificador de Video]
 C --&amp;gt; E[Decodificador de Audio]
 D --&amp;gt; F[Salida: Video 4K hasta 50fps]
 E --&amp;gt; G[Salida: Audio Sincronizado]
 end&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;graph TD
 subgraph "Arquitectura LTX-2"
 A[Entrada: Texto / Imagen / Video / Audio] --&gt; B[Codificador Espaciotemporal]
 B --&gt; C[Backbone DiT]
 C --&gt; D[Decodificador de Video]
 C --&gt; E[Decodificador de Audio]
 D --&gt; F[Salida: Video 4K hasta 50fps]
 E --&gt; G[Salida: Audio Sincronizado]
 end&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;h2 id="pipelines-soportados"&gt;Pipelines Soportados&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Pipeline&lt;/th&gt;
 &lt;th&gt;Entrada&lt;/th&gt;
 &lt;th&gt;Resolución&lt;/th&gt;
 &lt;th&gt;Tiempo de Generación (24 GB)&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Texto a Video&lt;/td&gt;
 &lt;td&gt;Prompt de texto&lt;/td&gt;
 &lt;td&gt;Hasta 4K&lt;/td&gt;
 &lt;td&gt;2-5 minutos&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Imagen a Video&lt;/td&gt;
 &lt;td&gt;Imagen + texto opcional&lt;/td&gt;
 &lt;td&gt;Hasta 4K&lt;/td&gt;
 &lt;td&gt;1-4 minutos&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Video a Video&lt;/td&gt;
 &lt;td&gt;Video + prompt de estilo&lt;/td&gt;
 &lt;td&gt;Hasta 4K&lt;/td&gt;
 &lt;td&gt;3-8 minutos&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Audio a Video&lt;/td&gt;
 &lt;td&gt;Pista de audio + texto&lt;/td&gt;
 &lt;td&gt;Hasta 1080p&lt;/td&gt;
 &lt;td&gt;2-6 minutos&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="requisitos-de-hardware"&gt;Requisitos de Hardware&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Calidad&lt;/th&gt;
 &lt;th&gt;VRAM Mínima&lt;/th&gt;
 &lt;th&gt;VRAM Recomendada&lt;/th&gt;
 &lt;th&gt;Ejemplos de GPU&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;480p&lt;/td&gt;
 &lt;td&gt;8 GB&lt;/td&gt;
 &lt;td&gt;12 GB&lt;/td&gt;
 &lt;td&gt;RTX 3060, RTX 4060&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;1080p&lt;/td&gt;
 &lt;td&gt;12 GB&lt;/td&gt;
 &lt;td&gt;16 GB&lt;/td&gt;
 &lt;td&gt;RTX 4070 Ti, RTX 4080&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;4K&lt;/td&gt;
 &lt;td&gt;16 GB&lt;/td&gt;
 &lt;td&gt;24 GB&lt;/td&gt;
 &lt;td&gt;RTX 4090, RTX 5090&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="comparación"&gt;Comparación&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Modelo&lt;/th&gt;
 &lt;th&gt;Código Abierto&lt;/th&gt;
 &lt;th&gt;Resolución Máx&lt;/th&gt;
 &lt;th&gt;Sincronización Audio&lt;/th&gt;
 &lt;th&gt;GPU Consumo&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;LTX-2 (Lightricks)&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;4K&lt;/td&gt;
 &lt;td&gt;Nativa&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Stable Video Diffusion&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;1080p&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Open-Sora&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;1080p&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Limitada&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;CogVideo&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;td&gt;720p&lt;/td&gt;
 &lt;td&gt;No&lt;/td&gt;
 &lt;td&gt;Sí&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="faq"&gt;FAQ&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;Qué es LTX-2?&lt;/strong&gt; Modelo fundamental de audio-video DiT de código abierto que genera video y audio 4K sincronizados a 50fps.&lt;/p&gt;</description></item><item><title>StoryDiffusion: Autoatención Consistente para Generación de Imágenes y Video de Largo Alcance</title><link>https://www.solosoft.dev/es/post/storydiffusion-image-video-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/storydiffusion-image-video-2026/</guid><description>&lt;p&gt;&lt;strong&gt;StoryDiffusion&lt;/strong&gt; es un proyecto de investigación de la Universidad de Nankai y ByteDance que aborda uno de los problemas más difíciles en IA generativa: mantener la consistencia visual en secuencias largas de imágenes y videos. Introduce un novedoso mecanismo de &lt;strong&gt;autoatención consistente (CSA)&lt;/strong&gt; que permite a los modelos de difusión generar tiras cómicas, animaciones y videos coherentes, todo sin ajuste fino.&lt;/p&gt;
&lt;p&gt;El desafío central que StoryDiffusion resuelve es simple de enunciar pero extremadamente difícil de resolver: cómo generar una secuencia de imágenes donde el mismo personaje se vea consistentemente igual en cada fotograma? Los modelos de difusión anteriores podían producir imágenes individuales impresionantes, pero al generar un cómic multipanel o un videoclip, los personajes cambiaban sutilmente entre fotogramas.&lt;/p&gt;</description></item></channel></rss>