<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>ECCV 2024 on SoloSoft</title><link>https://www.solosoft.dev/es/tags/eccv-2024/</link><description>Recent content in ECCV 2024 on SoloSoft</description><generator>Hugo</generator><language>es-es</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/es/tags/eccv-2024/index.xml" rel="self" type="application/rss+xml"/><item><title>LLaMA-VID: Una Imagen Vale 2 Tokens -- Comprensión Eficiente de Videos Largos con LLMs</title><link>https://www.solosoft.dev/es/post/llama-vid-video-understanding-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/es/post/llama-vid-video-understanding-2026/</guid><description>&lt;p&gt;&lt;strong&gt;LLaMA-VID&lt;/strong&gt; es un proyecto de investigación de ECCV 2024 que aborda el cuello de botella fundamental en la comprensión de video con LLMs: la &lt;strong&gt;eficiencia de tokens&lt;/strong&gt;. Mientras que los LLMs modernos presumen ventanas de contexto de 128K a 200K tokens, los enfoques multimodales anteriores consumían de 100 a 500 tokens por fotograma. El avance de LLaMA-VID es representar cada fotograma con solo &lt;strong&gt;2 tokens&lt;/strong&gt; &amp;ndash; una relación de compresión de 50x a 250x sobre los métodos existentes.&lt;/p&gt;
&lt;p&gt;La idea clave es que los fotogramas de video son altamente redundantes. LLaMA-VID introduce una &lt;strong&gt;representación de doble token&lt;/strong&gt; que separa lo que es estable entre fotogramas (el token de contexto) de lo que cambia (el token de movimiento).&lt;/p&gt;</description></item></channel></rss>