Niko1221/Strata promete que un modelo de 125.000 millones de parámetros —Qwen3.8-Flash-Next— funciona en tu propio PC, que basta «una tarjeta gráfica de 12 GB o más» y que escribe 94 tokens por segundo. El repositorio se creó el 24 de septiembre de 2026 y recibió su último envío el 4 de octubre, llegó a la portada de Hacker News con 595 puntos y 279 comentarios, y acumula 11.048 estrellas y 969 bifurcaciones en 11 días.
Es el tipo de titular que suele desmoronarse al primer contacto. Este no lo hace. Descargué el repositorio, consulté la API de GitHub para reconstruir el historial de versiones, colaboradores e incidencias, leí los tres documentos que describen el motor, desmonté sus propias cifras y rehíce yo mismo la aritmética del ancho de banda de memoria. La afirmación sobre la velocidad sobrevive, pero sobrevive por un motivo que la frase publicitaria esconde, y ese mismo repositorio se contradice a sí mismo por un factor de 5,3 en la velocidad de lectura de instrucciones.
Qué es realmente este repositorio
No es un envoltorio fino alrededor del binario de otro. Es un motor de inferencia: 235 ficheros C++, 56 ficheros CUDA, 167 cabeceras, sus propios backends CUDA y SYCL, una bifurcación de ggml incluida en third_party/, CMake, un Dockerfile, 172 ficheros bajo bench/ y 30 pruebas. Con licencia MIT.
| Medido | |
|---|---|
| Creado / último envío | 24 sep 2026 / 4 oct 2026 |
| Estrellas / bifurcaciones / seguidores | 11.048 / 969 / 71 |
| Estrellas por día | 1.004 |
| Versiones | 40 (v0.1.0 → v0.1.39 en 11 días, 3,6 al día) |
| Descargas de artefactos | 65.702 |
| Colaboradores | 68 (el primero: 520 aportes; el segundo: 21) |
| Incidencias y PR abiertos (página 1) | 98 / 67 |
| Ficheros / directorios / bytes | 852 / 113 / 27.100.222 |
| Licencia | MIT |
Dos datos de esa tabla deben leerse juntos. El primer colaborador suma 520 aportes frente a 21 del segundo, 24,8 veces más: la huella de un proyecto de autor único con una comunidad amplia que pasa de largo. Varios comentaristas de Hacker News, viendo la misma forma, concluyeron que el código está escrito en gran parte por máquinas («Main contributor: Claude», escribió uno). Yo no he auditado la autoría y no lo repetiría como un hecho, pero la concentración es real y conviene saberla cuando se calcula cuánta revisión independiente ha recibido el motor.
El segundo dato está en las descargas. El artefacto más descargado es strata-windows-x64.zip de la v0.1.38 con 14.179 descargas. El segundo es el vídeo de demostración de 49 segundos, Pagoda.mp4, con 12.493 — el 19% de todas las descargas de artefactos de la historia del proyecto, más que cualquier compilación salvo una. Que un tráiler de 13,8 MB supere a 38 de las 39 compilaciones alternativas dice mucho sobre cuánta de la adopción de este proyecto sigue siendo gente mirando, no ejecutando.
Los 12 GB son el número menos importante
Esta es la frase que repitieron casi todas las coberturas: una tarjeta NVIDIA o AMD con 12 GB de VRAM o más. Y esta es la letra pequeña de la misma tabla: 32 GB de RAM como mínimo, unos 80 GB de disco, una descarga de modelo de aproximadamente 70 GB y un primer arranque que carga «entre 35 y 55 GB en tu RAM» y puede congelar la máquina durante uno a tres minutos.
Ahora léase la tabla de tamaños de docs/MODELS.md, que es la versión honesta:
| Tamaño | RAM + VRAM necesarias | Pesos de expertos retenidos en RAM |
|---|---|---|
| Q2_0 (el más rápido) | 37,6 GB | 34 GB |
| IQ2_XS (recomendado) | 39,2 GB | 35,5 GB |
| IQ3_XXS | 47,0 GB | 43 GB |
| IQ3_S (mejor calidad) | 54,8 GB | 50 GB |
| Coder (IQ1_M) | 29,6 GB (fragmento 1) | 23 GB |
Q2_0 coloca 34 GB de pesos de expertos en la memoria del sistema, 2,8 veces el tamaño de la tarjeta de 12 GB completa. La tarjeta gráfica guarda las capas densas, los mezcladores de atención y DeltaNet, el enrutador, la cabeza de salida y una caché de los expertos más usados. El modelo vive en la RAM que ya tienes.
De ahí se deduce la propia guía del proyecto, más estricta que el titular: con 32 GB de RAM el instalador solo recomienda el Coder, que conserva 256 de los 512 expertos de cada capa y es, en palabras de su documentación, «más débil fuera del código y en idiomas distintos del inglés». Con 48 GB entran Q2_0 o IQ2_XS. Hacen falta 64 GB para que quepan todos los tamaños. Una tarjeta más grande lo hace más rápido; los documentos dicen explícitamente que no reduce la RAM necesaria.
Así que la decisión de compra no es una tarjeta gráfica: son 64 GB de DDR5, que en la mayoría de placas significa cuatro módulos o dos de 32 GB, y de ahí viene el rendimiento real.
De dónde salen realmente los 94 tokens por segundo
El motor es un modelo de mezcla de expertos: 48 capas × 512 expertos = 24.576 expertos, de los que el enrutador elige 10 por capa y token, es decir 480 instancias de experto por token. Esa dispersión es todo el truco y además permite comprobar las cifras publicadas en lugar de creerlas.
Q2_0 guarda 34 GB de pesos de expertos para 24.576 expertos: un experto ocupa unos 1,38 MB. Un token lee 480 de ellos, o 664 MB por token si no hay nada en caché. A los 94 tokens/s publicados eso supone 62,4 GB/s de tráfico sostenido de memoria, frente a un pico teórico de 83,2 GB/s en la DDR5-5200 de doble canal que el README especifica y una cifra realista de 50 a 60 GB/s. Es el 75% del pico teórico, antes de que el sistema operativo, el escritorio y el navegador tomen su parte.
Hagamos la misma cuenta con la fila de AMD. La máquina con RX 9070 XT lleva un Ryzen 9 3900X y 47 GB de RAM, es decir DDR4-3200: un techo de 51,2 GB/s. La cifra publicada allí es de 60 tokens/s, que exige 39,8 GB/s: el 77,8% del techo de esa máquina. Las velocidades publicadas se sitúan casi en la misma fracción de sus respectivos picos de ancho de banda (75,0% y 77,8%), y su cociente —60/94 = 0,638— sigue al cociente de anchos de banda 51,2/83,2 = 0,615.
No es casualidad, y es lo más útil de este artículo: los 94 tokens/s son una cifra de ancho de banda de memoria, y el hardware que la decide es la RAM, no la GPU. La tarjeta gráfica es una caché: la documentación dice que cada gigabyte extra de VRAM aloja «unos 700 expertos más», y las mediciones de DETAILS.md sitúan la residencia en VRAM en 1.589 expertos en condiciones normales y 3.872 con la transmisión de KV activada, entre el 6% y el 16% de los 24.576. El otro 84-94% lo calcula la CPU desde la RAM, en paralelo con la GPU, por el bus PCIe.
Queda un término que cierra la tabla y que el proyecto expone abiertamente: la decodificación especulativa. Una pequeña cabeza de predicción de múltiples tokens propone varios y el modelo los verifica en una sola pasada; los documentos prometen de 1,6 a 1,8 veces más velocidad y afirman que se aceptan entre 2,4 y 3,2 tokens por pasada. A 94 tokens/s eso significa solo 29-39 pasadas de lectura de pesos por segundo, lo que baja la RAM necesaria a 19,5-26,0 GB/s. Las cifras cuadran, sí, pero solo si el decodificador especulativo acepta de verdad dos o tres tokens por pasada con tu texto. Con código y salidas estructuradas lo hace; con texto poco habitual la documentación admite que la aceptación cae y que «una respuesta distinta a la misma pregunta mueve la cifra varios por ciento».
Por eso todas las cifras de lectores que superan los 100 tokens/s en el hilo de Hacker News vienen de máquinas con una tarjeta de 24 GB o 128 GB de RAM, y por eso la compilación de 4 bits de Unsloth que no cabe en memoria —111 GB de descarga y 77 GB de expertos— se hunde a 7-8,5 tokens/s en un PC de 64 GB con una tarjeta de 12 GB. Cuando los expertos tienen que salir del SSD en cada token, el argumento del ancho de banda de RAM se convierte en uno de SSD y la máquina deja de servir para trabajo agéntico.
La documentación se contradice 5,3 veces
El README dice: «Strata lee el primer mensaje de una conversación completo, alrededor de un minuto por cada 30.000 tokens». Eso son unos 500 tokens/s de procesamiento de instrucciones.
docs/MODELS.md dice: «Una instrucción de 32K tarda unos 15 segundos con Q2_0», en una tabla que da 2.650 tokens/s para Q2_0 y 2.180 para el Coder. Son 2.180-2.650 tokens/s, 5,3 veces más que su propia frase en el README.
Las dos no pueden ser verdad, y el registro de cambios del repositorio dice cuál está obsoleta. El prellenado estuvo limitado y lento hasta el motor 0.1.13, que introdujo el troceado automático de hasta 8.192 tokens; después, DETAILS.md registra cómo el motor 0.1.36 llevó el prellenado de 32K de 2.170 a 2.653 tokens/s con núcleos fusionados int8 en los tensor cores. La línea del minuto por 30.000 tokens describe un motor de varias decenas de versiones atrás y nunca se retiró, mientras que la de los 15 segundos es de la 0.1.26 y la 0.1.36. Es un fallo de documentación, no de hardware, pero es la frase que encuentra primero quien llega nuevo, y la velocidad de prellenado es la diferencia entre un agente de código útil y otro que se pasa un minuto tragándose un fichero.
Dos variantes menores del mismo problema:
- La tabla principal mezcla versiones del motor. La fila de Q2_0 se midió con el motor 0.1.36; todas las demás filas de esa tabla son del motor 0.1.26, y
DETAILS.mdlo confiesa en una nota a pie: «Las tablas de abajo son de la 0.1.26». - La mejor cifra de AMD es una configuración que el instalador rechaza.
MODELS.mdanota que la fila Q2_0 de AMD supera la propia estimación de RAM de su instalador para una máquina de 47 GB y que se instaló con la excepción--model Q2_0 --yes. El mejor número de AMD en la tabla de marketing está marcado como fuera de especificación por el instalador que acompaña al proyecto.
En descargo del proyecto: etiqueta las estimaciones como estimaciones. La cifra de la RTX 3090 de 24 GB —«debería escribir entre 100 y 140 tokens por segundo»— está bajo un epígrafe titulado «Other GPUs (estimated)», con la nota «No medido, estimado a partir de las ejecuciones anteriores», y el repositorio incluye un fichero llamado literalmente experimental-speed-projection. Eso es más disciplina de la que muestra la mayoría de proyectos de este tamaño. El problema es lo que pasa después: el envío a Hacker News llevaba el título «Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s», una tarjeta que el repositorio nunca mide y una cifra que salió del comentario de un usuario, no del mantenedor. Contada una sola vez, una estimación se convirtió en una medición sobre hardware que nadie probó.
Qué dicen las mediciones independientes y dónde queda el intercambio
El hilo de Hacker News es inusualmente útil porque los comentaristas hicieron el trabajo. Las reproducciones de la comunidad confirman la tabla más que superarla: unos 60 tokens/s con IQ3_S en una 3090, 65 tokens/s con IQ2_XS en una RX 9070 XT con un 5900X, «más de 110 tokens/s» con MTP de 3 tokens en una 4090 con 128 GB de DDR4. Para hacerse una idea de la escala: el mismo modelo en IQ3_XXS bajo llama.cpp en un Ryzen 8845HS con 96 GB de RAM y sin tarjeta gráfica alguna va a 7 tokens/s de decodificación y 60 tokens/s de prellenado, así que el aporte de Strata es real, en torno a un orden de magnitud en decodificación en ese nivel.
El lado de la calidad es donde viven las objeciones honestas, y el proyecto no las responde:
- La documentación no publica cifras de precisión.
MODELS.mdcalifica sus tamaños de forma cualitativa: «good» (Q2_0), «better» (IQ2_XS), «great» (IQ3_XXS), «best: matches the full model on the published tests» (IQ3_S). El único número del repositorio es una pérdida de perplejidad del 8-12% con la caché KV de 4 bits, que es una advertencia sobre la caché barata, no una medida de los pesos de 2 bits. La frase de un comentarista —«publicar referencias con modelos cuantizados debería ser la norma»— marca el estándar correcto y este proyecto no lo cumple. - La única cifra de calidad citada es de terceros y prestada. El «91,3% de la puntuación SWE-bench Verified del modelo completo y 98,7% de LiveCodeBench v6» del Coder procede de ISTA-DASLab, los autores del modelo, y se refiere a una variante podada que conserva 256 de los 512 expertos por capa. Es un número legítimo sobre un modelo distinto del que ocupa la fila superior de la tabla de velocidad.
- Una regresión de visión cuantificada. Un comentarista ejecutó una prueba de 50 imágenes de regresión de coordenadas a temperatura 0 con exactamente los mismos pesos GGUF y el mismo adaptador de visión bajo Strata y bajo llama.cpp: error mediano de 154,8 px frente a 46,5 px, media de 168,8 frente a 81,4, una brecha que describió como «tan grande como el salto de un modelo de 9B a uno de 35B». Importa porque la ruta de visión es opcional y limitada por plataforma —en tarjetas AMD las imágenes se procesan en Linux a través de la CPU y «en Windows todavía no pueden»— y porque el propio
DETAILS.mdconcede que del codificador cuantizado «todavía no hemos medido su precisión frente a BF16». Un codificador de 0,9 GB más unos 1,4 GB de VRAM reservada también cuestan velocidad de texto: entre un 2% y un 8% menos de generación con las imágenes activadas. - Tamaño frente a ganancia. Los ficheros del modelo de 125.000 millones son unas seis veces mayores que los de un modelo de 27B en la misma cuantización, para, según las propias referencias de la ficha del modelo, menos del 10% de ganancia. Es el intercambio que se le pide a una máquina de 64 GB.
- La concurrencia es un punto débil. Strata atiende una petición a la vez por defecto;
"parallel": 2es opcional y, en una tarjeta de 12 GB, «hace que cada respuesta sea más lenta», porque dos conversaciones activan expertos distintos y la caché de VRAM, que guarda entre el 6% y el 16% de la tabla, entra en conflicto.
El fragmento 2: los 28,8 GB de los que nadie habla
Un detalle estructural es más interesante que cualquier referencia. El modelo de Strata se divide en dos fragmentos, y el fragmento 2 es una «tabla de consulta» de 28,8 GB que se queda en tu SSD. Es la capa de incrustación de n-gramas del modelo: una tabla PLE (Parallel Lookup Embedding) de unos 20 millones de entradas de bigramas y trigramas en la capa 2, con dimensión de incrustación 2.560. Durante la generación el motor busca «unas pocas filas por token» en tu disco mediante E/S directa sin búfer (--ple-io direct).
Es el mecanismo que permite al modelo cargar parámetros sin pagarlos en RAM —escalado que ni la CPU ni la GPU ven— y también una segunda dependencia por token de un hardware que el texto publicitario nunca menciona: tu SSD. Si dudas entre un NVMe y un SATA, o ejecutas esto en un disco externo, esta tabla es la razón por la que la documentación insiste en un SSD y por la que una máquina que técnicamente cabe puede comportarse mal con una petición por segundo de lecturas aleatorias.
La ingeniería relacionada es real y merece crédito. La transmisión de KV por encima de 64K de contexto mantiene la caché en RAM y solo la parte atendida en VRAM (--kv-resident 32768), a unos 13,7 KB de RAM por token de contexto —1,7 GB a 128K— y lleva a Q2_0 con 262K de contexto de 50,9 a 62,6 tokens/s al subir la residencia en VRAM de 1.589 a 3.872 expertos. Una caché híbrida K8V4 recorta un 23% la memoria KV y llevó una 3090 de 85 a 99 tokens/s con 198K de contexto. Las pull requests abiertas se leen como las de un proyecto de sistemas y no como las de un artefacto de semana de lanzamiento: «Refactor PageCache to fix a 45× read amplification», «hip: RDNA3 (gfx1100) WMMA kernel for the QSA block-score select/scorer», «perf: opt-in resident expert exchange buffer rotation». Cuarenta versiones en once días no siempre es buena señal, pero este motor se mide, se perfila y se corrige en público.
Entonces, ¿conviene ejecutarlo?
Si tienes 64 GB de RAM, una tarjeta NVIDIA de 12 GB o más y un SSD NVMe, y quieres un modelo local suficientemente bueno para trabajo bien acotado, esto es una de las cosas más capaces que puedes instalar hoy. Elige IQ2_XS —la recomendación del propio proyecto— y no la fila más rápida de la tabla: la velocidad de Q2_0 es real, pero la documentación no tiene ninguna cifra de precisión que respalde su etiqueta «good», y entre «el más rápido» y «el recomendado» hay un paso de cuantización.
Si tienes 32 GB de RAM, estás eligiendo entre el Coder —que según sus documentos es «más débil fuera del código y en idiomas distintos del inglés», con respuestas en chino que «salían mal o en bucle»— y nada. En ese punto, un buen modelo de 27B a 4 bits en la tarjeta que ya tienes es mejor uso de la máquina: cuatro bits de un modelo denso más pequeño frente a dos bits de un modelo que solo puedes evaluar en parte no es una comparación que favorezca al número grande.
Si tu prioridad son las imágenes, prueba antes de fiarte. La precisión del codificador no está medida por el proyecto, la ruta de AMD se limita a inferencia en CPU sobre Linux y la única comparación pública y cuantificada contra llama.cpp con pesos idénticos muestra un castigo de 3,3 veces en el error mediano.
Y olvida el marco de los «12 GB» al planificar. Decide desde la RAM: 32 GB → solo el Coder; 48 GB → Q2_0 o IQ2_XS; 64 GB → todo menos las compilaciones de 4 bits de Unsloth de 111 GB; 96 GB o más → IQ3_S o UD-IQ4_XS. Reserva 80 GB de disco, cuenta con que el primer arranque bloquee la máquina de uno a tres minutos y con una petición a la vez salvo que pagues deliberadamente la concurrencia.
Preguntas frecuentes
¿Es cierta la cifra de 94 tokens por segundo? Es coherente con el hardware y la aritmética se puede comprobar: 480 expertos de 24.576 por token a 1,38 MB cada uno son 664 MB de tráfico por token, que a 94 tokens/s son 62,4 GB/s, el 75% del pico teórico de la DDR5-5200 que recomienda el README. Solo es alcanzable con una caché de expertos en VRAM funcionando y una decodificación especulativa que acepte 2-3 tokens por pasada. No está inventada: es un número de mejor caso en una máquina construida alrededor de él.
¿Por qué una tarjeta de 12 GB ejecuta un modelo de 125.000 millones? Porque solo se usan 10 de los 512 expertos por capa y token, y porque el modelo está repartido: pesos densos y caché de expertos calientes en VRAM, los 24.576 expertos en la memoria del sistema y una tabla de consulta de n-gramas de 28,8 GB en el SSD. Una tarjeta de 12 GB basta para la parte caliente y pequeña. Es una caché, no la casa del modelo.
¿Sustituye una tarjeta más grande a la RAM que necesito? No. La documentación dice que una tarjeta mayor lo hace más rápido pero «no reduce la RAM necesaria», con la excepción del modo de poca RAM, que mapea expertos desde el disco y, con una tarjeta pequeña, hace que «la mayoría de los expertos vengan del SSD y sea mucho más lento».
¿Es una pérdida real de calidad la cuantización de 2 bits? El proyecto no publica los números que responderían a eso, y eso es en sí la respuesta. Sus etiquetas van de «good» a «best» sin tabla de precisión para los tamaños base, la única cifra de pérdida del repositorio es un 8-12% de perplejidad de la caché KV de 4 bits, y las afirmaciones de la comunidad van desde «IQ3_XXS está a un punto del modelo sin cuantizar» hasta una estimación de que un cuant de 2 bits conserva en torno al 80% de la memoria del modelo completo. Prueba con tu propia carga de trabajo.
¿Qué tan lenta es la versión de 4 bits si no cabe en RAM? UD-Q4_K_XL de Unsloth es una descarga de 111 GB con 77 GB de expertos y escribe 7-8,5 tokens/s en un PC de 64 GB con una GPU de 12 GB, con instrucciones largas lentas. La UD-IQ4_XS de 94 GB se comporta mejor: mantiene en RAM tu memoria menos 24 GB de expertos y transmite el resto desde un SSD NVMe, y pide 48 GB de RAM o más.
¿Cuál es la crítica más sólida al proyecto? No la velocidad: la velocidad es real. Es que la configuración rápida y llamativa es la menos verificada: pesos de 2 bits sin evaluación de precisión publicada, una ruta de visión que el proyecto admite no haber medido y que una prueba independiente encontró 3,3 veces por detrás de llama.cpp con pesos idénticos, y una documentación que todavía te dice que una instrucción de 32K tarda un minuto cuando su propio fichero hermano dice quince segundos.
Conclusión
Strata es el raro caso de proyecto cuya afirmación extraordinaria resiste en su mayor parte. Un modelo de mezcla de expertos de 125.000 millones de parámetros sí funciona en una máquina con tarjeta de 12 GB, y la tabla de velocidad publicada es coherente con el ancho de banda de la memoria del hardware que nombra: tan coherente que sus dos filas publicadas caen en el 75% y el 78% de sus respectivos techos de RAM.
Pero la frase «12 GB bastan» está haciendo el trabajo de otra frase distinta: «64 GB de RAM bastan». La tarjeta es una caché para el 6-16% de los expertos, el modelo vive en la RAM, una tabla de 28,8 GB vive en tu SSD y la velocidad que percibes la marca tu controlador de memoria, no tu GPU. Medida así, la afirmación es cierta, comprobable y una pieza genuinamente impresionante de ingeniería de inferencia local, cuyo punto más débil no es el rendimiento sino la evidencia de precisión que no ha publicado y la documentación que no ha actualizado.