<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>EXL3 on SoloSoft</title><link>https://www.solosoft.dev/tags/exl3/</link><description>Recent content in EXL3 on SoloSoft</description><generator>Hugo</generator><language>en-us</language><lastBuildDate>Fri, 01 May 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.solosoft.dev/tags/exl3/index.xml" rel="self" type="application/rss+xml"/><item><title>ExLlamaV3: High-Performance LLM Inference Engine</title><link>https://www.solosoft.dev/post/exllamav3-inference-2026/</link><pubDate>Fri, 01 May 2026 00:00:00 +0000</pubDate><guid>https://www.solosoft.dev/post/exllamav3-inference-2026/</guid><description>&lt;p&gt;Running large language models on consumer hardware requires efficient inference engines that squeeze every drop of performance from available GPU memory. ExLlamaV3, developed by the turboderp team, is one of the fastest inference engines available for Llama-family models, particularly when using the EXL3 quantization format.&lt;/p&gt;
&lt;p&gt;ExLlamaV3 achieves its speed through a combination of optimized CUDA kernels, efficient memory management, and quantization-aware computation. It supports both 4-bit and 8-bit EXL3 quantization, dynamic batching, and speculative decoding. For users running local models on consumer GPUs, it consistently delivers the highest tokens-per-second throughput available.&lt;/p&gt;
&lt;h2 id="performance-benchmarks"&gt;Performance Benchmarks&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Model&lt;/th&gt;
 &lt;th&gt;GPU&lt;/th&gt;
 &lt;th&gt;Quantization&lt;/th&gt;
 &lt;th&gt;Speed (tokens/s)&lt;/th&gt;
 &lt;th&gt;Memory Usage&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Llama 3.1 8B&lt;/td&gt;
 &lt;td&gt;RTX 4090 24GB&lt;/td&gt;
 &lt;td&gt;EXL3 4-bit&lt;/td&gt;
 &lt;td&gt;180&lt;/td&gt;
 &lt;td&gt;6 GB&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Llama 3.1 70B&lt;/td&gt;
 &lt;td&gt;RTX 4090 24GB&lt;/td&gt;
 &lt;td&gt;EXL3 4-bit&lt;/td&gt;
 &lt;td&gt;30&lt;/td&gt;
 &lt;td&gt;22 GB&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Mistral 7B&lt;/td&gt;
 &lt;td&gt;RTX 3060 12GB&lt;/td&gt;
 &lt;td&gt;EXL3 4-bit&lt;/td&gt;
 &lt;td&gt;85&lt;/td&gt;
 &lt;td&gt;5 GB&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Qwen 2.5 32B&lt;/td&gt;
 &lt;td&gt;RTX 4090 24GB&lt;/td&gt;
 &lt;td&gt;EXL3 4-bit&lt;/td&gt;
 &lt;td&gt;55&lt;/td&gt;
 &lt;td&gt;18 GB&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="key-features"&gt;Key Features&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Feature&lt;/th&gt;
 &lt;th&gt;Description&lt;/th&gt;
 &lt;th&gt;Benefit&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;EXL3 quantization&lt;/td&gt;
 &lt;td&gt;Specialized 4-bit and 8-bit formats&lt;/td&gt;
 &lt;td&gt;Highest quality per bit&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;CUDA kernel optimization&lt;/td&gt;
 &lt;td&gt;Fused attention, flash decoding&lt;/td&gt;
 &lt;td&gt;Maximum throughput&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Dynamic batching&lt;/td&gt;
 &lt;td&gt;Process multiple requests concurrently&lt;/td&gt;
 &lt;td&gt;Higher utilization&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Speculative decoding&lt;/td&gt;
 &lt;td&gt;Draft-then-verify for faster generation&lt;/td&gt;
 &lt;td&gt;2x speedup on some tasks&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;LoRA support&lt;/td&gt;
 &lt;td&gt;Load and swap LoRA adapters at runtime&lt;/td&gt;
 &lt;td&gt;Flexible fine-tuning&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="inference-pipeline"&gt;Inference Pipeline&lt;/h2&gt;

&lt;figure class="mermaid-wrapper not-prose" role="img" aria-label="Mermaid diagram"&gt;
 &lt;div class="mermaid-container"&gt;
 &lt;pre class="mermaid"&gt;flowchart LR
 A[Input Tokens] --&amp;gt; B[Embedding Layer]
 B --&amp;gt; C[Transformer Layer 1]
 C --&amp;gt; D[Layer 2]
 D --&amp;gt; E[Layer N]
 E --&amp;gt; F[Attention with&amp;lt;br/&amp;gt;FlashAttention]
 F --&amp;gt; G[Feed-Forward&amp;lt;br/&amp;gt;with Quantized GEMM]
 G --&amp;gt; H{More Layers?}
 H --&amp;gt;|Yes| D
 H --&amp;gt;|No| I[Output Logits]
 I --&amp;gt; J[Sampling]
 J --&amp;gt; K[Generated Token]
 K --&amp;gt; L[KV Cache Update]
 L --&amp;gt; C&lt;/pre&gt;
 &lt;script type="application/mermaid"&gt;flowchart LR
 A[Input Tokens] --&gt; B[Embedding Layer]
 B --&gt; C[Transformer Layer 1]
 C --&gt; D[Layer 2]
 D --&gt; E[Layer N]
 E --&gt; F[Attention with&lt;br/&gt;FlashAttention]
 F --&gt; G[Feed-Forward&lt;br/&gt;with Quantized GEMM]
 G --&gt; H{More Layers?}
 H --&gt;|Yes| D
 H --&gt;|No| I[Output Logits]
 I --&gt; J[Sampling]
 J --&gt; K[Generated Token]
 K --&gt; L[KV Cache Update]
 L --&gt; C&lt;/script&gt;
 &lt;/div&gt;
&lt;/figure&gt;&lt;p&gt;The pipeline processes tokens through transformer layers with specialized CUDA kernels for attention and feed-forward computation. The KV cache is maintained efficiently in GPU memory, and speculative decoding can accelerate generation by validating multiple tokens at once.&lt;/p&gt;</description></item></channel></rss>