Strata exécute Qwen 3.8 Flash Next sur un « simple » PC
mer, 07/10/2026 - 07:33
Strata, un moteur d'inférence open source sous licence MIT, fait tourner Qwen 3.8 Flash Next, un modèle de 125 milliards de paramètres sur un PC équipé d'une d’une GPU NVIDIA (GeForce RTX séries 20 à 50) ou AMD (Radeon RX 6800 et au-delà) avec au moins 12 Go de RAM, sous Windows ou Linux. Strata répartit le travail entre GPU, RAM, CPU et stockage. La RAM nécessaire dépend de la variante et du GPU, 32 Go au minimum, et il faut environ 80 Go d'espace disque libre.

Le modèle discute, écrit du code, lit des images (avec des restrictions sur AMD) et sert les agents de codage par une API compatible OpenAI et Anthropic sur localhost. L'inférence est locale.
Mesures publiées par les auteurs : 94 tokens par seconde en écriture et 2 650 en lecture de prompt sur une RTX 5070 avec 12 Go, avec 64 Go de RAM et une quantification Q2_0 ; 60 et 1 160 sur une RX 9070 XT, avec environ 47 Go de RAM.
L'installation est assistée : un double-clic sur START-HERE.bat sous Windows, setup.sh sous Linux, ou un prompt à confier à son agent. La version 0.1.39 du 4 octobre accélère le décodage d'environ 6 % sur certaines configurations, accepte en option plusieurs requêtes à la fois, ce qui peut ralentir une carte de 12 Go, et ajoute l'API Response d'OpenAI pour Codex.
GitHub : https://github.com/Niko1221/Strata

