6 minutes
Veille du 20 août 2026 — volta · qwen · self-play
Les 3 articles les plus chauds de la veille du 20 août 2026. 🔥
🔥 Top 3
1. NVFP4 on VOLTA! Despite being built for Blackwell, I made four 2017 V100s run Qwen 3.8 NVFP4 natively and match my $6000 RTX 5090.
Quatre V100 de 2017 qui font tourner du NVFP4 conçu pour les RTX 50, et qui égalent une RTX 5090 à 6000 dollars. Non, ce n’est pas un canular, c’est un type sur Reddit qui s’est dit que les specs, c’est fait pour être contournées.
Le piège, c’est que le NVFP4 (flottant 4 bits) est taillé pour l’architecture Blackwell. Sur Volta, les instructions natives n’existent pas. La solution ? Il a désassemblé les kernels, identifié les opérations FP4, puis les a réécrites en FP16 avec une conversion dynamique à la volée. Les V100 n’ont pas de tensor cores FP4, mais elles ont des FP16 costauds. Résultat : le modèle Qwen 3.8 tourne, et la qualité de sortie colle à celle de la 5090.
Le plus dingue, c’est le coût. Quatre V100 d’occasion, c’est environ 1200 dollars en 2026, contre 6000 pour la carte neuve. La vitesse est inférieure, évidemment, mais pour de l’inférence en batch ou du traitement hors ligne, l’écart se réduit à peau de chagrin. Il a même publié les patches et les scripts de conversion sur GitHub.
Ce que ça révèle, c’est que la guerre des formats (FP8, FP4, MXFP4) n’est pas qu’une bataille de hardware. Le software peut tricher, et les vieilles cartes ont encore des années de vie si quelqu’un prend le temps de bidouiller les kernels.
Question : si les V100 peuvent faire ça, qu’est-ce que les A100 ou les MI100 peuvent encore cacher ? Et surtout, qui va casser le prochain format propriétaire ?
🔗 www.reddit.com
2. DFlash2 speeds Qwen 3.8 27B up to 4 times
Qwen 3.8 27B, quatre fois plus rapide, sans changer de GPU
Le projet DFlash2 fait tourner les têtes sur r/LocalLLaMA. Un modèle de 27 milliards de paramètres qui passe de 20 à 80 tokens par seconde sur un simple RTX 4090. Pas de miracle, de l’ingénierie de mémoire.
L’astuce tient dans la gestion du cache KV. DFlash2 réécrit la façon dont les clés et valeurs sont stockées pendant l’inférence. Au lieu de tout garder en VRAM, il compacte les données en blocs plus denses et exploite les bandes passantes mémoire de façon agressive. Résultat : le goulot d’étranglement classique des grands modèles, la bande passante, saute en grande partie.
Les tests montrent un gain jusqu’à 4x sur les longues séquences, là où le cache KV explose la mémoire. Sur des contextes courts, l’avantage se réduit, mais reste net. Le tout, sans dégrader la qualité des réponses. Les benchmarks de perplexité et de génération restent stables.
Ce qui frappe, c’est que DFlash2 ne touche pas au modèle lui-même. C’est un patch d’inférence, compatible avec les poids d’origine de Qwen. Vous gardez vos fine-tunes, vous changez le moteur, vous gagnez un facteur 4. Les utilisateurs de la communauté rapportent déjà des intégrations dans llama.cpp et vLLM.
La question qui tue : si ce genre d’optimisation se généralise, a-t-on encore besoin de clusters pour faire tourner des 27B en local ? À suivre de près.
🔗 www.reddit.com
3. SPADE: Self-Play in Adaptive Synthetic Executable Environments
Un seul modèle d’IA joue à deux rôles : il conçoit des environnements d’entraînement sous forme de code exécutable, puis apprend à les résoudre. Résultat : il bat les systèmes à environnement fixe de +5,3 points en moyenne sur huit benchmarks, et grimpe à +13,9 sur ACEBench-Agent en usage d’outils. C’est SPADE, et ça sent la boucle d’amélioration qui ne s’arrête plus.
L’idée tient en une phrase : si ton agent progresse, ses exercices doivent progresser aussi. Les pools d’entraînement classiques sont statiques, écrits à la main ou générés une fois pour toutes. SPADE les rend dynamiques et adaptatifs. Un Environment Designer écrit des environnements complets avec une interface reset() / step() façon OpenAI Gym. Un Reasoning Agent apprend à y naviguer. Même interface, donc, pour des problèmes de raisonnement pur et des chaînes d’actions multi-étapes.
Le point malin, c’est le signal de regret. L’agent reçoit parfois des indices privilégiés, parfois non. L’écart entre ses performances avec et sans ces indices mesure son degré de difficulté. L’Environment Designer optimise ce regret pour générer des tâches juste au bord des capacités de l’agent, ni trop faciles, ni impossibles. Il garde aussi une mémoire des environnements passés et s’ancre sur des documents tirés d’un gros corpus de pré-entraînement. Sans ces deux ingrédients, disent les auteurs, tout s’effondre.
Sur les jeux, l’avantage de SPADE augmente avec la taille du modèle. Plus le modèle est gros, plus la boucle auto-générative lui profite. C’est exactement le genre de résultat qui donne des frissons : l’auto-amélioration ouverte n’est plus un slogan, c’est une architecture avec des chiffres.
Reste une question qui tue : jusqu’où cette boucle peut-elle aller avant que l’agent ne génère que des problèmes qu’il sait déjà résoudre, ou pire, des problèmes qu’il ne comprend même plus ? La marge de progression est réelle, mais elle a une limite. Laquelle ?
🔗 arXiv
📦 Le reste de la veille
Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets — Des PC Intel AI inactifs se transforment en cluster distribué pour servir des LLM 70B sur un réseau ordinaire : de quoi démocratiser l’inférence auto-hébergée.
shipped the vibedraft redesign, and the process was the story.
claude code built it. i directed:
- asked for 5 versio… — Un retour d’expérience concret sur l’utilisation de Claude Code pour piloter un redesign, avec un processus itératif inspirant.
Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training — Mesurer enfin l’effet d’un unique exemple d’entraînement, pas seulement l’estimer : 24 contre-factuels sur GPT-2, un luxe expérimental rare.
We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility — Une enquête choc révèle que des livres rares finissent dans l’entraînement d’IA d’Amazon – de quoi enflammer le débat sur le droit d’auteur.
Offering Zero Data Retention for frontier models — Une avancée concrète pour la confidentialité des API, mais sans code ni démonstration, cela reste une annonce de confiance.
smolmachines / smolvm as a sandbox for untrusted Python & JavaScript — Un bac à sable pour exécuter du code non fiable en Python et JavaScript, testé par Simon Willison — un pattern réutilisable pour sécuriser les agents autonomes.
US crypto policy and regulatory engagement. Trump met with Coinbase, Ripple, Kraken, Gemini, Polymarket, Nasdaq, CME, an… — Trump et les géants crypto poussent le Clarity Act : le marché réagit, mais rien de concret pour les développeurs d’agents.
Swarm architecture makes your job easier and faster, just leverage more agents whenever possible.
https://t.co/CVv… — Architecture en essaim : plus d’agents, plus de vitesse ? Une idée séduisante mais sans preuve concrète.
Pacing model development in an era of cyber-critical capabilities — OpenAI durcit la surveillance et l’alignement des modèles frontières, un sujet crucial mais sans démonstration concrète pour les builders.
Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis — Une approche pour la rétrosynthèse chimique, mais peu pertinente pour les agents OS.
CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation — Un modèle cardiaque multimodal, mais trop spécialisé pour intéresser les développeurs d’OS agentiques.
OpenAI joins PORTS-Pike project — Un investissement communautaire dans l’Ohio, sans impact technique pour les développeurs d’agents.