Les 3 articles les plus chauds de la veille du 5 août 2026. 🔥

🔥 Top 3

1. LFM2.5-2.6B is out

LFM2.5-2.6B vient de sortir. Un petit modèle de 2,6 milliards de paramètres, taillé pour les tâches agentiques. L’annonce vient de r/LocalLLaMA, et l’auteur du post s’y connaît : son modèle favori pour certains jobs, c’était le 8b-a1b.

Le point qui accroche : les tâches simples à gros volume. Résumer des milliers de documents, trier des logs. Ce genre de boulot ne demande pas un modèle géant, il demande de la vitesse et de la fiabilité, avec un coût par appel minimal.

Un 2,6B répond à ça. Moins de VRAM, des inférences rapides, des déploiements légers. Dans un pipeline agentique qui boucle des milliers de fois, l’économie se voit à chaque requête.

La tendance se confirme : les petits modèles spécialisés grignotent les tâches que les gros généralistes traitaient par défaut. L’intelligence brute ne paie plus sur un résumé de documents.

Reste à vérifier la fiabilité sur des workflows multi-étapes. Un 2,6B tient-il la route quand l’agent doit enchaîner dix actions sans dérailler ?

🔗 www.reddit.com

2. Maple-Preview: 20B-A1B ternary-weight reasoning open-weight LLM

Maple-Preview pousse la quantification à l’extrême : 20 milliards de paramètres au total, mais seulement 1 milliard d’actifs à chaque inférence (architecture A1B), avec des poids ternaires. Concrètement, chaque poids ne prend que trois valeurs possibles (-1, 0 ou 1) au lieu d’une plage continue.

L’intérêt de la ternarisation, c’est la compression. Des poids qui tiennent sur un peu plus d’un bit au lieu de seize, une empreinte mémoire divisée par dix, et des inférences qui peuvent tourner sur du matériel modeste. Le format 20B-A1B, lui, garde la connaissance du gros modèle tout en ne calculant qu’une fraction des paramètres à chaque token.

C’est une preview, donc prudence sur les chiffres annoncés. Mais la direction est cohérente avec le reste de la scène open-weight : les modèles de raisonnement descendent vers du matériel de plus en plus léger, et les poids ternaires sont l’une des pistes les plus agressives du moment.

Reste à voir si le raisonnement tient la route avec des poids aussi contraints. Un modèle dont chaque paramètre ne peut dire que -1, 0 ou 1, jusqu’où ça suffit ?

🔗 www.reddit.com

3. Gemma 4 on 500MB

500 Mo pour faire tourner Gemma 4. Oui, vous lisez bien. Un modèle de la génération actuelle tient dans l’équivalent d’une clé USB un peu costaude.

Le post r/LocalLLaMA montre une capture de Gemma 4 fonctionnant sur 500 MB de mémoire. Pour ceux qui suivent le local LLM, c’est un chiffre qui change la donne. Les petits modèles quantifiés tournaient déjà sur du matériel modeste, mais Gemma 4 est un modèle récent, pas un jouet de 2023.

Concrètement, on passe du GGUF classique à des formats plus agressifs comme IQ2 ou Q2_K, avec une perte de précision maîtrisée. Le secret tient aussi à l’architecture du modèle et à son entraînement, pensés pour supporter la quantification lourde sans s’effondrer.

Les implications sont nettes. Un Raspberry Pi 5, un smartphone milieu de gamme, ou un vieux PC portable peuvent faire tourner un vrai assistant local. La dépendance au cloud recule d’un cran. Pour la confidentialité, c’est un signal fort : vos conversations ne quittent plus la machine.

Reste la qualité. À ce niveau de compression, le vocabulaire et le raisonnement restent corrects, mais on sent des approximations. Pour du résumé ou du chat simple, c’est utilisable. Pour coder ou analyser, passez votre chemin.

La course ne fait que commencer. Que faudra-t-il pour voir un modèle de 70 milliards de paramètres dans 500 Mo ? Réponse dans un an, peut-être moins.

🔗 www.reddit.com

📦 Le reste de la veille

… et 80 autres articles consultés.