4 minutes
Veille du 5 août 2026 — lfm2.5 · maple-preview · gemma
Les 3 articles les plus chauds de la veille du 5 août 2026. 🔥
🔥 Top 3
1. LFM2.5-2.6B is out
LFM2.5-2.6B vient de sortir. Un petit modèle de 2,6 milliards de paramètres, taillé pour les tâches agentiques. L’annonce vient de r/LocalLLaMA, et l’auteur du post s’y connaît : son modèle favori pour certains jobs, c’était le 8b-a1b.
Le point qui accroche : les tâches simples à gros volume. Résumer des milliers de documents, trier des logs. Ce genre de boulot ne demande pas un modèle géant, il demande de la vitesse et de la fiabilité, avec un coût par appel minimal.
Un 2,6B répond à ça. Moins de VRAM, des inférences rapides, des déploiements légers. Dans un pipeline agentique qui boucle des milliers de fois, l’économie se voit à chaque requête.
La tendance se confirme : les petits modèles spécialisés grignotent les tâches que les gros généralistes traitaient par défaut. L’intelligence brute ne paie plus sur un résumé de documents.
Reste à vérifier la fiabilité sur des workflows multi-étapes. Un 2,6B tient-il la route quand l’agent doit enchaîner dix actions sans dérailler ?
🔗 www.reddit.com
2. Maple-Preview: 20B-A1B ternary-weight reasoning open-weight LLM
Maple-Preview pousse la quantification à l’extrême : 20 milliards de paramètres au total, mais seulement 1 milliard d’actifs à chaque inférence (architecture A1B), avec des poids ternaires. Concrètement, chaque poids ne prend que trois valeurs possibles (-1, 0 ou 1) au lieu d’une plage continue.
L’intérêt de la ternarisation, c’est la compression. Des poids qui tiennent sur un peu plus d’un bit au lieu de seize, une empreinte mémoire divisée par dix, et des inférences qui peuvent tourner sur du matériel modeste. Le format 20B-A1B, lui, garde la connaissance du gros modèle tout en ne calculant qu’une fraction des paramètres à chaque token.
C’est une preview, donc prudence sur les chiffres annoncés. Mais la direction est cohérente avec le reste de la scène open-weight : les modèles de raisonnement descendent vers du matériel de plus en plus léger, et les poids ternaires sont l’une des pistes les plus agressives du moment.
Reste à voir si le raisonnement tient la route avec des poids aussi contraints. Un modèle dont chaque paramètre ne peut dire que -1, 0 ou 1, jusqu’où ça suffit ?
🔗 www.reddit.com
3. Gemma 4 on 500MB
500 Mo pour faire tourner Gemma 4. Oui, vous lisez bien. Un modèle de la génération actuelle tient dans l’équivalent d’une clé USB un peu costaude.
Le post r/LocalLLaMA montre une capture de Gemma 4 fonctionnant sur 500 MB de mémoire. Pour ceux qui suivent le local LLM, c’est un chiffre qui change la donne. Les petits modèles quantifiés tournaient déjà sur du matériel modeste, mais Gemma 4 est un modèle récent, pas un jouet de 2023.
Concrètement, on passe du GGUF classique à des formats plus agressifs comme IQ2 ou Q2_K, avec une perte de précision maîtrisée. Le secret tient aussi à l’architecture du modèle et à son entraînement, pensés pour supporter la quantification lourde sans s’effondrer.
Les implications sont nettes. Un Raspberry Pi 5, un smartphone milieu de gamme, ou un vieux PC portable peuvent faire tourner un vrai assistant local. La dépendance au cloud recule d’un cran. Pour la confidentialité, c’est un signal fort : vos conversations ne quittent plus la machine.
Reste la qualité. À ce niveau de compression, le vocabulaire et le raisonnement restent corrects, mais on sent des approximations. Pour du résumé ou du chat simple, c’est utilisable. Pour coder ou analyser, passez votre chemin.
La course ne fait que commencer. Que faudra-t-il pour voir un modèle de 70 milliards de paramètres dans 500 Mo ? Réponse dans un an, peut-être moins.
🔗 www.reddit.com
📦 Le reste de la veille
inclusionAI/Ling-3.0-flash weights are up on Hugging Face — MIT, BF16 plus an official FP8 — Les poids de Ling-3.0-flash sont dispo en MIT, avec FP8 officiel, de quoi tourner efficacement en local.
AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks? — Des agents LLM qui s’auto-améliorent en continu face à des tâches en streaming : l’évaluation indépendante ne suffit plus, place aux défis du monde réel.
GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience — Un assistant portable qui raisonne sur son historique visuel et sait quand l’utiliser en situation : la mémoire vidéo devient proactive.
MemSFT: Mitigating Alignment Tax with an External Parametric Memory — Une mémoire paramétrique externe pour adapter les LLM sans sacrifier leurs compétences générales : l’impôt d’alignement enfin réduit.
Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging — Distiller un modèle de flow quand le professeur et l’élève ne parlent pas la même langue : une méthode qui casse les barrières d’architecture et de latents.
InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis — Générer une scène 3D complète depuis une seule image avec des Gaussiennes implicites : adieu les contraintes de caméras calibrées.
GPT-OSS has turned one year old today! — Un anniversaire pour GPT-OSS, un des meilleurs modèles locaux selon la communauté, mais peu de nouveautés.
… et 80 autres articles consultés.