Les 3 articles les plus chauds de la veille du 9 août 2026. 🔥

🔥 Top 3

1. Building a zero-dependency C inference engine for BitNet (1.58-bit) - lessons from hitting 36 tok/s on a Xeon CPU

36 tokens par seconde sur un Xeon, sans GPU, sans Python, sans BLAS. Juste du C99 et make. Voilà de quoi dérouter ceux qui pensent que l’inférence d’un modèle ternaire exige un datacenter.

Un développeur a construit un moteur d’inférence CPU-only pour les modèles BitNet 1.58-bit. Les poids sont ternaires : -1, 0, 1. Plus de multiplications coûteuses, il reste des additions et des comparaisons. Le tout tourne en C99 pur, zéro dépendance. GCC et make suffisent.

Les chiffres parlent : 36 tok/s sur Xeon. Pour du code écrit à la main, sans bibliothèque optimisée, c’est un résultat solide. La quantification extrême n’est pas qu’un exercice académique. Elle change la nature du calcul.

Le choix du C n’est pas un caprice. Chaque couche d’abstraction coûte des cycles. En supprimant Python et BLAS, on garde la main sur la mémoire et le flux d’instructions. Pour du ternaire, une boucle bien écrite bat souvent un appel générique à une lib.

Les leçons à retenir : la latence mémoire domine, les prédicteurs de branchement détestent les données aléatoires, et le profilage manuel reste roi. Rien de glamour, mais ça tourne.

Reste une question : ce moteur tiendra-t-il sur un Raspberry Pi ? À 36 tok/s sur Xeon, la marge semble fine. Mais qui sait.

🔗 www.reddit.com

2. enabling PCI-E p2p for consumer Nvidia cards will yield you more than you think

Quatre GeForce 5060 Ti 16 Go dans un serveur, aucun NVLink entre elles. Et pourtant, une simple option dans le driver change tout. Le post sur r/LocalLLaMA le dit crûment : le P2P PCIe rapporte plus qu’on ne croit.

Sur les cartes grand public, Nvidia désactive le Peer-to-Peer. Les GPU communiquent alors par la RAM système, via le CPU. L’auteur du post possède un serveur EPYC à 8 canaux, avec 150 Go/s de bande passante mémoire. Un beau score. Mais il préfère utiliser le bus PCIe.

Avec vLLM et deux GPU ou plus, le tensor parallel impose des échanges constants entre les cartes. Chaque couche du modèle exige des synchronisations. En passant par le CPU, on ajoute de la latence et on occupe la mémoire hôte. En activant le P2P, les cartes s’écrivent directement sur le bus, sans intermédiaire. Les batchs passent plus vite, le débit augmente.

L’intérêt va grandir. Les GeForce gagnent en VRAM, mais ne voient toujours pas de NVLink. Le P2P par PCIe devient un palliatif sérieux pour faire tourner des modèles de 30 ou 40 milliards de paramètres en parallèle.

Le post complet promet un guide d’installation. En attendant, une question : combien de temps Nvidia va-t-il laisser ses cartes grand public performer sous leur vrai potentiel ?

🔗 www.reddit.com

3. Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay

Votre assistant numérique vous regarde travailler. Il ne retient rien. Chaque tâche répétitive, il la réapprend et la repaie en tokens, comme si vous ne l’aviez jamais faite.

Le projet Activity Frames attaque ce gaspillage à la racine. Ses auteurs ont construit un compilateur déterministe, sans aucun modèle dans la boucle. Il découpe un flux d’écran local en activity frames, des épisodes bornés avec application, site, timing, volume de saisie et pointeurs vers les données brutes. Même pipeline, même sortie, à l’octet près. Auditable mécaniquement.

Les chiffres donnent le vertige. Sur un corpus de 128 756 frames répartis sur 51 jours, une journée brute est réduite en un bloc de contexte 86 fois plus petit, compilé en 68 ms. Un agent qui lit ce bloc répond à des questions sur la journée avec 98,4% de précision, contre 66 à 80% pour un résumé LLM de la même capture. Un modèle intermédiaire atteint le niveau d’un modèle frontalier.

Le compilateur sert aussi d’instrument de mesure des coûts. Il fournit deux paramètres que les modèles économiques des agents supposent sans jamais les avoir mesurés : le Routine Overhead Ratio R, entre 60 et 343x, et la récurrence délégable, autour de 9%. Plafond réaliste de tokens pour toute une flotte : près de 8%.

Le plus fort reste à la fin. Une routine reconnue se rejoue à zéro token modèle, le LLM complètement hors du circuit, avec une correspondance vérifiée par garde-fou.

Tout est open source (MIT) : schéma, compilateur, serveur MCP, harnais d’évaluation.

Une question me taraude : si un compilateur déterministe écrit la mémoire mieux qu’un LLM, quel sera le rôle des modèles dans la mémoire agentique ? Juste l’action, plus la mémoire ?

🔗 Hugging Face

📦 Le reste de la veille