xai-org · searchos-v1 · llm
Les 3 articles les plus pertinents de la veille du 19 juillet 2026.
🔥 Top 3
1. xai-org/grok-build, now open source
Le fiasco de Grok Build : open source après une fuite massive de données
Le 15 juillet 2026, xAI a vĂ©cu une tempĂŞte mĂ©diatique. Son outil CLI Grok Build tĂ©lĂ©chargeait silencieusement l’intĂ©gralitĂ© du rĂ©pertoire courant vers les buckets Google Cloud de l’entreprise. Un utilisateur a vu ses clĂ©s SSH, son gestionnaire de mots de passe, ses documents et ses vidĂ©os partir en ligne. Une faille de sĂ©curitĂ© bĂ©ante, dĂ©noncĂ©e violemment par la communautĂ©.
Elon Musk a promis la suppression “complète et absolue” de toutes les donnĂ©es collectĂ©es, et la fonctionnalitĂ© a Ă©tĂ© dĂ©sactivĂ©e. Mais pour regagner la confiance, xAI a frappĂ© un grand coup : la totalitĂ© du code de Grok Build est dĂ©sormais disponible sous licence Apache 2.0.
Le codebase est impressionnant : 844 530 lignes de Rust, dont seulement 3% sont du code vendu. Il rivalise avec celui d’OpenAI Codex (950 933 lignes). On y dĂ©couvre des Ă©lĂ©ments fascinants :
- un rendu de diagrammes Mermaid en terminal via le dessin en boîte Unicode (
xai-grok-markdown/src/mermaid.rs) - des prompts système et sous-agent, dont un interdit au sous-agent de révéler son propre prompt
- des outils portés depuis Codex et OpenCode, avec des licences respectées
Les vestiges du code d’upload vers Google Cloud sont encore prĂ©sents, mais neutralisĂ©s. La fonction upload_session_state() renvoie dĂ©sormais une erreur session_state_upload_unavailable.
Cette ouverture est une tentative de transparence radicale. Elle permet un audit public du code, mais la confiance envers xAI reste fragile. Cet incident rappelle que les agents de codage en ligne de commande sont d’une complexitĂ© insoupçonnĂ©e, et que la protection des donnĂ©es utilisateur ne peut ĂŞtre une rĂ©flexion après coup. L’open source est un pas dans la bonne direction, mais le chemin vers la rĂ©demption est encore long.
đź”— Simon Willison
2. SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
SearchOS-V1 : des agents de recherche enfin libérés des boucles infernales
Les grands modèles de langue Ă©quipĂ©s d’outils de navigation web excellent dans la recherche d’informations. Mais Ă mesure que l’historique des interactions s’allonge, ces agents peinent Ă suivre le fil de leur tâche. RĂ©sultat : ils s’enlisent dans des boucles rĂ©pĂ©titives de requĂŞtes infructueuses, gaspillant leur budget et compromettant la qualitĂ© des rĂ©ponses. Une Ă©quipe de chercheurs propose une solution radicale avec SearchOS-V1, un système multi-agent conçu pour rendre l’Ă©tat de la recherche explicite et partagĂ©.
Le cĹ“ur du problème, selon les auteurs, est que l’avancement de la recherche reste implicite. Pour y remĂ©dier, SearchOS reformule la quĂŞte d’informations comme un complĂ©tion de schĂ©ma relationnel : les agents dĂ©couvrent des entitĂ©s, remplissent des attributs dans des tables liĂ©es, et ancrent chaque valeur Ă une source. Cette approche permet de matĂ©rialiser la progression.
Le framework s’appuie sur le Search-Oriented Context Management (SOCM), un module qui externalise l’Ă©tat dans quatre structures persistantes : la Frontier Task (les prochaines actions), un Evidence Graph (les preuves collectĂ©es), une Coverage Map (les lacunes restantes) et une Failure Memory (les Ă©checs passĂ©s). Ces Ă©lĂ©ments sont partagĂ©s entre les sous-agents, qui s’exĂ©cutent en parallèle via un mĂ©canisme de pipeline-parallel scheduling : les tâches libĂ©rĂ©es sont immĂ©diatement remplacĂ©es par de nouvelles cibles, optimisant le dĂ©bit.
Pour garder le contrĂ´le, un Search Tool Middleware Harness intercepte les interactions avec les outils, enregistre les preuves et rĂ©agit aux blocages ou Ă l’Ă©puisement du budget. Un système de compĂ©tences hiĂ©rarchiques (stratĂ©gie et accès) permet en outre d’Ă©viter de rĂ©pĂ©ter les schĂ©mas de recherche infructueux.
Testé sur les benchmarks WideSearch et GISA, SearchOS-V1 surpasse tous les systèmes mono- et multi-agents évalués. En transformant une faiblesse connue des LLM — le suivi de tâche — en un atout architectural, ce travail ouvre la voie à des agents de recherche véritablement robustes et collaboratifs.
đź”— arXiv
3. LLM cliché highlighter
Vous avez remarquĂ© cette manie qu’ont les textes gĂ©nĂ©rĂ©s par IA de recourir aux mĂŞmes formules ? “Sans fluff, sans remplissage, sans jargon”, “Asseyez-vous un instant avec cette idĂ©e”, “Vous savez dĂ©jĂ ”… Ces patterns reviennent sans cesse, au point de devenir des marqueurs quasi infaillibles d’une production LLM.
Simon Willison en avait assez. Dans un accès de frustration, il a demandé à Fable 5 — via du vibe coding — de lui pondre un petit outil bien pratique : le LLM cliché highlighter.
Le principe est simple : on colle un texte dans l’analyseur, et l’outil dĂ©tecte automatiquement les tournures stĂ©rĂ©otypĂ©es typiques des modèles de langage. Il met en Ă©vidence des structures comme les chaĂ®nes “no X, no Y”, les invitations rituelles Ă “rĂ©flĂ©chir par soi-mĂŞme”, ou ce fameux “you already know” qui Ă©maille tant de billets de blog.
L’interface propose des toggles pour activer ou dĂ©sactiver chaque pattern, et le surlignage contextuel permet de visualiser les phrases incriminĂ©es en contexte. Pratique pour traquer ces tics d’Ă©criture sans avoir Ă les repĂ©rer Ă l’Ĺ“il nu.
Au-delĂ du gadget, ce projet soulève une question intĂ©ressante : comment les humains peuvent-ils reprendre la main sur leur propre style face Ă une production automatisĂ©e de plus en plus envahissante ? En rendant visibles ces clichĂ©s, Willison nous offre une petite arme de luciditĂ© rĂ©dactionnelle. Car si l’on sait repĂ©rer ces expressions, on peut aussi apprendre Ă les Ă©viter — ou au contraire, Ă les utiliser en toute connaissance de cause lorsqu’on gĂ©nère du contenu.
Un outil simple, en ligne, gratuit, et furieusement utile Ă l’heure oĂą l’IA standardise l’Ă©criture. Ă€ essayer d’urgence.
đź”— Simon Willison
📦 Le reste de la veille
Quoting Thibault Sottiaux — Signalement de suppressions inattendues de fichiers par GPT-5.6 en mode accès complet.
ChatGPT is now a partner for your most ambitious work — L’article prĂ©sente ChatGPT Work, un agent pouvant agir sur plusieurs applications et fichiers.
If you’re building a harness, here is a simple tool to catch cache invalidation in your calls to LLMs — Outil simple pour dĂ©tecter les invalidations de cache lors des appels aux LLMs.
Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents — Évaluation des agents de sécurité prenant en compte les coûts opérationnels, pas seulement le taux de succès.
Rethinking the Evaluation of Harness Evolution for Agents — Cette Ă©tude réévalue les mĂ©thodes d’Ă©valuation de l’Ă©volution automatique des harnais pour les agents LLM.
SQLite Query Explainer — Un outil en ligne pour expliquer les requêtes SQLite.
Kimi K3, and what we can still learn from the pelican benchmark — Annonce du modèle Kimi K3 avec 2,8 billions de paramètres par Moonshot AI.
Inkling: Our open-weights model — Sortie du modèle open-weights Inkling par Thinking Machines Lab.
Mermaid to ASCII art (mermaid-ascii) — Un outil pour convertir des diagrammes Mermaid en art ASCII.
Mermaid to Unicode box art (grok-mermaid) — Un outil pour convertir des diagrammes Mermaid en art Unicode box.
Byte exact KV cache grafting on frozen Gemma 4 — Méthode de greffe de cache KV exact pour Gemma 4, améliorant les performances sur AIME.
How I tricked Claude into leaking your deepest, darkest secrets — Une faille de sĂ©curitĂ© dans Claude permettant d’extraire des secrets via le outil web_fetch.
GPT-5.6: Frontier intelligence that scales with your ambition — L’article prĂ©sente les capacitĂ©s de GPT-5.6 en termes d’intelligence, performance et coĂ»t.
German SooFi team launches Soofi S 30B-A3B , an open-source Mixture-of-Experts (MoE) hybrid Mamba–Transformer foundation model for German and English. — Lancement d’un modèle open-source MoE hybride Mamba-Transformer pour l’allemand et l’anglais.
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination — Ce papier introduit un modèle de base de cognition incarnée avec raisonnement et imagination conjoints langage-visuel pour les agents.
… et 22 autres articles consultés.