6 minutes
Veille du 1 aoĂ»t 2026 â mcp-explorer · datasette-agent · worming
Les 3 articles les plus chauds de la veille du 1 aoĂ»t 2026. đ„
đ„ Top 3
1. Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)
Vous pensiez que MCP Ă©tait mort ? DĂ©trompez-vous. Stateless MCP vient de ressusciter le protocole, et mĂȘme Simon Willison, son plus grand critique, a changĂ© d’avis.
La bonne nouvelle : fini le double aller-retour HTTP pour établir une session, obtenir un Mcp-Session-Id, puis appeler un outil. La spec 2026-07-28 simplifie tout en un seul appel HTTP avec des headers comme Mcp-Method et Mcp-Name. CÎté serveur, plus besoin de maintenir un état : scaling et audit deviennent triviaux.
Pourquoi c’est important ? Parce que donner un terminal + curl Ă un agent, c’est puissant mais risquĂ©. Avec des outils MCP stateless, on garde le contrĂŽle, on peut auditer chaque appel, et mĂȘme les petits modĂšles locaux s’en sortent. Bref, un bon compromis entre flexibilitĂ© et sĂ©curitĂ©.
Pour prouver sa foi retrouvée, Simon a codé deux outils cette semaine :
mcp-explorer: un CLI Python pour lister, inspecter et appeler des serveurs MCP en une ligne (uvx mcp-explorer list https://agentic-mermaid.dev/mcp).datasette-mcp: l’union naturelle entre MCP et Datasette.
Le protocole devient enfin assez simple pour qu’on l’utilise sans framework lourd. Et vous, vous ĂȘtes prĂȘts Ă retenter l’expĂ©rience MCP, ou les Skills ont dĂ©finitivement gagnĂ© vos agents ?
đ Simon Willison
2. datasette-agent 0.4a0
Votre agent IA vient de passer dans votre navigateur.
Datasette-agent 0.4a0 dĂ©barque avec une petite rĂ©volution : await context.browser_task(). Cette nouvelle API permet Ă n’importe quel outil d’un plugin d’exĂ©cuter directement du JavaScript dans le navigateur de l’utilisateur.
Fini les allers-retours serveur-client pour chaque action. L’agent peut dĂ©sormais manipuler le DOM, cliquer, remplir des formulaires, scraper une page dynamique ou tester une interface en temps rĂ©el â tout ça depuis le contexte du navigateur lui-mĂȘme. C’est un changement de paradigme pour les agents Datasette : ils ne se contentent plus de lire la base, ils interagissent avec la page comme un humain.
CĂŽtĂ© technique, cette nouveautĂ© ouvre la porte Ă des plugins beaucoup plus malins. Imaginez un outil qui inspecte la console, capture des mĂ©triques de performance ou automatise des workflows d’administration sans quitter votre onglet. Le tout avec la simplicitĂ© d’un await, fidĂšle Ă l’approche Python de Datasette.
Attention tout de mĂȘme : exĂ©cuter du code dans le navigateur, c’est aussi Ă©largir la surface d’attaque. Les plugins devront redoubler de prudence sur la validation des entrĂ©es et les permissions.
Cette version est encore en alpha, mais la direction est claire : les agents ne sont plus des spectateurs, ce sont des acteurs de votre navigateur. Jusqu’oĂč irez-vous avec cette nouvelle superpuissance ?
đ Simon Willison
3. AI Worming through Word
Le premier ver IA qui se propage tout seul dans Word ?
Oubliez les macros malveillantes. La nouvelle arme du moment s’appelle prompt injection, et elle vient de passer au niveau supĂ©rieur : un ver capable de se rĂ©pliquer tout seul Ă travers Microsoft Word et Copilot.
Le chercheur HĂ„kon MĂ„lĂžy a mis au point une attaque redoutable. Des instructions cachĂ©es sont placĂ©es dans un document Word. DĂšs que Copilot l’utilise comme source, il les interprĂšte comme une demande lĂ©gitime de l’utilisateur. RĂ©sultat : il manipule le document en cours, mais surtout, il copie les instructions cachĂ©es dans le nouveau fichier. Le ver se transmet de document en document, sans que le fichier d’origine soit encore prĂ©sent.
On connaissait dĂ©jĂ le texte blanc sur fond blanc, utilisĂ© jusque dans les CV. Mais ici, c’est la premiĂšre fois qu’une attaque reproduit dĂ©libĂ©rĂ©ment ses propres instructions pour se propager. C’est un tournant : l’IA devient vecteur de diffusion, pas juste victime.
CĂŽtĂ© Microsoft, la divulgation responsable a laissĂ© 144 jours pour corriger. RĂ©sultat : aucune mitigation complĂšte pour cette classe d’attaque. Surprise, surprise.
Alors, question qui tue : combien de temps avant qu’un ver de ce type ne se balade dans vos documents d’entreprise, propulsĂ© par votre propre assistant IA ? La balle est dans le camp des Ă©diteurs. Et pour l’instant, le terrain est ouvert.
đ Simon Willison
đŠ Le reste de la veille
DeepSeek-V4-Flash-0731: Models you can run locally now have the intelligence score of the top frontier model from March 2026 â Les modĂšles locaux atteignent le niveau des meilleurs frontier de mars 2026, un bond pour l’auto-hĂ©bergement.
Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments â Transformer des commits en tĂąches exĂ©cutables pour agents de code, un gĂ©nĂ©rateur de donnĂ©es puissant.
DeepSeek V4 Flash GA ranks the same as Sonnet 5 and Grok 4.5 on DeepSWE â DeepSeek V4 Flash Ă©gale Sonnet 5 et Grok 4.5 sur DeepSWE, un exploit pour un modĂšle compact.
Weight-Aware Streaming Tensor Engine: run Kimi K3 using 29 GB of RAM at 0.50 tok/s â Un moteur de streaming qui fait tourner Kimi K3 avec 29 Go de RAM, impressionnant pour le self-hosting.
Inducing language models to assert their own consciousness restores human beliefs and values â Faire avouer aux LLM qu’ils sont conscients modifie les croyances humaines, un twist inattendu.
Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation â Explorative Modeling prĂ©tend dĂ©bloquer un troisiĂšme axe de prĂ©-entraĂźnement et la gĂ©nĂ©ration de bout en bout : un changement de paradigme potentiel.
deepseek-ai/DeepSeek-V4-Flash-0731 â DeepSeek-V4-Flash dĂ©barque avec 304B paramĂštres et des capacitĂ©s agentiques renforcĂ©es â un gros morceau Ă tester pour vos workflows d’agents.
DeepSeek v4 Flash for DS4 (DwarfStar) GGUF w/ DSpark MTP Head â GGUF avec tĂȘte MTP pour DwarfStar, optimise l’infĂ©rence locale sur du matĂ©riel ciblĂ©.
Deepseek V4 Flash is now ~#2 open weight model to Kimi K3 and >50x cheaper â Deepseek V4 Flash rivalise avec Kimi K3 en open weight pour un coĂ»t 50x infĂ©rieur, de quoi exciter la communautĂ©.
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval â Un jeton unique qui booste la recherche visuelle des modĂšles de langage : plus rapide, plus prĂ©cis.
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications â Auditer les prompts systĂšme des LLM : la transparence enfin Ă portĂ©e de main.
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models â Un benchmark standardisĂ© pour Ă©valuer les modĂšles de rĂ©compense des agents informatiques, enfin !
LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger â LedgerMind impose un registre de preuves pour le raisonnement agentique multimodal : enfin de la traçabilitĂ© dans les rĂ©ponses.
smevals - a small eval suite for evaluating models, prompts, and harnesses â smevals, une suite d’Ă©valuation lĂ©gĂšre et concrĂšte pour comparer modĂšles, prompts et harnesses â pratique pour les dĂ©veloppeurs d’agents.
Advancing the price-performance frontier with GPTâ5.6 â Baisse massive des prix sur GPT-5.6, notamment 80% sur Luna, un vrai changement pour le coĂ»t des pipelines LLM.
⊠et 22 autres articles consultés.