Les 3 articles les plus chauds de la veille du 2 août 2026. 🔥

🔥 Top 3

1. datasette-agent 0.4a0

Votre agent IA ne se contente plus de regarder votre Ă©cran : il met les mains dans le navigateur. La version 0.4a0 de datasette-agent introduit await context.browser_task(), une mĂ©canique qui permet aux outils d’un agent d’exĂ©cuter du JavaScript directement dans le navigateur de l’utilisateur.

Concrètement, un plugin Datasette Agent peut dĂ©sormais injecter du code custom cĂ´tĂ© client. Fini les allers-retours serveur pour chaque micro-action : l’agent manipule le DOM, clique, remplit des formulaires, ou dĂ©bugge en conditions rĂ©elles, sous vos yeux.

Simon Willison l’utilise dĂ©jĂ  pour ajouter une boucle de debug Ă  datasette-apps (0.2a0). Imaginez : vous demandez Ă  l’agent de corriger un bug d’affichage, et il ouvre la console, teste un correctif, Ă©value le rĂ©sultat… le tout en direct dans votre onglet. Prometteur, non ?

Les implications sont Ă©normes pour l’automatisation des tests et l’assistance utilisateur en temps rĂ©el. Mais ça soulève aussi des questions : qui contrĂ´le ce qui tourne dans votre navigateur ? Et si un plugin malveillant en profitait ?

La frontière entre l’agent et l’outil devient floue — et c’est exactement lĂ  que ça devient intĂ©ressant. PrĂŞt Ă  laisser un bot toucher Ă  votre DOM ?

đź”— Simon Willison

2. smevals - a small eval suite for evaluating models, prompts, and harnesses

Et si vous pouviez Ă©valuer n’importe quel modèle avec une simple commande terminal ? C’est exactement ce que propose smevals, le nouveau petit suite d’Ă©valuation dont tout le monde va parler.

Conçu avec le lab Prime Radiant, ce framework fait le job en trois commandes. D’abord, vous demandez Ă  votre agent de coder de lire la doc (uvx smevals docs), puis de vous construire une suite d’Ă©vals. Ensuite, vous lancez vos tests contre les modèles de votre choix :

uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6

La magie ? La sĂ©paration entre l’exĂ©cution et la notation. Vous collectez vos runs, puis vous les gradez avec uvx smevals grade. Enfin, vous visualisez le tout via un serveur local ou un rapport HTML statique exportable n’importe oĂą.

Le vocabulaire est ultra-clair : une eval contient des tasks (ex: “gĂ©nère un SVG de pĂ©lican Ă  vĂ©lo”), exĂ©cutĂ©es via des configs (modèle, prompts, harnesses). Un grader applique ensuite des checks, du simple test de chaĂ®ne Ă  la validation XML, ou mĂŞme des checkers custom qui font appel Ă  d’autres modèles.

Ce qui a pris le plus de temps ? Trouver les bons mots. Et c’est ce souci du dĂ©tail qui rend l’outil immĂ©diatement accessible.

Après deux itérations ratées, Simon Willison tient enfin son approche. Reste à voir : cette petite suite va-t-elle devenir le standard de facto pour évaluer rapidement vos configs ?

đź”— Simon Willison

3. Advancing the price-performance frontier with GPT‑5.6

80% de baisse sur GPT‑5.6 Luna : OpenAI vient de dynamiter le marché des modèles pas chers.

Hier, OpenAI a annoncĂ© une rĂ©duction spectaculaire : -20% sur GPT‑5.6 Terra et surtout -80% sur GPT‑5.6 Luna. RĂ©sultat : Luna passe Ă  $0,20 / million de tokens en entrĂ©e et $1,20 en sortie. C’est moins cher que le Gemini 3.1 Flash-Lite de Google, et cinq fois moins cher que Claude Haiku 4.5 d’Anthropic. La donne change sĂ©rieusement pour toutes les apps qui tournent sur des modèles low-cost.

Comment ont-ils fait ? Grâce Ă  GPT‑5.6 Sol, utilisĂ© pour optimiser… GPT‑5.6 lui-mĂŞme. Le modèle a réécrit ses propres kernels de production en Triton et Gluon, deux langages GPU open source maintenus par OpenAI. RĂ©sultat : moins de mouvements mĂ©moire, moins de synchronisations, et 20% de coĂ»ts de serving en moins Ă  l’Ă©chelle.

Le plus fou ? C’est une IA qui optimise le code qui la fait tourner. On est dans une boucle d’amĂ©lioration autonome, pas juste un coup de promo marketing.

Perso, j’ai dĂ©jĂ  migrĂ© mon site de dĂ©mo de Gemini vers Luna. Ă€ ce prix-lĂ , pourquoi rester sur autre chose ? La vraie question : combien de temps les concurrents vont-ils tenir avant de s’aligner — ou de sortir leur propre modèle qui s’auto-optimise ?

đź”— Simon Willison

📦 Le reste de la veille