Les 3 articles les plus chauds de la veille du 2 août 2026. 🔥

🔥 Top 3

1. datasette-agent 0.4a0

Votre agent IA ne se contente plus de regarder votre écran : il met les mains dans le navigateur. La version 0.4a0 de datasette-agent introduit await context.browser_task(), une mécanique qui permet aux outils d’un agent d’exécuter du JavaScript directement dans le navigateur de l’utilisateur.

Concrètement, un plugin Datasette Agent peut désormais injecter du code custom côté client. Fini les allers-retours serveur pour chaque micro-action : l’agent manipule le DOM, clique, remplit des formulaires, ou débugge en conditions réelles, sous vos yeux.

Simon Willison l’utilise déjà pour ajouter une boucle de debug à datasette-apps (0.2a0). Imaginez : vous demandez à l’agent de corriger un bug d’affichage, et il ouvre la console, teste un correctif, évalue le résultat… le tout en direct dans votre onglet. Prometteur, non ?

Les implications sont énormes pour l’automatisation des tests et l’assistance utilisateur en temps réel. Mais ça soulève aussi des questions : qui contrôle ce qui tourne dans votre navigateur ? Et si un plugin malveillant en profitait ?

La frontière entre l’agent et l’outil devient floue — et c’est exactement là que ça devient intéressant. Prêt à laisser un bot toucher à votre DOM ?

🔗 Simon Willison

2. smevals - a small eval suite for evaluating models, prompts, and harnesses

Et si vous pouviez évaluer n’importe quel modèle avec une simple commande terminal ? C’est exactement ce que propose smevals, le nouveau petit suite d’évaluation dont tout le monde va parler.

Conçu avec le lab Prime Radiant, ce framework fait le job en trois commandes. D’abord, vous demandez à votre agent de coder de lire la doc (uvx smevals docs), puis de vous construire une suite d’évals. Ensuite, vous lancez vos tests contre les modèles de votre choix :

uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6

La magie ? La séparation entre l’exécution et la notation. Vous collectez vos runs, puis vous les gradez avec uvx smevals grade. Enfin, vous visualisez le tout via un serveur local ou un rapport HTML statique exportable n’importe où.

Le vocabulaire est ultra-clair : une eval contient des tasks (ex: “génère un SVG de pélican à vélo”), exécutées via des configs (modèle, prompts, harnesses). Un grader applique ensuite des checks, du simple test de chaîne à la validation XML, ou même des checkers custom qui font appel à d’autres modèles.

Ce qui a pris le plus de temps ? Trouver les bons mots. Et c’est ce souci du détail qui rend l’outil immédiatement accessible.

Après deux itérations ratées, Simon Willison tient enfin son approche. Reste à voir : cette petite suite va-t-elle devenir le standard de facto pour évaluer rapidement vos configs ?

🔗 Simon Willison

3. Advancing the price-performance frontier with GPT‑5.6

80% de baisse sur GPT‑5.6 Luna : OpenAI vient de dynamiter le marché des modèles pas chers.

Hier, OpenAI a annoncé une réduction spectaculaire : -20% sur GPT‑5.6 Terra et surtout -80% sur GPT‑5.6 Luna. Résultat : Luna passe à $0,20 / million de tokens en entrée et $1,20 en sortie. C’est moins cher que le Gemini 3.1 Flash-Lite de Google, et cinq fois moins cher que Claude Haiku 4.5 d’Anthropic. La donne change sérieusement pour toutes les apps qui tournent sur des modèles low-cost.

Comment ont-ils fait ? Grâce à GPT‑5.6 Sol, utilisé pour optimiser… GPT‑5.6 lui-même. Le modèle a réécrit ses propres kernels de production en Triton et Gluon, deux langages GPU open source maintenus par OpenAI. Résultat : moins de mouvements mémoire, moins de synchronisations, et 20% de coûts de serving en moins à l’échelle.

Le plus fou ? C’est une IA qui optimise le code qui la fait tourner. On est dans une boucle d’amélioration autonome, pas juste un coup de promo marketing.

Perso, j’ai déjà migré mon site de démo de Gemini vers Luna. À ce prix-là, pourquoi rester sur autre chose ? La vraie question : combien de temps les concurrents vont-ils tenir avant de s’aligner — ou de sortir leur propre modèle qui s’auto-optimise ?

🔗 Simon Willison

📦 Le reste de la veille