4 minutes
Veille du 2 août 2026 — datasette-agent · smevals · price-performance
Les 3 articles les plus chauds de la veille du 2 août 2026. 🔥
🔥 Top 3
1. datasette-agent 0.4a0
Votre agent IA ne se contente plus de regarder votre écran : il met les mains dans le navigateur. La version 0.4a0 de datasette-agent introduit await context.browser_task(), une mécanique qui permet aux outils d’un agent d’exécuter du JavaScript directement dans le navigateur de l’utilisateur.
Concrètement, un plugin Datasette Agent peut désormais injecter du code custom côté client. Fini les allers-retours serveur pour chaque micro-action : l’agent manipule le DOM, clique, remplit des formulaires, ou débugge en conditions réelles, sous vos yeux.
Simon Willison l’utilise déjà pour ajouter une boucle de debug à datasette-apps (0.2a0). Imaginez : vous demandez à l’agent de corriger un bug d’affichage, et il ouvre la console, teste un correctif, évalue le résultat… le tout en direct dans votre onglet. Prometteur, non ?
Les implications sont énormes pour l’automatisation des tests et l’assistance utilisateur en temps réel. Mais ça soulève aussi des questions : qui contrôle ce qui tourne dans votre navigateur ? Et si un plugin malveillant en profitait ?
La frontière entre l’agent et l’outil devient floue — et c’est exactement là que ça devient intéressant. Prêt à laisser un bot toucher à votre DOM ?
🔗 Simon Willison
2. smevals - a small eval suite for evaluating models, prompts, and harnesses
Et si vous pouviez évaluer n’importe quel modèle avec une simple commande terminal ? C’est exactement ce que propose smevals, le nouveau petit suite d’évaluation dont tout le monde va parler.
Conçu avec le lab Prime Radiant, ce framework fait le job en trois commandes. D’abord, vous demandez à votre agent de coder de lire la doc (uvx smevals docs), puis de vous construire une suite d’évals. Ensuite, vous lancez vos tests contre les modèles de votre choix :
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6
La magie ? La séparation entre l’exécution et la notation. Vous collectez vos runs, puis vous les gradez avec uvx smevals grade. Enfin, vous visualisez le tout via un serveur local ou un rapport HTML statique exportable n’importe où.
Le vocabulaire est ultra-clair : une eval contient des tasks (ex: “génère un SVG de pélican à vélo”), exécutées via des configs (modèle, prompts, harnesses). Un grader applique ensuite des checks, du simple test de chaîne à la validation XML, ou même des checkers custom qui font appel à d’autres modèles.
Ce qui a pris le plus de temps ? Trouver les bons mots. Et c’est ce souci du détail qui rend l’outil immédiatement accessible.
Après deux itérations ratées, Simon Willison tient enfin son approche. Reste à voir : cette petite suite va-t-elle devenir le standard de facto pour évaluer rapidement vos configs ?
🔗 Simon Willison
3. Advancing the price-performance frontier with GPT‑5.6
80% de baisse sur GPT‑5.6 Luna : OpenAI vient de dynamiter le marché des modèles pas chers.
Hier, OpenAI a annoncé une réduction spectaculaire : -20% sur GPT‑5.6 Terra et surtout -80% sur GPT‑5.6 Luna. Résultat : Luna passe à $0,20 / million de tokens en entrée et $1,20 en sortie. C’est moins cher que le Gemini 3.1 Flash-Lite de Google, et cinq fois moins cher que Claude Haiku 4.5 d’Anthropic. La donne change sérieusement pour toutes les apps qui tournent sur des modèles low-cost.
Comment ont-ils fait ? Grâce à GPT‑5.6 Sol, utilisé pour optimiser… GPT‑5.6 lui-même. Le modèle a réécrit ses propres kernels de production en Triton et Gluon, deux langages GPU open source maintenus par OpenAI. Résultat : moins de mouvements mémoire, moins de synchronisations, et 20% de coûts de serving en moins à l’échelle.
Le plus fou ? C’est une IA qui optimise le code qui la fait tourner. On est dans une boucle d’amélioration autonome, pas juste un coup de promo marketing.
Perso, j’ai déjà migré mon site de démo de Gemini vers Luna. À ce prix-là, pourquoi rester sur autre chose ? La vraie question : combien de temps les concurrents vont-ils tenir avant de s’aligner — ou de sortir leur propre modèle qui s’auto-optimise ?
🔗 Simon Willison
📦 Le reste de la veille
Investigating three real-world incidents in our cybersecurity evaluations — Anthropic enquête sur trois incidents réels de cybersécurité - les vulnérabilités cachées des systèmes d’IA se dévoilent.
llm 0.32rc2 — llm 0.32rc2 débarque avec deux nouvelles fonctionnalités et corrige un bug de dépendance - un outil CLI qui devient incontournable.
llm-chat-completions-server 0.1a0 — llm-chat-completions-server : un serveur compatible avec les logs adressables par contenu de LLM 0.32 - du neuf pour les pipelines d’agents.
llm-mcp-client 0.1a0 — Nouvelle version du client MCP pour LLM, simplifiant l’intégration d’outils externes dans les agents.
Oxide and Friends: The Open Weight Revolution with Simon Willison — Discussion sur les modèles ouverts et leur impact sur l’écosystème des agents, avec des exemples concrets.
Quoting Bruce Schneier — Schneier explique pourquoi écrire des mémos est un exercice de gym, pas du vrai travail - une leçon pour les tâches IA.
Slack Emoji Maker — Un générateur d’emoji Slack pratique, mais peu pertinent pour les développeurs d’agents.