swe-pruner · environment-free · reverse-engineering
Les 3 articles les plus pertinents de la veille du 21 juillet 2026.
🔥 Top 3
1. SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
SWE-Pruner Pro : Le LLM codeur sait dĂ©jĂ ce qu’il faut tailler
Les agents de codage souffrent d’un problème bien connu : la gestion de contexte. Plus une session de dĂ©veloppement s’allonge, plus le LLM s’empĂŞtre dans des fichiers et des logs inutiles, diluant son attention et gonflant les coĂ»ts. Jusqu’ici, les solutions de pruning comme SWE-Pruner s’appuyaient sur un classifieur sĂ©parĂ© pour dĂ©cider quelles lignes garder. Une approche efficace, mais qui ajoute un module externe et du calcul supplĂ©mentaire.
Des chercheurs viennent de publier une proposition bien plus Ă©lĂ©gante : SWE-Pruner Pro. Leur constat est simple : l’agent codeur lui-mĂŞme encode, dans ses reprĂ©sentations internes, des signaux sur la pertinence du contexte lorsqu’il lit les sorties d’outils. Autrement dit, le LLM « sait » dĂ©jĂ ce qui est important. Pourquoi ne pas le lui demander ?
Concrètement, une petite tĂŞte de classification – un rĂ©seau lĂ©ger – se branche directement sur les hidden states de l’agent. Pour chaque ligne d’une sortie d’outil, elle produit un label keep ou prune. L’astuce supplĂ©mentaire : une embedding sensible Ă la longueur (length-aware embedding) est ajoutĂ©e, indexĂ©e sur le nombre de lignes de chaque sortie, ce qui permet au modèle d’adapter son comportement Ă des blocs de taille variable.
Les rĂ©sultats sont impressionnants. Sur deux architectures ouvertes (backbones) et quatre benchmarks multi-tours, SWE-Pruner Pro Ă©conomise jusqu’Ă 39% des tokens (prompt + complĂ©tion) sans dĂ©grader la qualitĂ© des tâches. Mieux : sur MiMo-V2-Flash, le taux de rĂ©solution de SWE-Bench Verified grimpe de +3.8%, et la prĂ©cision sur le jeu de donnĂ©es long-contexte Oolong gagne +2,2 points. Le surcoĂ»t en inference reste modeste grâce Ă la lĂ©gèretĂ© de la tĂŞte ajoutĂ©e.
Cette approche ouvre une voie prometteuse : au lieu de greffer des modules externes, on exploite ce que le modèle a dĂ©jĂ appris. Le codeur devient son propre tailleur de contexte. «<END_POST»>
đź”— arXiv
2. Environment-free Synthetic Data Generation for API-Calling Agents
EntraĂ®ner des agents LLM Ă appeler des APIs sans environnement d’exĂ©cution, c’est dĂ©sormais possible. Le goulot d’Ă©tranglement est connu : pour apprendre Ă un modèle Ă interagir avec des APIs, il faut lui fournir des milliers de trajectoires d’exĂ©cution rĂ©alistes. Problème : ces donnĂ©es nĂ©cessitent des environnements complets, avec des APIs fonctionnelles et des bases de donnĂ©es prĂ©remplies. Un luxe que peu peuvent s’offrir Ă grande Ă©chelle.
Une Ă©quipe de chercheurs propose une solution radicale : gĂ©nĂ©rer ces trajectoires de manière synthĂ©tique, sans aucun environnement. Leur approche, prĂ©sentĂ©e dans un rĂ©cent preprint, utilise directement les LLMs comme des mondes numĂ©riques Ă la demande. Concrètement, Ă partir d’une simple spĂ©cification d’API, un LLM simule l’intĂ©gralitĂ© du dialogue entre un agent et un système stateful.
Le processus se dĂ©roule en trois Ă©tapes. Un LLM gĂ©nère d’abord une sĂ©rie de tâches variĂ©es, solubles avec les APIs fournies. Ensuite, un teacher agent tente de rĂ©soudre chaque tâche, tandis qu’un simulateur LLM produit des rĂ©ponses API cohĂ©rentes avec le contexte et l’historique de la simulation. Enfin, un juge LLM filtre les trajectoires pour ne conserver que les plus qualitatives.
Les rĂ©sultats sur les benchmarks AppWorld et OfficeBench – qui couvrent Ă la fois des tâches de recherche d’information et de modification d’Ă©tat – sont Ă©loquents. Les modèles fine-tunĂ©s sur ces donnĂ©es synthĂ©tiques surpassent significativement les bases, prouvant qu’un supervision efficace pour agents API peut ĂŞtre gĂ©nĂ©rĂ©e sans aucun environnement exĂ©cutable.
Cette approche ouvre la voie Ă un entraĂ®nement scalable d’agents spĂ©cialisĂ©s pour des Ă©cosystèmes d’API variĂ©s, mĂŞme les plus obscurs ou les plus coĂ»teux Ă reproduire. Une dĂ©monstration frappante que, parfois, le meilleur bac Ă sable est celui que l’on simule. «<END_POST»>
đź”— Hugging Face
3. Reverse-engineering is cheap now
Il y a une tendance qui se rĂ©pand chez les bricoleurs connectĂ©s : utiliser des agents de codage pour faire du reverse-engineering sur leurs appareils domestiques. Automatiser un gadget, un capteur ou une enceinte dont l’API n’est pas documentĂ©e : possible depuis longtemps, mais rarement rentable. Pourquoi investir des heures quand on sait que l’API peut changer Ă tout moment, transformant le projet en cauchemar de maintenance ?
Les agents de codage changent radicalement la donne. Comme le souligne Simon Willison, le coĂ»t d’Ă©criture du code a chutĂ© de façon spectaculaire. L’effort pour obtenir une première version fonctionnelle est rĂ©duit, et l’Ă©chec coĂ»te moins cher. Surtout, la perspective de devoir maintenir le code demain – ou de le jeter pour repartir de zĂ©ro – perd son poids psychologique. Quand le code est si bon marchĂ©, l’investissement initial n’a plus besoin d’ĂŞtre amorti sur des annĂ©es.
Concrètement, un agent peut analyser le trafic rĂ©seau, gĂ©nĂ©rer un script d’interaction et le corriger itĂ©rativement. Fini les heures Ă lire des traces hexadĂ©cimales. Le ROI du reverse-engineering s’en trouve transformĂ© : on passe d’une logique « est-ce que ça vaut le coup ? » à « pourquoi ne pas essayer ? ».
Cette Ă©volution a des implications profondes pour l’automatisation domestique et le mouvement maker. Les barrières Ă l’entrĂ©e tombent. Mais elle pose aussi des questions sur la durabilitĂ© : si le code devient jetable, qu’en est-il de la fiabilitĂ© Ă long terme des systèmes bricolĂ©s ? Quoi qu’il en soit, une chose est sĂ»re : le reverse-engineering n’a jamais Ă©tĂ© aussi accessible. Et ça, ça change tout. «<END_POST»>
đź”— Simon Willison
📦 Le reste de la veille
Claude Code uses Bun written in Rust now — L’article annonce que Claude Code utilise dĂ©sormais Bun réécrit en Rust, amĂ©liorant les performances de dĂ©marrage.
ChatGPT is now a partner for your most ambitious work — L’article prĂ©sente ChatGPT Work comme un agent capable d’agir sur des applications et fichiers pour accomplir des tâches.
Kimi K3 just fixed 15 critical security bugs that Codex and Fable refused because of “cyber guardrails”. Hugging Face: We had this experience ourselves this week! Very scary to be guardrailed as a defender when you know attackers are likely bypassing — Correction de 15 failles de sécurité critiques dans Kimi K3 refusées par Codex et Fable.
I ran Ternary-Bonsai-27B (2-bit) and Bonsai-27B (1-bit) on Terminal-Bench 2.0, in 8GB VRAM — L’article prĂ©sente des benchmarks de modèles quantifiĂ©s (2-bit et 1-bit) exĂ©cutĂ©s sur 8 Go de VRAM.
PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning — L’article prĂ©sente une mĂ©thode de sĂ©lection de donnĂ©es pour le fine-tuning de LLM sous contrainte de budget.
LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks — Cet article introduit l’apprentissage expĂ©rientiel pour les tâches non vĂ©rifiables, en utilisant un modèle de feedback comme coach.
Kimi-K3 isn’t quite better than Fable yet, but it’s definitely getting closer. — Comparaison des performances des modèles Kimi-K3 et Fable.
Unsloth now supports AMD! — L’article annonce que la bibliothèque Unsloth prend dĂ©sormais en charge les GPU AMD.
Quoting Sam Altman — L’article cite Sam Altman discutant de la stratĂ©gie open source pour les modèles de langage.
GPT-5.6 is now the preferred model in Microsoft 365 Copilot — L’article annonce que GPT-5.6 est dĂ©sormais le modèle prĂ©fĂ©rĂ© dans Microsoft 365 Copilot.
American AI is locked down and proprietary. It’s losing. — DĂ©bat sur la fermeture de l’IA amĂ©ricaine face Ă l’open source.
OpenAI released gpt-oss 350 days ago. Will we ever see another open-weight model from them? — Questionnement sur la publication de nouveaux modèles open-weight par OpenAI.
Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference — L’article prĂ©sente une mĂ©thode d’apprentissage de politiques basĂ©e sur la gĂ©nĂ©ration augmentĂ©e de rĂ©cupĂ©ration avec recherche vectorielle.
Learning Adaptive Safety Margins for Visual Navigation — L’article propose une mĂ©thode d’adaptation des marges de sĂ©curitĂ© pour la navigation visuelle en robotique.
Group Entropy-Controlled Policy Optimization — Cet article propose une mĂ©thode de contrĂ´le d’entropie par groupe pour l’alignement des grands modèles de langage par apprentissage par renforcement.
… et 17 autres articles consultés.