7 minutes
vectimus · long-horizon · mcp-compatible
Les 3 articles les plus pertinents de la veille du 14 juillet 2026.
đ„ Top 3
1. Show HN: Vectimus â Cedar policy enforcement for AI coding agents
Les agents IA de codage et les frameworks agentiques exĂ©cutent des commandes shell, Ă©crivent des fichiers, installent des packages et appellent des API. Sans couche de gouvernance, chaque agent dĂ©ployĂ© devient un compte de service non surveillĂ© avec accĂšs Ă la production et aucune piste dâaudit. Vectimus rĂ©pond Ă ce problĂšme via lâapplication de politiques Cedar pour chaque action dâagent, avec une Ă©valuation sous 10 ms et zĂ©ro configuration.
Lâinstallation est immĂ©diate : pipx install vectimus puis vectimus init. Les politiques Cedar Ă©valuent chaque appel dâoutil, quâil sâagisse dâun agent en terminal ou dâun framework en production. Onze packs couvrent les menaces : opĂ©rations destructives (rm -rf, terraform destroy), secrets, chaĂźne dâapprovisionnement (npm publish), infrastructure, exĂ©cution de code, exfiltration, intĂ©gritĂ© des fichiers, base de donnĂ©es, sĂ©curitĂ© Git, sĂ©curitĂ© MCP et gouvernance des agents. Chaque politique est liĂ©e Ă un incident rĂ©el, comme la Clinejection (fĂ©vrier 2026) oĂč une injection de prompt dans un titre dâissue GitHub a compromis 4 000 machines en 8 heures, ou lâincident terraform destroy ayant rasĂ© une VPC de production.
Les rĂšgles sont annotĂ©es avec @incident et @controls pour un mapping direct vers les frameworks de conformitĂ© : OWASP Agentic Top 10, SOCâŻ2, NIST AI RMF, NIST CSFâŻ2.0, ISOâŻ27001 et EU AI Act. DerriĂšre, un pipeline de trois agents IA â chasseur de menaces, ingĂ©nieur sĂ©curitĂ© et analyste â rĂ©dige et teste les politiques, chaque PR Ă©tant revue par un humain. Les mises Ă jour sont poussĂ©es automatiquement chaque jour.
Avec lâintĂ©gration de Claude Code, Cursor, GitHub Copilot, Gemini CLI et Codex CLI (expĂ©rimental), Vectimus sâimpose comme une couche dĂ©fensive dĂ©terministe, indĂ©pendante des permissions traditionnelles. Pour les Ă©quipes dĂ©ployant des agents en production, câest un filet de sĂ©curitĂ© immĂ©diat et documentĂ©.
đ GitHub
2. Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Les agents IA butent sur lâhorizon long : le nouveau benchmark qui rĂ©vĂšle leurs limites
Ăvaluer un agent sur une tĂąche qui dure quelques minutes et ne juger que le rĂ©sultat final ne suffit plus. Les benchmarks terminaux classiques, avec leur signal de rĂ©compense Ă©pars, donnent une image trompeuse des capacitĂ©s rĂ©elles des modĂšles. Pour y remĂ©dier, des chercheurs dĂ©voilent Long-Horizon-Terminal-Bench, un ensemble de 46 tĂąches conçues pour pousser les agents dans leurs retranchements.
Ce nouveau banc dâessai couvre 9 catĂ©gories exigeantes : reproduction dâexpĂ©riences, gĂ©nie logiciel, analyse multimodale, jeux interactifs, calcul scientifique⊠Chaque tĂąche suit le format Terminal-Bench avec une solution de rĂ©fĂ©rence, mais est dĂ©composĂ©e en sous-tĂąches finement Ă©valuĂ©es. Cette approche permet dâattribuer des rĂ©compenses denses et du crĂ©dit partiel, mesurant non seulement la rĂ©ussite finale mais aussi la progression dans des workflows ouverts.
Le niveau dâexigence est radical. Une tĂąche requiert en moyenne 9,9 millions de tokens, 231 Ă©pisodes et 85 minutes dâexĂ©cution par run. De quoi solliciter la planification long terme, la gestion de longs contextes et le dĂ©bogage itĂ©ratif, bien loin du « one-shot » des benchmarks traditionnels.
Les rĂ©sultats montrent lâampleur du dĂ©fi : le meilleur modĂšle testĂ© atteint Ă peine 15,2 % de succĂšs Ă un seuil de rĂ©compense partielle de 0,95, et 10,9 % pour une note parfaite. La moyenne des taux de rĂ©ussite plonge Ă 4,3 % et 1,7 % respectivement. MĂȘme les modĂšles les plus avancĂ©s peinent Ă enchaĂźner les Ă©tapes sur la durĂ©e.
Cette marge dâamĂ©lioration considĂ©rable est une mine dâor pour la recherche. Les auteurs publient les donnĂ©es de performance, les modes dâĂ©chec identifiĂ©s et le benchmark lui-mĂȘme, appelant la communautĂ© Ă repousser les limites des agents dits « long horizon ». Un pas nĂ©cessaire vers des systĂšmes capables de mener Ă bien des projets complexes et multi-Ă©tapes en autonomie.
đ Hugging Face
3. Show HN: MCP-compatible distributed RPC layer for AI agents
Les dĂ©veloppeurs qui construisent des agents IA le savent bien : orchestrer des appels d’outils Ă distance reste un casse-tĂȘte technique. Une nouvelle solution, dĂ©voilĂ©e sur Hacker News, promet de simplifier cette complexitĂ© avec une couche RPC distribuĂ©e compatible avec le protocole MCP.
Le problĂšme est familier : quand un agent LLM doit interagir avec des outils externes, chaque appel implique une nĂ©gociation de contexte, une sĂ©rialisation et une gestion des erreurs qui deviennent rapidement ingĂ©rables Ă l’Ă©chelle. Les implĂ©mentations actuelles souffrent de latence, de couplage fort et d’une difficultĂ© Ă maintenir la cohĂ©rence entre les nĆuds.
L’approche proposĂ©e s’appuie sur une architecture de middleware RPC qui encapsule les appels d’outils dans un format standardisĂ©. Le protocole MCP (Model Context Protocol) sert de colonne vertĂ©brale, garantissant une interopĂ©rabilitĂ© entre les diffĂ©rents agents et services. ConcrĂštement, cela permet Ă un agent de invoquer une fonction distante comme s’il s’agissait d’un appel local, avec une gestion transparente de la sĂ©rialisation et du routage.
Les implications techniques sont notables : réduction de la charge cognitive sur les développeurs, meilleure scalabilité horizontale grùce à une distribution native, et possibilité de composer des workflows complexes sans réinventer la roue à chaque fois. La couche gÚre également la découverte de services et la tolérance aux pannes, des aspects critiques pour des systÚmes en production.
Cette initiative rĂ©pond Ă un besoin croissant dans la communautĂ© : standardiser les interactions entre agents et outils dans un environnement distribuĂ©. En rendant le RPC compatible avec MCP, elle ouvre la voie Ă des Ă©cosystĂšmes d’agents plus modulaires et interopĂ©rables. Un pas de plus vers une infrastructure oĂč les LLM ne sont plus de simples API, mais des acteurs Ă part entiĂšre dans des systĂšmes rĂ©partis.
đ agentrpc.com
đŠ Le reste de la veille
Show HN: Sentience â Semantic Visual Grounding for AI Agents (WASM and ONNX) â PrĂ©sentation de Sentience, un runtime d’automatisation de navigateur pour agents LLM utilisant le grounding visuel sĂ©mantique avec WASM et ONNX.
J-Wash: A novel way to brainwash and customize large language models based on Anthropic’s Jacobian-Lens! â PrĂ©sentation de J-Wash, une mĂ©thode originale pour modifier les modĂšles de langage basĂ©e sur le Jacobian-Lens d’Anthropic.
llm-meta-ai 0.1 â Publication de la version 0.1 du plugin llm-meta-ai pour exĂ©cuter des requĂȘtes via le modĂšle muse-spark-1.1.
Browser Agent Benchmark: Comparing LLM models for web automation â Benchmark comparant diffĂ©rents modĂšles LLM pour l’automatisation web par agents.
Show HN: Agentic Metric â top for your AI coding agents (token, cost tracking) â Agentic Metric est un outil de suivi des tokens et des coĂ»ts pour les agents de codage IA.
KronQ: LLM Quantization via Kronecker-Factored Hessian â MĂ©thode de quantification des LLM utilisant une hessienne factorisĂ©e par Kronecker.
Using uvx in GitHub Actions in a cache-friendly way â Article expliquant comment utiliser uvx de maniĂšre compatible avec le cache dans les workflows GitHub Actions.
datasette code-frequency chart on GitHub â Analyse de la frĂ©quence de code du projet Datasette sur GitHub pour illustrer l’impact des agents de codage.
shot-scraper 1.11 â Notes de version de shot-scraper 1.11 avec des amĂ©liorations mineures.
Rewriting Bun in Rust â Annonce de la réécriture de Bun, initialement en Zig, en Rust.
Clara â Open-Source Local AI Workspace with LLMs, Agents, Automation, and Images â PrĂ©sentation de Clara, un espace de travail local open-source intĂ©grant LLMs, agents, automatisation et images.
Show HN: Gh-PR-review, inline PR comments for GitHub CLI â Extension pour GitHub CLI permettant de visualiser et interagir avec les commentaires de revue de pull request.
Show HN: Agentic Docs Templates, keep AI coding agents disciplined â Un outil proposant des modĂšles de documentation pour discipliner les agents de codage IA.
Apple M7 Ultra Chip Planned With Up to 1.5 TB of Unified Memory â Annonce du projet de puce Apple M7 Ultra avec jusqu’Ă 1,5 To de mĂ©moire unifiĂ©e.
DOOMQL â Projet utilisant SQLite comme moteur de jeu pour DOOM, construit avec GPT-5.6.
⊠et 22 autres articles consultés.