4 minutes
Veille du 22 septembre 2026 — system · open-source · multi-horizon
Les 3 articles les plus chauds de la veille du 22 septembre 2026. 🔥
🔥 Top 3
1. Jev introduces a new shape of LLM - System One, aka Decision Models
Jev: le LLM qui ne renvoie que des chiffres, et c’est génial (et flippant).
TypeSafe AI vient de lancer Jev, un modèle qui rompt avec le format classique des LLM. Il accepte du texte en entrée, mais ne produit jamais de texte en sortie. À la place, il renvoie des nombres flottants qui répondent à des questions précises, avec un score de confiance. Leur Pitch: une “fonction d’appel à intelligence frontalière”.
Concrètement, vous lui soumettez un texte (un article, un profil client) et une ou plusieurs questions. Trois types de questions sont possibles. Les questions Noul (pour Bernoulli) pour des réponses Vrai/Faux. Les questions de Choix, où le modèle sélectionne la meilleure option parmi celles que vous fournissez. Et les questions de Score, qui évaluent une situation sur une échelle définie.
Le modèle est incroyablement rapide et pas cher. L’entrée coûte 0,042 $ par million de tokens, moins que le GPT-5 Nano d’OpenAI. La sortie est totalement gratuite. Vous pouvez poser des dizaines de questions sur un même texte, et il les traite en parallèle.
C’est un outil puissant pour toute tâche de classification: détecter du spam, étiqueter du contenu, hiérarchiser des résultats de recherche. Jev excelle par exemple à reranker une centaine de documents pour pertinence.
C’est aussi un retour en force des boîtes noires. Contrairement à un LLM classique, Jev ne donne aucune explication. Vous recevez juste un chiffre. Si le modèle juge une candidature “non pertinente”, vous ne saurez jamais quel biais l’a conduit à cette décision. Une expérience a montré qu’il classait Cupertino comme “bonne ville” et East Palo Alto au dernier rang. Un signal d’alerte pour tout usage en contexte sensible.
La communauté a déjà détourné Jev pour créer un chatbot approximatif ou même jouer à 2048. Des versions en poids ouvert existent déjà, avec des modèles comme Kev basés sur Qwen 3.5. La vraie question est de savoir si cette spécialisation extrême, à bas coût, redéfinira nos pipelines ou simplement ajoutera une brique supplémentaire à notre boîte à outils de classification.
🔗 Simon Willison
2. Clara – Open-Source Local AI Workspace with LLMs, Agents, Automation, and Images
ClaraVerse ne ressemble pas à vos interfaces AI habituelles. C’est un espace de travail local qui place trois éléments au centre : des agents qui collaborent comme une équipe, une mémoire qui fonctionne réellement, et une licence open-source qui ne vous facturera pas au moment où votre projet décolle.
Le cœur du système est le mode “Crew”. Vous lancez une mission, une équipe d’agents l’exécute sous votre supervision. Chaque résultat passe par votre validation avant d’aller plus loin. Pas de boîte noire.
La mémoire est particulièrement bien pensée. Les faits sont extraits automatiquement et rangés en deux catégories. Les “épinglés” (votre allergies, vos contraintes techniques) sont toujours injectés. Les autres sont récupérés par similarité sémantique, ce qui signifie que l’IA se souvient de vous au fur et à mesure sans le répéter. Les informations inutilisées s’archivent avec le temps. Le tout est chiffré locally.
Techniquement, c’est un seul conteneur Docker. ClaraVerse détecte automatiquement vos modèles locaux via Ollama ou LM Studio. Zéro configuration. Vous pouvez aussi pointer vers les API d’OpenAI, Claude ou Gemini.
Un projet qui pourrait bien redéfinir ce qu’on attend d’un assistant AI personnalisé en entreprise. Qui, dans votre équipe, sera le premier à tester une telle base privée ?
🔗 GitHub
3. GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
5 000 heures de gameplay AAA analysées pour entraîner des IA plus performantes. Un nouveau projet de recherche met en lumière un outil massif pour évaluer comment les modèles maîtrisent les actions à court et long terme dans les jeux.
Les jeux vidéo offrent un terrain de test complet pour l’IA, combinant vision par ordinateur, planification et contrôle précis. Les jeux de données existants sont souvent restreints à quelques titres, manquent d’instructions textuelles, ou utilisent des tests en ligne trop aléatoires.
Le GameHorizon Suite unifie la solution. Il comprend un annotateur automatisé qui génère des consignes multi-horizons, c’est-à-dire des ordres pour des actions immédiates et des objectifs futurs. La base GameHorizon-Data compile ensuite 5 000 heures d’enregistrements de 21 jeux AAA, filmés par 100 joueurs experts.
Le benchmark GameHorizon-Bench évalue ensuite les performances. Les chercheurs ont testé 47 modèles via plus d’un million d’invocations, et ils observent une hiérarchie claire de la difficulté des tâches, avec des écarts marqués entre les capacités des différents modèles.
Cette standardisation pourrait devenir la référence pour comparer les IA dans les jeux complexes. Avec la publication prochaine des outils, jusqu’où ira la prochaine génération de modèles capables de jouer comme des humains ?
🔗 arXiv
📦 Le reste de la veille
- Advisory Group on Mathematics and Artificial Intelligence — OpenAI forme un groupe consultatif sur les mathématiques et l’IA pour guider la révision des résultats émergents en IA.