Les 3 articles les plus chauds de la veille du 1 octobre 2026. 🔥

🔥 Top 3

1. Disrupting a coordinated model-distillation campaign

Copier un modèle par la porte de sortie, c’est un vieux tour. Faire courir un réseau entier de comptes sur un même modèle pour en extraire la “chaîne de raisonnement”, ça c’est nouveau. C’est exactement ce qu’OpenAI dit avoir démantelé : une campagne coordonnée visant à reproduire les capacités de raisonnement de ses modèles, et les réponses internes qui l’accompagnent.

De quoi s’agit-il ? La distillation, c’est l’opération classique de machine learning qui consiste à entraîner un modèle petit sur les sorties d’un modèle grand. Résultat : un clone plus rapide et moins cher. Pratique quand on le fait soi-même. Gênant quand c’est fait, massivement et de façon organisée, sur les raisonnements protégés d’un concurrent.

La “distillation adversariale”, elle, consiste à interroger un modèle avec des centaines de milliers de requêtes bien calibrées, souvent via des comptes multiples, pour en cartographier les zones de savoir-faire et reconstruire un équivalent. Le raisonnement affiché par le modèle devient la matière première.

OpenAI n’a pas communiqué les noms des acteurs, mais décrit des stratégies d’évasion : requêtes dissimulées dans des textes apparemment innocents, contournement des filtres, comportements anormaux sur un ensemble de comptes. L’éditeur annonce renforcer la détection et les barrières de sortie, y compris sur les traces de raisonnement.

Reste la tension structurelle : ouvrir le raisonnement, c’est ce qui rend les modèles utiles et auditable. Le fermer par trop, c’est affaiblir cette même utilité. Jusqu’o les éditeurs devront-ils masquer leurs modèles pour les défendre ?

🔗 OpenAI

2. Least to most expensive (Somewhat modern) GPU’s with 32gb of vram (Under $1600) Based on ebay listings

Petit rappel de vocabulaire avant de descendre la liste. La VRAM est la mémoire dédiée du GPU, celle où vit le modèle pendant son inférence. Trop peu de VRAM, et le modèle ne rentre pas ou ralentit à cause des va-et-vient avec la RAM classique. Un LLM de 14 milliards de paramètres en 4 bits demande environ 9 Go, un modèle de 70 milliards en 8 bits en dépasse 40. Avec 32 Go, on tape dans le large.

Le point surprenant de ce classement : ce sont surtout des cartes d’occasion de datacenter qui dominent, pas des cartes gaming. Le marché de l’occasion est devenu une source sérieuse de VRAM à bas prix, avec quelques compromis.

À l’entrée de gamme, on trouve du vieux fer d’occasion et des cartes d’ancienne génération. Puis viennent les modèles MI100 d’AMD (32 Go de mémoire haute bande passante, à traiter avec l’écosystème ROCm plutôt qu’avec CUDA) et les V100S 32 Go de NVIDIA, qui datent mais restent solides pour l’inférence.

En haut de liste, une carte à 48 Go comme l’A40 dépasse le cadre des 32 Go, mais les prix d’occasion la collent dans la fourchette. Un mot sur les contraintes : ces cartes datacenter n’ont pas de sortie vidéo, consomment beaucoup et aiment les serveurs avec un système de refroidissement imposant.

Les vraies cartes gaming neuves avec 32 Go de VRAM ? Elles n’existent pas encore dans ce budget. Si ce n’est pas avant l’année prochaine, il faudra faire le choix entre attendre ou bricoler avec de l’occasion.

🔗 www.reddit.com

3. Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

Un modèle médical peut afficher 90 % d’accuracy et être totalement inutile en clinique. C’est le point de départ d’une étude sur la diagnosis multimodale par grands modèles de langue : face à des maladies rares, le prédit de toujours annoncer “sain” suffit à obtenir un score flatteur.

L’équipe change donc la métrique. Elle passe à l’AUROC, qui classe les patients malades au-dessus des patients sains sans dépendre du seuil de décision ni de la proportion de cas. Concrètement, cette métrique mesure la capacité du modèle à ranger correctement les cas, pas à les catégoriser brut.

Le vrai problème est technique. Les méthodes d’optimisation du prompt, comme GEPA, choisissent un nouveau prompt en moyennant la bonne ou la mauvaise réponse de chaque exemple. Cette moyenne est de l’accuracy. L’équipe remplace chaque ligne de “bonne réponse” par une comparaison par paires : un patient positif ou un patient négatif, lequel le modèle classe plus haut ? La moyenne sur ces paires redevient l’AUROC, sans appel de modèle supplémentaire.

Sur le jeu de données MIMIC, ce changement fait basculer les résultats. Optimisé sur la précision, le prompt peut dégrader le classement. L’approche appelée Ranking-PE le corrige : +5,8 points d’AUROC sur Qwen3-VL-8B, +16,2 points sur MedGemma-4B.

L’ablation ennuie les optimistes : aucun raffinage de prompt ne remplace un backbone visuel médical, préentraîné ou affiné pour la vision médicale. La question qui reste ouverte est simple : quels modèles cliniques utiliseront enfin l’AUROC comme objectif par défaut, au lieu de corriger après coup des rankings biaisés ?

🔗 arXiv

📦 Le reste de la veille