Microsoft-Decision-1 : les modèles de décision passent à l’offensive

Microsoft Decision-1 : trois chemins continuer, revoir et arrêter, avec le choix revoir mis en évidence en orange.

Les agents IA ont besoin de savoir quoi faire après avoir compris une demande. Le 9 octobre 2026, Microsoft a présenté Microsoft-Decision-1, disponible dans Foundry, avec une arrivée annoncée sur OpenRouter. Le modèle score des choix prédéfinis. Son lancement donne une nouvelle visibilité aux modèles de prise de décision : des IA spécialisées dans l’orientation des logiciels. Annonce de Microsoft

L’enjeu dépasse un modèle supplémentaire dans un catalogue. Lorsqu’un assistant enchaîne recherches, outils et vérifications, ses petits arbitrages deviennent une partie essentielle du service rendu. Faut-il continuer, recommencer, utiliser un autre outil ou demander une relecture ? Cette nouvelle catégorie cherche à traiter ces questions avec un format simple et un coût réduit.

Un modèle de prise de décision, concrètement

La fiche Foundry décrit un système textuel fondé sur Qwen3.5-9B, adapté par Microsoft. On lui soumet une situation, une question et des options ; il renvoie leurs probabilités en JSON, sans produire d’explication. Il accepte notamment des choix oui/non, des catégories et des notes. Sa fenêtre de contexte est de 32 768 tokens. Fiche officielle du modèle

Imaginons une entreprise qui reçoit un message : « Depuis la dernière mise à jour, notre export comptable échoue. » L’application pourrait demander de choisir entre trois équipes : support technique, facturation et service commercial. Ce scénario est illustratif, pas un test réalisé ici. Il montre le changement de contrat : le résultat attendu est une distribution sur des catégories définies par l’entreprise, plutôt qu’un paragraphe qu’il faudra ensuite interpréter.

L’application conserve la décision d’agir

Le score ne règle pas toute la suite du processus. Si le modèle privilégie le support technique, l’application peut ouvrir un ticket, vérifier un seuil de confiance ou demander une confirmation. Ce sont trois politiques différentes, même avec une réponse identique du modèle.

Cette séparation est fondamentale. Une estimation indique quel choix paraît adapté aux informations fournies. Une autorisation définit ce que le logiciel a le droit d’exécuter. Les confondre reviendrait à transformer une prédiction en permission.

Une vague déjà amorcée par Jev et Liquid AI

Microsoft arrive dans un domaine où d’autres acteurs explorent le même principe. Nous avions présenté en septembre Jev, le modèle de TypeSafe AI spécialisé dans les décisions sans texte.

Le 5 octobre, Liquid AI a lancé d1, un modèle de décision acceptant texte et images. Sa présentation décrit une lecture en un passage pour retourner des probabilités, avec des usages allant du classement de demandes à l’inspection visuelle. Cette capacité visuelle appartient à d1 ; la fiche de Microsoft-Decision-1 indique, elle, un modèle uniquement textuel. Annonce de Liquid AI, fiche Foundry

La convergence est intéressante : plusieurs fournisseurs isolent une fonction que l’on confiait souvent à un assistant généraliste. Notre lecture est celle d’une spécialisation des systèmes IA. Un modèle peut produire une proposition, un autre l’évaluer et un logiciel appliquer des règles d’exécution. Ce partage des rôles ouvre une piste d’efficacité ; il demande aussi de savoir où passent les responsabilités.

Des performances prometteuses, mesurées par Microsoft

Microsoft annonce la meilleure précision dans sa comparaison de 36 benchmarks, représentant près de 150 000 questions. Sur ses mesures, Decision-1 serait 4,5 fois plus rapide que Quyet-1.0-Large et environ 35 fois plus rapide que GPT-6 Sol en latence médiane. Ces résultats proviennent du fournisseur. Présentation et résultats Microsoft

Ils ne démontrent pas que tous les agents iront 35 fois plus vite. Un agent attend également ses outils, son réseau ou ses recherches. Accélérer un arbitre ne réduit que la part du temps consacrée à cet arbitre. La comparaison utile, pour une équipe, serait donc de mesurer le parcours entier, avec les mêmes tâches et les mêmes critères de réussite.

Le dépôt de JevBench maintenu par Benchmark Heaven apporte un contexte complémentaire : ses évaluations distinguent précision, calibration, latence et coût. Ses auteurs précisent qu’un classement ne garantit pas la fiabilité sur un cas d’usage particulier. Il s’agit d’un benchmark distinct de la comparaison annoncée par Microsoft, et non d’une confirmation indépendante des chiffres de Decision-1. Méthode et limites de JevBench

Une confiance à 90 % doit avoir un sens vérifiable

Les probabilités ne sont utiles que si elles correspondent raisonnablement à la fréquence réelle des bonnes réponses. Sur un ensemble représentatif de prédictions annoncées à 90 %, une bonne calibration implique environ neuf réponses correctes sur dix. Cela ne certifie pas une réponse individuelle.

Cette question précède la vague actuelle : les travaux de Chuan Guo et de ses collègues, présentés à l’ICML en 2017, montraient déjà qu’un réseau performant pouvait être mal calibré. Ils portent sur d’autres modèles et ne constituent pas une évaluation de Microsoft-Decision-1. Ils expliquent pourquoi précision et confiance doivent être examinées séparément. On Calibration of Modern Neural Networks

Pour un service client, notre recommandation serait de suivre les erreurs par catégorie et de vérifier les probabilités sur des demandes réelles. Le même seuil peut convenir à un classement documentaire et être insuffisant pour une action coûteuse. Un score élevé doit être confronté au risque de l’action, pas simplement transformé en bouton « exécuter ».

Le prix baisse, mais le choix conserve un coût

Microsoft annonce un tarif de 0,042 dollar par million de tokens d’entrée, avec des sorties gratuites. À titre de calcul illustratif, 1 000 décisions consommant chacune 1 000 tokens d’entrée représenteraient 0,042 dollar de coût de modèle. Ce montant ne comprend pas les autres services du parcours. Tarif annoncé

L’intérêt économique dépendra donc des demandes réellement envoyées. Fournir un historique entier à chaque étape peut coûter davantage que transmettre un état ciblé. Et une décision erronée qui déclenche plusieurs tentatives peut annuler une partie de l’économie initiale.

Le bon indicateur serait le coût d’une tâche correctement achevée, en incluant reprises et contrôles, plutôt que le prix isolé d’un appel. C’est aussi une manière de comparer une architecture spécialisée avec un modèle généraliste sans présumer du vainqueur.

Choisir les bonnes options devient un travail central

Un modèle limité à une liste ne peut pas sélectionner une possibilité absente. Si l’entreprise propose seulement « accepter » et « rejeter », elle impose une décision même lorsque le dossier est incomplet. Ajouter « informations insuffisantes » ou « relecture humaine » change le problème posé.

La fiche Foundry prévoit l’abstention et attribue à l’application la définition des choix, seuils et voies d’escalade. Elle exclut l’usage du modèle comme seul décideur automatisé pour des décisions lourdes de conséquences concernant des personnes, par exemple dans l’emploi, le crédit ou la santé. Périmètre d’usage officiel

L’émergence des modèles de décision pourrait ainsi déplacer une partie du travail des développeurs : moins interpréter de longues réponses, davantage concevoir des choix précis, observables et révisables. Microsoft-Decision-1 rend cette piste plus visible. Le prochain test sera de montrer que des milliers de petits arbitrages rapides produisent, ensemble, un service plus fiable.

Références

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.