Les agents IA ont besoin de savoir quoi faire après avoir compris une demande. Le 9 octobre 2026, Microsoft a présenté Microsoft-Decision-1, disponible dans Foundry, avec une arrivée annoncée sur OpenRouter. Le modèle score des choix prédéfinis. Son lancement donne une nouvelle visibilité aux modèles de prise de décision : des IA spécialisées dans l’orientation des logiciels. Annonce de Microsoft
L’enjeu dépasse un modèle supplémentaire dans un catalogue. Lorsqu’un assistant enchaîne recherches, outils et vérifications, ses petits arbitrages deviennent une partie essentielle du service rendu. Faut-il continuer, recommencer, utiliser un autre outil ou demander une relecture ? Cette nouvelle catégorie cherche à traiter ces questions avec un format simple et un coût réduit.
Un modèle de prise de décision, concrètement
La fiche Foundry décrit un système textuel fondé sur Qwen3.5-9B, adapté par Microsoft. On lui soumet une situation, une question et des options ; il renvoie leurs probabilités en JSON, sans produire d’explication. Il accepte notamment des choix oui/non, des catégories et des notes. Sa fenêtre de contexte est de 32 768 tokens. Fiche officielle du modèle
Imaginons une entreprise qui reçoit un message : « Depuis la dernière mise à jour, notre export comptable échoue. » L’application pourrait demander de choisir entre trois équipes : support technique, facturation et service commercial. Ce scénario est illustratif, pas un test réalisé ici. Il montre le changement de contrat : le résultat attendu est une distribution sur des catégories définies par l’entreprise, plutôt qu’un paragraphe qu’il faudra ensuite interpréter.
L’application conserve la décision d’agir
Le score ne règle pas toute la suite du processus. Si le modèle privilégie le support technique, l’application peut ouvrir un ticket, vérifier un seuil de confiance ou demander une confirmation. Ce sont trois politiques différentes, même avec une réponse identique du modèle.
Cette séparation est fondamentale. Une estimation indique quel choix paraît adapté aux informations fournies. Une autorisation définit ce que le logiciel a le droit d’exécuter. Les confondre reviendrait à transformer une prédiction en permission.
Une vague déjà amorcée par Jev et Liquid AI
Microsoft arrive dans un domaine où d’autres acteurs explorent le même principe. Nous avions présenté en septembre Jev, le modèle de TypeSafe AI spécialisé dans les décisions sans texte.
Le 5 octobre, Liquid AI a lancé d1, un modèle de décision acceptant texte et images. Sa présentation décrit une lecture en un passage pour retourner des probabilités, avec des usages allant du classement de demandes à l’inspection visuelle. Cette capacité visuelle appartient à d1 ; la fiche de Microsoft-Decision-1 indique, elle, un modèle uniquement textuel. Annonce de Liquid AI, fiche Foundry
La convergence est intéressante : plusieurs fournisseurs isolent une fonction que l’on confiait souvent à un assistant généraliste. Notre lecture est celle d’une spécialisation des systèmes IA. Un modèle peut produire une proposition, un autre l’évaluer et un logiciel appliquer des règles d’exécution. Ce partage des rôles ouvre une piste d’efficacité ; il demande aussi de savoir où passent les responsabilités.
Des performances prometteuses, mesurées par Microsoft
Microsoft annonce la meilleure précision dans sa comparaison de 36 benchmarks, représentant près de 150 000 questions. Sur ses mesures, Decision-1 serait 4,5 fois plus rapide que Quyet-1.0-Large et environ 35 fois plus rapide que GPT-6 Sol en latence médiane. Ces résultats proviennent du fournisseur. Présentation et résultats Microsoft
Ils ne démontrent pas que tous les agents iront 35 fois plus vite. Un agent attend également ses outils, son réseau ou ses recherches. Accélérer un arbitre ne réduit que la part du temps consacrée à cet arbitre. La comparaison utile, pour une équipe, serait donc de mesurer le parcours entier, avec les mêmes tâches et les mêmes critères de réussite.
Le dépôt de JevBench maintenu par Benchmark Heaven apporte un contexte complémentaire : ses évaluations distinguent précision, calibration, latence et coût. Ses auteurs précisent qu’un classement ne garantit pas la fiabilité sur un cas d’usage particulier. Il s’agit d’un benchmark distinct de la comparaison annoncée par Microsoft, et non d’une confirmation indépendante des chiffres de Decision-1. Méthode et limites de JevBench
Une confiance à 90 % doit avoir un sens vérifiable
Les probabilités ne sont utiles que si elles correspondent raisonnablement à la fréquence réelle des bonnes réponses. Sur un ensemble représentatif de prédictions annoncées à 90 %, une bonne calibration implique environ neuf réponses correctes sur dix. Cela ne certifie pas une réponse individuelle.
Cette question précède la vague actuelle : les travaux de Chuan Guo et de ses collègues, présentés à l’ICML en 2017, montraient déjà qu’un réseau performant pouvait être mal calibré. Ils portent sur d’autres modèles et ne constituent pas une évaluation de Microsoft-Decision-1. Ils expliquent pourquoi précision et confiance doivent être examinées séparément. On Calibration of Modern Neural Networks
Pour un service client, notre recommandation serait de suivre les erreurs par catégorie et de vérifier les probabilités sur des demandes réelles. Le même seuil peut convenir à un classement documentaire et être insuffisant pour une action coûteuse. Un score élevé doit être confronté au risque de l’action, pas simplement transformé en bouton « exécuter ».
Le prix baisse, mais le choix conserve un coût
Microsoft annonce un tarif de 0,042 dollar par million de tokens d’entrée, avec des sorties gratuites. À titre de calcul illustratif, 1 000 décisions consommant chacune 1 000 tokens d’entrée représenteraient 0,042 dollar de coût de modèle. Ce montant ne comprend pas les autres services du parcours. Tarif annoncé
L’intérêt économique dépendra donc des demandes réellement envoyées. Fournir un historique entier à chaque étape peut coûter davantage que transmettre un état ciblé. Et une décision erronée qui déclenche plusieurs tentatives peut annuler une partie de l’économie initiale.
Le bon indicateur serait le coût d’une tâche correctement achevée, en incluant reprises et contrôles, plutôt que le prix isolé d’un appel. C’est aussi une manière de comparer une architecture spécialisée avec un modèle généraliste sans présumer du vainqueur.
Choisir les bonnes options devient un travail central
Un modèle limité à une liste ne peut pas sélectionner une possibilité absente. Si l’entreprise propose seulement « accepter » et « rejeter », elle impose une décision même lorsque le dossier est incomplet. Ajouter « informations insuffisantes » ou « relecture humaine » change le problème posé.
La fiche Foundry prévoit l’abstention et attribue à l’application la définition des choix, seuils et voies d’escalade. Elle exclut l’usage du modèle comme seul décideur automatisé pour des décisions lourdes de conséquences concernant des personnes, par exemple dans l’emploi, le crédit ou la santé. Périmètre d’usage officiel
L’émergence des modèles de décision pourrait ainsi déplacer une partie du travail des développeurs : moins interpréter de longues réponses, davantage concevoir des choix précis, observables et révisables. Microsoft-Decision-1 rend cette piste plus visible. Le prochain test sera de montrer que des milliers de petits arbitrages rapides produisent, ensemble, un service plus fiable.
Références
- Microsoft — lancement de Microsoft-Decision-1, 9 octobre 2026.
- Microsoft Foundry — fiche, capacités et limites de Microsoft-Decision-1.
- Liquid AI — lancement de d1, 5 octobre 2026.
- Benchmark Heaven — dépôt JevBench et méthode d’évaluation.
- Guo et al. — On Calibration of Modern Neural Networks, ICML 2017.

