Microsoft commercialise ses nouveaux modèles d’IA, réduisant les coûts jusqu’à 89 % par rapport à OpenAI

IA Microsoft Deux nouveaux modèles ont été présentés au public mercredi. MAI-Image-2.5-Proson générateur d’images à la plus haute résolution à ce jour, et MAI-Voix-2-FlashLe modèle conversationnel, conçu pour les charges de travail des grandes entreprises, est l’affirmation la plus agressive de l’entreprise selon laquelle elle peut piloter son propre produit sans s’appuyer sur le modèle frontière d’OpenAI lors de la publication des données de production.

Déclaration, faite L’équipe de superintelligence de Microsoft AIL’entreprise a atterri environ un an après s’être engagée à construire des prototypes personnalisés en interne, et elle obtient un niveau de clarté inhabituel quant à l’endroit où se trouvent actuellement ces prototypes : Bing, PowerPoint, OneDrive, Dynamique 365, Exceller, Pilote de support GitHubet Azur. Le message adressé aux acheteurs d’entreprise et à OpenAI est que les modèles développés par Microsoft ne sont plus des projets de recherche. Ce sont des infrastructures de production au service de millions d’utilisateurs.

“Chacune de ces améliorations est un pas vers un objectif : des produits Microsoft optimisés par les conceptions Microsoft”, a écrit la société dans un article de blog annonçant l’annonce.

Quel est l’impact de MAI-Image-2.5-Pro ​​​​et MAI-Voice-2-Flash sur les extrémités opposées de la courbe des coûts de l’IA ?

Les deux nouvelles versions occupent les extrémités opposées de ce que Microsoft appelle la courbe qualité-vitesse-coût, et leur placement est délibéré. MAI-Image-2.5-Pro Destiné au niveau premium : le rendu des caractères, l’édition détaillée et le réglage fin du texte dans les images ont longtemps été les inconvénients des derniers modèles de génération d’images. Microsoft a tarifé le modèle à 5 $ pour un million de jetons de saisie de texte, 8 $ pour un million de jetons d’entrée d’image et 106 $ pour un million de jetons de sortie d’image. Fondation MAI-Image-2.5 Le modèle est sorti récemment Retouche photo dans l’Arène n°2Les classements communautaires sont devenus des tableaux de bord pour les médias génératifs.

L’industrie créative semble en prendre note. Rob Reilly, directeur mondial de la création chez le géant de la publicité WPP, a qualifié le modèle Pro de Microsoft de « grand pas en avant pour les outils GenMedia » dans l’annonce de Microsoft, ajoutant que « Microsoft s’est fermement établi comme un leader en matière d’IA ».

MAI-Voix-2-Flash va de l’autre côté. Vu pour la première fois chez Microsoft Établir une conférenceFlash est deux fois plus rapide que MAI-Voice-2 et coûte 32 % moins cher à 15 $ par million de caractères. Il s’adresse au marché négligé mais énorme de la voix – centres d’appels, agents vocaux et applications vocales en temps réel – où la latence de la parole et le coût par appel sont plus importants que l’augmentation marginale de l’expressivité. Les deux modèles reflètent une stratégie consistant à construire une famille de modèles plutôt qu’un modèle unique, car l’entreprise affirme qu’un studio de création qui s’efforce d’obtenir une fidélité maximale a des besoins très différents de ceux d’un service client qui reçoit des millions d’appels par jour.

Les tests de production de Microsoft montrent que les modèles internes réduisent les coûts des GPU jusqu’à 89 %.

Ce modèle est sans doute moins digne d’intérêt que la mesure de déploiement ci-jointe de Microsoft, qui se lit comme un cas systématique de remplacement de modèles frontières tiers dans son portefeuille de produits.

Créateur d’images Bing maintenant entièrement fonctionnel MAI-Image-2.5jusqu’à la fin, marquant la première fois qu’un outil d’icônes utilisateur est entièrement interne. Dans PowerPoint, Microsoft affirme que MAI-Image-2.5 réduit les coûts du GPU jusqu’à 84 % par rapport au modèle d’image d’OpenAI, GPT-Image-2. Avec MAI-Image-2.5 désormais par défaut pour les versions d’édition d’images clés, la société a signalé une augmentation de 26 % de la vitesse de sauvegarde, une réduction d’environ 25 % de la latence P95 et une augmentation de 2,5 fois de l’efficacité sous des charges de travail de production moyennes.

Au niveau du son, MAI-Voix-2-Flash Utilisant désormais Dynamics 365 Contact Center, une plate-forme utilisée par des clients tels que T-Mobile et EasyJet, Microsoft affirme avoir réduit les coûts du GPU jusqu’à 89 %. Ce modèle est également intégré à Azure Voice Live pour les développeurs créant des agents de synthèse vocale.

Le déploiement le plus conséquent se situe peut-être dans le secteur de la santé. de Microsoft Copilote de DragonUtilisé par 170 000 prestataires médicaux et responsable de 28 millions de visites de patients au dernier trimestre, il fonctionne désormais sur MAI-Transcribe-1.5, qui est multilingue en 58 langues. Selon Microsoft, des évaluations internes ont réduit les taux d’erreurs de transcription et de reconnaissance linguistique de 50 % dans la plupart des langues, une affirmation significative dans un domaine où les erreurs de transcription sont monnaie courante dans les notes cliniques.

À l’intérieur de la stratégie « grimper la tête » qui permet aux modèles plus petits de contourner le GPT-5.6 d’Excel

Dans un article complémentaire publié le même jour, Microsoft détaille la méthodologie derrière ces résultats.véhicule d’alpinisme», un volant intégré de données, de modèles et du produit « produit » qui les entoure.

L’exemple le plus évident MAI-code-1-flashUn modèle de codage léger publié sur GitHub Copilot en juin. Microsoft affirme que ce modèle a une vitesse d’acceptation de code environ 10 % plus rapide que GPT-5.4 Mini et Claude Haiku 4.5 dans VS Code, tout en utilisant 10 % de jetons médians en moins. La fidélisation des développeurs raconte une histoire similaire : les utilisateurs étaient 6 % plus susceptibles de revenir pendant plusieurs jours par rapport à GPT-5.4 Mini et 11 % plus susceptibles de revenir à Claude Haiku 4.5.

Ensuite, Microsoft a fait quelque chose d’encore plus intéressant. Il est allé au point de contrôle MAI-Code-1-Flash et au-delà il a été formé dans l’environnement d’apprentissage par renforcement d’Excelenseigner les outils de travail et les flux de travail des connaissances sur les feuilles de calcul dans les modèles de codage. Le résultat, selon les commentaires des utilisateurs de production, est le même modèle que GPT-5.6 pour les tâches Excel les plus courantes, mais suffisamment petit pour fonctionner sur les anciens GPU H100 ou même A100 de Nvidia qui ne nécessitent pas les derniers accélérateurs.

Les détails de ce matériel méritent d’être notés. Toutes les grandes entreprises d’IA s’efforcent de distribuer les dernières puces, et une conception offrant une qualité de pointe sur deux générations de silicium modifie fondamentalement l’économie du déploiement. Cela libère également le matériel le plus récent, tel que le cluster GB200 existant de Microsoft, pour la formation plutôt que pour la maintenance.

Le manifeste « diffusion aux frontières » de Satya Nadella réinvente la relation entre OpenAI.

Le PDG de Microsoft, Satya Nadella, a fait cette annonce sur X dans un long article intitulé : «Propagation et contrôle des frontières“Nous pouvons désormais exploiter des capacités limitées grâce à des modèles optimisés pour les produits à usage intensif, les fournir à grande échelle et à un prix abordable, tout en continuant à utiliser des modèles frontières pour des besoins frontaliers”, a écrit Nadella, ajoutant que Microsoft “initie le mouvement des véhicules chaque fois qu’il correspond à notre modèle frontal”. versions.”

Traduit du script exécutif : Les fonctionnalités qui étaient à la pointe de la technologie il y a un an sont désormais un enjeu de taille, et Microsoft pense pouvoir reproduire à moindre coût les tâches spécifiques et répétitives qui dominent l’utilisation réelle des produits. Pourquoi payer pour un modèle de bordure lorsque l’utilisateur souhaite reformater une colonne de tableau ?

Alors que Nadella a pris soin de noter que « les modèles limites d’OpenAI et d’Anthropic font partie du système d’orchestration aux côtés de MAI », il a défini le principe d’indépendance du modèle, arguant que la valorisation de l’entreprise « devrait continuer à gravir la montagne, quel que soit le modèle supprimé ».

« Garder le style, la mémoire, le contexte et les compétences hors de la mode donne à Microsoft le contrôle », a-t-il déclaré. Le sous-texte est difficile à manquer. Reuters a rapporté en avril que Microsoft Licence exclusive sur la technologie OpenAI révisé en un accord non exclusif, a annoncé Microsoft en septembre dernier Des modèles anthropiques ont été introduits à certains produits. “L’annonce de mercredi complète le triangle : Microsoft en tant que directeur, les modèles frontaliers de ses partenaires sont des composants interchangeables, et ses propres modèles absorbent une plus grande part du trafic typique.”

Alors que les développeurs soutiennent des modèles plus abordables, les sceptiques remettent en question le succès de Microsoft.

Les réponses en ligne ont suscité à la fois l’intérêt et le scepticisme à l’égard de la stratégie. Un utilisateur de X a écrit : « J’adore quand les gens utilisent des miniatures pour leur travail. » @mavihskEn réponse au message de Nadella. « Pourquoi devrais-je utiliser un modèle omniscient pour modifier mes champs Excel ? » Un autre utilisateur, @nabu_lines“Lorsque vous arrêtez d’abuser du modèle le plus grand, le coût et les performances s’améliorent.”

D’autres étaient moins positifs quant à l’exécution de Microsoft. “Microsoft est le pire en matière d’écoute des commentaires des clients”, a écrit le concepteur. @designedbyabinL’entreprise affirme qu’elle “perdra la course à l’IA parce qu’elle n’a pas réussi à comprendre les besoins des clients à plusieurs reprises”. Et un utilisateur, @tokenoverflow» a formulé une critique plus sèche de l’indépendance du modèle : « Je veux qu’il continue à gravir la montagne après que Microsoft l’ait tué. »

Les sceptiques ont raison. Les mesures autodéclarées par Microsoft (taux d’acceptation, taux d’économies et économies de GPU) proviennent de ses propres évaluations internes, et non de références indépendantes, et l’entreprise choisit les comparaisons à publier.

Mais la logique de la stratégie ne dépend d’aucun chiffre. Nadella construit actuellement ce logiciel.coût marginal réel pour la première fois« Microsoft explique pourquoi il se concentre trop sur les jetons, les GPU et les coûts de service : réduire les coûts des GPU de 84 % lorsque les fonctions d’IA s’exécutent à chaque frappe sur un milliard de portefeuilles de produits d’utilisateurs n’est pas une optimisation. C’est la différence entre une entreprise viable et un gouffre financier. »

Pourquoi Microsoft transforme-t-il son playbook d’IA interne en un produit Azure ?

La dernière partie de la stratégie est que Microsoft vend le playbook, pas seulement les modèles. Nadella décrit clairement Mountain Climbing comme « un modèle pour chaque entreprise d’IA, SaaS ou entreprise », et Microsoft regroupe une chaîne d’outils appelée Foundry et Frontier Tuning qui permettent aux entreprises de former des modèles spécifiques pour améliorer leurs propres environnements d’évaluation et d’apprentissage. Cela traduira l’exercice interne de réduction des coûts de Microsoft en un produit Azure qui permettra aux entreprises clientes d’exécuter leurs charges de travail d’IA sur le cloud Microsoft, même si les modèles proviennent d’ailleurs.

L’accent mis par l’entreprise sur des modèles construits « sur des données propres, traçables et de qualité entreprise, sans distillation de modèles tiers » est un objectif commercial. Dans un secteur où la provenance des données de formation est scrutée, je suis sûr que les clients et les tribunaux de Microsoft prêteront attention à la provenance des capacités du modèle. Microsoft déclare élargir désormais son approche de l’alpinisme Chat copilote, Étatet PowerPointet les deux nouveaux modèles sont disponibles en avant-première publique Fonderie Microsoft et Aire de jeux MAI. “Aucun de ces éléments n’est définitif”, a écrit la société. “Nous ne faisons que commencer.”

Il y a sept ans Microsoft a parié plus de 13 milliards de dollars OpenAI façonnera l’avenir de l’intelligence artificielle. L’annonce de mercredi suggère que l’entreprise a appris une leçon moins coûteuse : l’avenir de l’IA appartient peut-être à celui qui repousse les limites, mais les bénéfices appartiennent à celui qui la simplifie.

Leave a Comment