Les chiffres clés de l'épisode
En janvier 2026, il y a eu cette scène assez dingue : un robot humanoïde, un modèle de la série Atlas, s'est promené tranquillement sur une chaîne de montage dans une usine automobile de Hyundai. À un moment, il s'arrête devant un rack de pièces détachées, observe un problème — un défaut d'alignement sur un bloc de suspension —, l'ajuste, et reprend sa ronde. Le plus fou, c'est que personne ne le téléguidait avec une manette dans une pièce à côté : aucun ingénieur n'avait codé à l'avance comment résoudre ce problème d'alignement très précis. Le robot a analysé son environnement, déduit qu'il y avait une anomalie, et pris l'initiative physique de la corriger tout seul, sans même interrompre la production de l'usine. On est très loin de l'époque où l'IA n'était qu'un petit chat textuel sur un écran qui attendait qu'on lui pose une question.
C'est exactement ce basculement qu'on décortique aujourd'hui, en s'appuyant sur trois documents majeurs : un rapport poussé d'Orca Security sur les modèles d'IA les plus utilisés, un aperçu des nouvelles offres gratuites de Google Cloud, et une grosse étude de marché qui appelle carrément cette période "l'année de l'IA agentique". La mission : décrypter comment on est passé d'un assistant passif à un véritable acteur autonome, voire physique, et comment ces technologies ultra-spécialisées rebattent les cartes pour les entreprises.
L'année de l'IA agentique
Il faut d'abord définir ce concept d'IA agentique. On parle d'un marché qui passe, selon les projections citées, d'environ 5,2 milliards de dollars en 2024 à 200 milliards de dollars pour 2034 — une explosion totale, qui s'explique parce qu'on ne parle plus d'une IA qui génère du texte, mais d'une IA qui prend des décisions complexes et exécute des tâches sans qu'aucun humain n'intervienne. L'exemple de Danfoss illustre ça de façon très concrète : avant, quand un client faisait une demande un peu complexe, il fallait en moyenne 42 heures pour que ce soit traité et résolu. En automatisant 80% de leurs décisions transactionnelles avec des agents, ce délai est devenu quasi instantané. La profondeur de l'exécution est radicalement différente de l'automatisation classique : avant, un script allait chercher une info dans une base de données, l'envoyait à un employé, et cet humain devait lire, analyser, ouvrir un autre logiciel pour la livraison, envoyer la facture. Aujourd'hui, chez Danfoss, l'agent lit la demande du client, croise avec l'historique, vérifie les stocks en direct, calcule les coûts de transport qui varient, valide l'expédition et génère la facture — tout ça en une fraction de seconde, de A à Z. C'est comme passer d'un dictionnaire encyclopédique ultra-intelligent à un véritable employé de bureau à qui on donne les clés de l'entreprise et une mission claire.
On le voit aussi chez Google Cloud, avec des outils comme Google Antigravity pour coder de manière orientée agent, et des navigateurs comme Fellow ou Atlas qui ne sont plus de simples fenêtres web : ils font des recherches poussées tout seuls, gèrent des paniers d'achat complets, bloquent des trackers, naviguent à la place de l'utilisateur. Est-ce que c'est vraiment de la prise de décision intelligente, ou juste d'immenses arbres de décision "si-alors" bien maquillés ? La différence, c'est que les règles "si-alors" cassent dès que l'environnement change un peu — si un bouton de validation change de couleur ou se décale de quelques pixels, le script plante. Les agents dont on parle utilisent un raisonnement profond : s'ils tombent sur un site qui a changé d'interface, ils utilisent la vision par ordinateur pour analyser la page, comprendre sémantiquement où se trouve la barre de recherche, et s'adapter en temps réel. Il y a une vraie boucle de rétroaction — ils se trompent, analysent pourquoi, et essaient autre chose. C'est ça, l'autonomie.
La fin des modèles généralistes
Faire tourner un réseau aussi énorme à chaque micro-clic consommerait une énergie folle avec les modèles gigantesques d'il y a deux ans — c'est pour ça que le cerveau même de l'IA a dû changer. En 2026, on assiste à la fin totale de la domination des modèles généralistes : le marché s'est complètement fragmenté. En 2024, GPT-3.5 écrasait tout avec 79% du marché cloud ; en 2026, le numéro un est GPT-4, mais il plafonne à seulement 37,6% d'adoption. Le monopole s'est effondré. Avant, on utilisait un énorme couteau suisse pour tout faire, même pour enfoncer un clou ; aujourd'hui, on est passé à une boîte à outils ultra-spécialisée où chaque modèle fait une seule chose, mais parfaitement, très vite, et pour pas cher.
Cela montre aussi l'importance de l'architecture RAG et la montée en flèche des modèles d'intégration (embeddings) : dans le classement cité, trois modèles de ce type figurent au top 10, dont un modèle de "text embedding" qui rafle à lui seul 29,1%. Un modèle d'intégration ne génère pas de texte et ne discute pas — mais c'est l'antidote parfait contre les hallucinations de l'IA. Il prend tous les documents d'une entreprise, contrats et mémos, et les transforme en coordonnées mathématiques. Quand un agent autonome cherche une info sur une garantie, au lieu d'inventer une réponse basée sur des probabilités lues sur internet, le modèle d'intégration lui pointe les coordonnées exactes du vrai contrat dans la base de l'entreprise — un documentaliste mathématique parfait. On voit aussi des modèles de raisonnement pur qui prennent près de 18% pour les maths ou le code. Mais la vraie star de l'efficacité en 2026, c'est le modèle Falcon H1R : tout petit, seulement 7 milliards de paramètres, et pourtant un score de 88,1% sur un test de mathématiques réputé difficile, battant des modèles sept fois plus gros.
Cette efficacité vient d'une architecture hybride qui mélange le classique Transformer avec une structure appelée Mamba, traitant environ 1500 tokens par seconde par GPU pour une consommation d'énergie ridicule. Le Transformer classique doit, à chaque mot généré, relire tout le contexte précédent pour rester cohérent — comme si, en lisant un roman, il fallait recommencer au premier chapitre à chaque nouvelle page ; la mémoire sature vite. Mamba, à l'inverse, fait partie des "modèles d'espace d'état" : il compresse le passé en un état interne fluide qui se met à jour en continu, gardant un résumé condensé plutôt que de tout relire. Falcon H1R utilise le Transformer pour les tâches très complexes et bascule sur Mamba pour le flux normal, ce qui lui donne cette vitesse.
Le paradoxe Apple/Gemini : petit modèle sur puce, cloud souverain
Si des modèles Falcon ultra-légers, efficaces et rapides existent, pourquoi Apple, pour refaire Siri en 2026 avec son informatique privée sur puce, s'associe-t-il avec Google pour utiliser Gemini — un modèle massif ? Ce n'est pas un paradoxe, c'est la stratégie "Edge AI" couplée au cloud souverain. Le petit modèle efficace est directement dans la puce du téléphone : il gère 90% de la vie quotidienne — notifications, résumés, réglages — avec zéro latence et aucune donnée qui part sur le réseau. Mais pour une analyse complexe croisant des bases de données mondiales, le petit modèle sur puce reconnaît ses limites et envoie, de manière sécurisée, la requête au cloud, où le modèle massif prend le relais. C'est une délégation ultra-dynamique : des petits cerveaux rapides pour l'immédiat, capables d'appeler à l'aide des cerveaux massifs si besoin. C'est ce mécanisme qui a débloqué la sortie du logiciel pur vers le monde physique — ce qui ramène au robot Atlas chez Hyundai.
Du logiciel au corps physique
L'IA agentique a maintenant des bras et des jambes. Derrière le robot Atlas, on trouve des modèles comme celui de Nvidia — probablement nommé Alpamayo —, un modèle de 10 milliards de paramètres classé "vision-langage-action" (VLA). Comment un modèle qui traite du langage arrive-t-il à générer une force physique mécanique ? Avant, c'était un empilement de logiciels : une caméra voyait une vis, un premier logiciel calculait des coordonnées, un deuxième planifiait le mouvement du bras, un troisième envoyait l'électricité au moteur — une véritable usine à gaz. Le modèle VLA supprime tous ces intermédiaires : il prend directement les pixels de la caméra et la commande vocale, et ce qu'il produit n'est pas du texte, mais directement des impulsions physiques, les couples de serrage des moteurs. Il traduit le langage en cinématique continue.
Reste une question légitime : les vidéos de robots qui font des prouesses circulent depuis des années sur les réseaux sociaux, souvent hyper scénarisées, avec des dizaines de prises et une fragilité réelle au moindre changement d'éclairage. Qu'est-ce qui prouve que l'Atlas de 2026 n'est pas qu'un coup de communication ? Ce qui a changé la donne, ce n'est pas la mécanique du robot, c'est la simulation. Des simulateurs comme celui de Nvidia auraient réduit la variance des métriques d'erreur de 83%. Avant, l'IA s'entraînait dans un monde virtuel assez basique ; une fois transférée dans le vrai robot, la vraie vie chaotique — lumières changeantes, métal glissant — faisait casser la pièce. Aujourd'hui, avec la technologie des jumeaux numériques développée notamment avec Siemens, le simulateur gère la gravité, la thermodynamique, la friction microscopique des matériaux — de la physique quasi atomique. L'usine virtuelle où le robot s'entraîne est un clone quasi parfait des lois de la physique réelle : le modèle tombe, glisse, apprend des millions de fois dans cette matrice, et arrive déjà opérationnel une fois branché dans la vraie usine. C'est aussi ce qui permet d'envisager le robot domestique — où la marge d'erreur doit être proche de zéro pour la sécurité dans un salon.
La démocratisation — et la fracture entre startups et grands groupes
Toutes ces technologies — Hyundai, Boston Dynamics, Nvidia — donnent l'impression d'un terrain réservé aux méga-corporations. C'est l'inverse : la barrière à l'entrée s'est effondrée. Avec les outils gratuits de Google Cloud — Google AI Studio, NotebookLM (qui transforme ses propres documents en assistant de recherche), Gemini Code Assist, des API de vision et de traduction gratuites pour des centaines de milliers de requêtes —, une puissance qui coûtait des millions hier est disponible avec un simple email et du wifi. Les résultats économiques suivent : dans une étude citée sur les entreprises australiennes, 68% ont intégré l'IA, avec des revenus moyens en hausse de 34% et 38% d'économies réalisées.
Mais l'étude pointe un vrai risque d'économie à deux vitesses. Les startups utilisent l'IA à fond, contre seulement 61% des grandes entreprises traditionnelles — et 42% de ces startups créent carrément des produits nativement conçus autour de l'IA, venant directement menacer les modèles d'affaires des géants en place. Avec des outils aussi accessibles et souvent gratuits, pourquoi les grandes entreprises restent-elles à la traîne ? Le rapport indique que 51% des entreprises manquent de capacité humaine pour implémenter l'IA, et 39% manquent de compétences numériques — mais le vrai goulot d'étranglement est organisationnel, voire psychologique. Les grandes entreprises sont construites en silos, avec plusieurs signatures nécessaires pour valider un changement ; un agent IA qui peut scanner toutes les bases de données en même temps et changer les prix en temps réel casse complètement la chaîne de contrôle habituelle, posant un problème de responsabilité si une décision automatisée tourne mal. Les startups, elles, partent d'une feuille blanche et construisent leur architecture autour de l'IA agentique dès le premier jour — d'où l'existence de programmes gouvernementaux (comme un programme australien doté de 17 millions de dollars) pour aider les entreprises établies à se débloquer culturellement avant d'être dépassées.
Qu'est-ce que le travail, dans un monde d'agents ?
Pour résumer : on est parti de Danfoss, où le logiciel gère tout de bout en bout de façon autonome, grâce à des architectures fragmentées et ultra-efficaces comme Mamba ou le RAG ; cette puissance a permis à Nvidia et Boston Dynamics de l'intégrer dans des corps physiques fiables ; et une démocratisation permet désormais à de toutes petites startups de concurrencer les plus grands groupes. Une dernière réflexion, un peu vertigineuse : si depuis un simple navigateur web, on dispose déjà d'agents gratuits capables de coder, faire des recherches de marché pointues, gérer des campagnes — et que demain, ils pourront piloter des flux logistiques physiques — qu'est-ce qui empêchera une seule personne, dans son salon, de diriger une entreprise valorisée à un milliard de dollars ? Qu'est-ce que la définition du travail, quand on n'est plus un employé mais le chef d'orchestre d'une symphonie d'IA ? Le statut d'employé tel qu'on le connaît est peut-être en train de vivre ses dernières années.