// FUTURA SCIENCES — SPAZIO & SCIENZA
Claude tenait presque la victoire dans Civilization VI… puis l’IA a complètement changé de stratégie et bombardé Toulouse !
Le clavier et la souris seront-ils bientôt dépassés ? Les IA agentiques se multiplient, capables d’effectuer des tâches à votre place. Avec HoloTab, la startup française H Company propose une extension capable de transformer un navigateur en véritable agent autonome.... Lire la suite
Microsoft présente son nouvel outil Scout comme un assistant autonome capable d’agir sans intervention directe de l’utilisateur. Mais derrière cette promesse d’automatisation totale, des documents internes suggèrent une vision bien plus controversée.... Lire la suite
Le jeu vidéo pourrait bien devenir un terrain d’essai privilégié pour les agents d’IA. Des chercheurs britanniques ont justement imaginé un test qui les confronte à une partie de Civilization VI, où ils doivent planifier leurs actions sur plusieurs centaines de tours. Les résultats mettent en lumière des faiblesses qui dépassent largement le cadre du jeu.
Ces derniers temps, les développeurs des modèles d'IA mettent l'accent sur une fonctionnalité spécifique : les agents. Ils sont désormais capables de diviser une requête en une série de tâches, puis d'y assigner des agents pour les exécuter de manière autonome. La difficulté est alors de créer des tests pour évaluer leurs performances.
Des chercheurs de l'université d'Oxford, de Google DeepMind et d'autres institutions britanniques ont mis au point un nouveau test baptisé CivBench. Il consiste tout simplement à faire jouer les agents au jeu vidéo Civilization VI, dans une version réduite à des lignes de texte. Chaque partie dure plus de 300 tours, au cours desquels les agents font des milliers d'appels à différents outils, permettant ainsi d'analyser leur capacité à mettre en place une stratégie et s'y tenir sur le long terme.
Le clavier et la souris seront-ils bientôt dépassés ? Les IA agentiques se multiplient, capables d’effectuer des tâches à votre place. Avec HoloTab, la startup française H Company propose une extension capable de transformer un navigateur en véritable agent autonome.... Lire la suite
Les agents sont censés vérifier leur progression vers la victoire tous les 20 tours, mais semblent oublier et se contentent de le faire tous les 30 à 75 tours seulement. De plus, ils tendent à mettre en place des stratégies à court terme, mais ne s'y tiennent pas. Dans l'un des premiers tests, Claude a joué le Portugal, et était opposé, entre autres, à la France. Alors qu'il était proche d'une victoire diplomatique, il s'est inquiété de la menace culturelle de la France et a élaboré une stratégie sur 50 tours. L'IA a alors développé l'arme nucléaire et a rayé Toulouse, la capitale culturelle de la France dans cette partie, de la carte en larguant deux bombes nucléaires.
La France a tout de même gagné la partie, par la voie diplomatique. Pendant qu'il était occupé à neutraliser la menace culturelle française, Claude ne s'est plus préoccupé des autres aspects du jeu. CivBench révèle ainsi deux failles majeures de ces IA. Lorsque les informations ne leur sont pas transmises directement et qu'ils doivent interroger des outils, les agents ont tendance à fonctionner à l'aveugle. Et ils ont tendance à planifier des actions, mais ne pas les exécuter.
Microsoft présente son nouvel outil Scout comme un assistant autonome capable d’agir sans intervention directe de l’utilisateur. Mais derrière cette promesse d’automatisation totale, des documents internes suggèrent une vision bien plus controversée.... Lire la suite
Et ce problème n'est pas limité à Claude Opus 4.6. Les chercheurs ont aussi testé Gemini 3.1 Pro, GPT-5.4 et Kimi-K2.5, qui ont montré les mêmes failles. Un simple jeu vidéo montre ainsi les limites des modèles actuels, qui n'ont pas simplement besoin de devenir plus intelligents. Ils ont besoin de nouveaux mécanismes pour garder une vue d'ensemble de la tâche, et surveiller le déroulement de leurs propres actions planifiées.