Google a commencé à déployer Gemini 4 Argon, son modèle d’intelligence artificielle le plus récent et le plus puissant. Ses résultats aux tests officiels sont solides, mais, selon des sources citées par Bloomberg, ses performances en conditions réelles suscitent des doutes au sein du groupe.

Ses performances seraient notamment inégales en programmation. Google conteste ce constat et affirme que Gemini 4 figure parmi les meilleurs modèles d’IA du moment.

Gemini 4 : de bons résultats aux tests, mais des doutes en conditions réelles

Google a ouvert mercredi l’accès à Gemini 4 à un petit groupe de partenaires de confiance spécialisés dans la cybersécurité. Après de nouveaux tests, le modèle doit être proposé à davantage d’utilisateurs, à commencer par les abonnés payants.

Selon Google, Gemini 4 obtient de très bons résultats à plusieurs tests de référence en IA. Il surpasserait même Astra, le modèle d’OpenAI, lors d’un test évaluant les compétences en cybersécurité.

Plusieurs salariés estiment toutefois que ces chiffres ne reflètent pas toute la réalité. Lorsqu’il est utilisé pour des tâches concrètes, Gemini 4 afficherait des performances décevantes dans certains domaines.

La programmation est particulièrement citée. Le modèle aurait du mal à accomplir certaines tâches et serait aussi moins performant dans la conception des interfaces d’applications et de sites internet, selon une source.

Google réfute cette analyse. Un salarié participant au développement du modèle assure qu’un large consensus existe au contraire en interne pour placer Gemini 4 parmi les meilleurs. Selon le groupe, les nombreux tests internes ne révèlent pas non plus de difficultés face à des tâches de programmation complexes en conditions réelles.

Les avis divergent donc au sein de l’entreprise. Certains salariés jugent qu’Anthropic et OpenAI progressent plus vite et s’attendent à ce que Gemini 4 reste en retrait sur certains points. D’autres estiment au contraire que Google a désormais comblé son retard.

Google ne peut pas se permettre un nouveau revers

L’enjeu est de taille. Gemini sert de socle aux fonctionnalités d’IA de la quasi-totalité des principaux produits de Google, dont Search, Gmail, Maps et Chrome. Chacun de ces services compte plus d’un milliard d’utilisateurs.

Dans le même temps, OpenAI et Anthropic cherchent à se développer au-delà de leurs seuls modèles d’IA. Ils conçoivent de plus en plus d’applications propres, notamment des agents d’IA capables d’effectuer de manière autonome des travaux de programmation et d’autres tâches.

Google peine justement à gagner du terrain dans la programmation assistée par l’IA. Une faiblesse de Gemini 4 dans ce domaine pourrait donc offrir davantage de marge à ses concurrents pour attirer développeurs et entreprises vers leurs plateformes.

Le groupe a par ailleurs déjà essuyé un revers. Il prévoyait de lancer Gemini 3.5 Pro en juin, mais cette version n’a finalement jamais vu le jour. Selon des sources de Bloomberg, le modèle a été abandonné parce que son développement ne répondait pas aux attentes internes.

Cette décision pourrait avoir coûté cher. Selon Bloomberg Intelligence, l’entraînement d’un modèle d’IA de cette envergure peut coûter jusqu’à 400 millions de dollars. À cela s’ajoutent les salaires des chercheurs spécialisés en IA.

De bons résultats aux tests ne disent pas tout

Le débat autour de Gemini 4 renvoie à un problème plus large dans le secteur de l’IA. Les entreprises utilisent des tests de référence pour mesurer les performances de leurs modèles. Clients et développeurs s’appuient ensuite sur ces scores pour comparer les différents modèles.

Mais un score élevé ne signifie pas nécessairement qu’un modèle est plus performant en conditions réelles.

Le secteur parle ainsi de « benchmaxxing » : un modèle d’IA est optimisé à l’extrême pour certains tests afin d’améliorer ses scores, sans que ces progrès soient toujours aussi perceptibles dans les tâches du quotidien.

Selon deux sources de Bloomberg, Gemini 4 fait lui aussi l’objet de ce débat. Edwin Chen, fondateur de Surge AI, compare cette situation à celle d’un élève qui obtient une excellente note à un examen, sans que cela renseigne vraiment sur sa capacité à mettre ses connaissances en pratique.

Selon des personnes impliquées dans le projet, Gemini 4 présente aussi des atouts indéniables. Le modèle serait à l’aise avec les contenus autres que le texte, notamment pour analyser des vidéos. Il serait également performant en matière de cybersécurité, de sécurité et de fluidité des échanges.

Google affirme que Gemini 4 a été conçu pour mener des tâches longues et complexes dans le développement logiciel, la finance, le droit et la cybersécurité. Le modèle peut en outre traiter simultanément bien plus d’informations que son prédécesseur : jusqu’à un million de tokens, soit environ 750 000 mots selon Google.

micron

Les résultats de Micron dissipent les doutes : la demande liée à l’IA reste très forte

micron
palantir
PDG d’Apple
Plus Marché news

Le plus lu

near protocol

Le NEAR s’envole de 28 % : voici pourquoi

Le NEAR gagne près de 30 % après le lancement de nouvelles fonctions de confidentialité. Les volumes d’échanges, l’activité du réseau et les revenus progressent également fortement.

Avalanche
Charles Hoskinson