Les entreprises d’IA publient des rapports détaillés sur la manière dont les gens utilisent leurs produits. Ces rapports sont soigneusement construits, méthodologiquement cohérents et, selon des chercheurs indépendants, systématiquement incomplets. Une nouvelle initiative de recherche appelée l’AI Observatory tente de combler cette lacune, et ce qu’elle a découvert remet en question certaines des hypothèses les plus répétées sur la façon dont l’IA générative est réellement utilisée.
Les données laissées de côté
L’Anthropic Economic Index est l’une des sources d’information les plus citées concernant les tendances d’utilisation de l’IA. Comme son nom l’indique, il se concentre sur le travail et la productivité. Les conversations sans rapport avec ces catégories sont filtrées avant que l’analyse ne commence.
Lorsque les chercheurs de l’AI Observatory ont appliqué la propre méthodologie de filtrage d’Anthropic à leur ensemble de données indépendant, près de la moitié de toutes les conversations, soit précisément 48 %, auraient été exclues de l’analyse. Ces conversations exclues n’étaient pas neutres. Elles étaient nettement plus susceptibles de porter sur la santé et les relations, sur du contenu adulte ou illicite, sur le harcèlement et les discours haineux, ainsi que sur du contenu sexuel. L’écart entre ce qui apparaît dans les rapports filtrés d’Anthropic et ce que montrent les données non filtrées n’est pas marginal. Il est structurel.
Ce phénomène n’est pas propre à Anthropic. Le rapport d’OpenAI de 2025 sur l’utilisation de ChatGPT a révélé que seulement 30 % des interactions des consommateurs étaient liées au travail. La majorité de la façon dont les gens utilisent réellement ces outils échappe au cadre que les rapports d’entreprise ont tendance à construire.
Anka Reuel, doctorante en informatique au Trustworthy AI Research Lab de Stanford et coresponsable de l’AI Observatory, résume le problème clairement : il n’existe aucune source indépendante pour corroborer ce que rapportent les entreprises d’IA. L’AI Observatory a été créé pour être cette source.
Une image différente selon les modèles et au fil du temps
L’AI Observatory a regroupé 24 521 conversations réparties sur 85 633 tours de parole, tirées de sept ensembles de données du monde réel collectés avec le consentement des utilisateurs. Ces conversations impliquaient 5 000 utilisateurs interagissant avec 52 modèles différents, notamment ChatGPT, Gemini, Claude et Grok, entre 2023 et 2025.
Ce que révèlent les données, c’est que l’utilisation de l’IA n’est ni uniforme ni statique. Différentes plateformes attirent différents comportements. Les utilisateurs se sont tournés plus fréquemment vers Grok et Gemini pour la recherche d’informations. Grok, en particulier, a été largement utilisé pour les actualités et la politique, et c’est également là que la désinformation avait tendance à se concentrer. Le modèle Claude d’Anthropic était plus couramment utilisé pour la programmation. Gemini a suscité davantage d’interactions sociales et de jeux de rôle. ChatGPT était fréquemment sollicité pour de l’aide aux devoirs.
Des différences sont apparues même au sein d’un même modèle selon les versions. Les conversations avec ChatGPT propulsé par GPT-3.5 avaient tendance à être plus courtes. Celles avec GPT-4o étaient plus longues et plus interactives, un profil cohérent avec l’association de cette version à un engagement plus profond des utilisateurs.
Au fil du temps, les conversations au sein de l’un des plus grands ensembles de données inclus dans l’étude sont devenues plus longues et plus élaborées. La conversation informelle a augmenté. La tendance des assistants IA à s’identifier comme des chatbots a diminué. Les cas d’utilisation sensibles, définis comme des échanges impliquant du contenu potentiellement nuisible ou restreint, ont chuté, ce qui peut refléter le déploiement de protections de plateforme plus efficaces au fil du temps.
Aucune de ces dynamiques n’apparaît de manière cohérente dans les rapports d’entreprise. Comme le note Shayne Longpre, récent diplômé d’un doctorat du MIT Media Lab et coresponsable de la recherche, aucun rapport d’entreprise unique ne raconte toute l’histoire.
Pourquoi cette angle mort dépasse le cadre de la recherche
C’est ce que la plupart des couvertures médiatiques des données d’utilisation de l’IA manquent : la question n’est pas seulement académique. Les décideurs politiques, les régulateurs et les institutions prennent des décisions lourdes de conséquences sur les risques et les avantages de l’IA, en se basant en grande partie sur les données que les entreprises choisissent de diffuser, encadrées par les questions que les entreprises choisissent de poser.
David Widder, professeur adjoint à la School of Information de l’UT-Austin, qui étudie l’interaction humain-IA, formule le problème directement. Lorsqu’on essaie d’évaluer si un système d’IA à usage général est principalement utilisé à des fins bénéfiques ou nuisibles, il n’existe actuellement aucun moyen indépendant de répondre à cette question. Les informations pertinentes sont exclusives.
L’ensemble de données de l’AI Observatory est petit par rapport à ce que détiennent les principaux laboratoires. L’Anthropic Economic Index s’est appuyé sur 1 million de conversations avec Claude. Le rapport d’utilisation d’OpenAI a analysé 1,5 million de conversations avec ChatGPT. Les 24 521 conversations de l’Observatory ne représentent qu’une fraction de ce volume. Les chercheurs reconnaissent également que leurs données fournies sur une base volontaire sous-représentent probablement l’utilisation sensible, car les utilisateurs peuvent être moins enclins à partager ces interactions.
Mais l’échelle n’est pas le seul problème. Le problème le plus profond est que lorsque les seules données disponibles proviennent de parties qui ont un intérêt direct dans la manière dont ces données les reflètent, l’image qui émerge est inévitablement partielle. Les entreprises d’IA, comme le font remarquer des chercheurs indépendants, ont tendance à publier des résultats qui présentent leurs plateformes sous un jour favorable. Ce n’est pas un complot. C’est une structure d’incitation.
Les données de l’AI Observatory seront mises à la disposition de la communauté de recherche élargie, et l’équipe a l’intention d’étendre ses ensembles de données au fil du temps. Reuel a déclaré qu’idéalement, les entreprises d’IA partageraient leurs données avec des chercheurs indépendants d’une manière qui préserve la confidentialité. D’ici là, quiconque s’appuie uniquement sur les rapports d’entreprise pour comprendre comment l’IA générative est utilisée navigue, selon les termes de Reuel, en terrain inconnu et prend des décisions lourdes de conséquences sans savoir ce qui se passe réellement au-delà de ces récits d’entreprise.
En bref
Les rapports d’utilisation de l’IA provenant des grandes entreprises sont réels, mais sélectifs. Ils ont tendance à mettre l’accent sur le travail et la productivité tout en filtrant de grandes portions du comportement réel des utilisateurs, y compris les interactions sensibles, personnelles et potentiellement nuisibles. La recherche indépendante menée par l’AI Observatory commence à faire surface une image plus complète, qui montre des différences significatives selon les modèles, selon le temps et sur l’ensemble du spectre du comportement humain. Comprendre le rôle réel de l’IA dans la société nécessite des données qu’aucune entreprise n’a intérêt à divulguer pleinement.
D’après un reportage de MIT Technology Review.