Aller au contenu
Wikipédia et Wikidata : le socle des citations par les IA

Wikipédia et Wikidata : le socle des citations par les IA

Par Guillaume P.

9 min de lecture
Lien copié dans le presse-papiers
Guillaume P.

Le conseil le plus vendu en GEO en 2025 tenait en une phrase : faites-vous citer par Wikipédia. Les mesures de 2026 disent autre chose. Dans un panel de 301 025 réponses d'IA collectées entre août 2025 et août 2026 par Sorank, Wikipédia apparaît dans 1,62 % des réponses mesurées sur les trois derniers mois, ce qui le place troisième des plateformes suivies. Sur la même période, le pic datait d'octobre 2025, à 11,31 %.

Wikipédia n'est donc plus un raccourci de visibilité. Wikidata, la base d'entités qui l'accompagne, reste en revanche le socle sur lequel une machine construit ce qu'elle croit savoir d'une organisation : 123 569 270 items, 2 553 838 877 éditions, et des données structurées placées sous licence CC0, donc réutilisables sans négociation. L'effet n'a pas disparu, il a changé de couche : on ne pilote plus une citation encyclopédique, on pilote la cohérence de ses données d'entité.

Ce que les machines consomment réellement#

Personne n'envoie un modèle de langage lire une page Wikipédia rendue en HTML. Le canal industriel est documenté par Wikimedia Enterprise, qui vend des « Enterprise-grade APIs for Wikipedia, Wikidata & every Wikimedia project ». Trois collections, un même schéma JSON : des instantanés de projet entier, la récupération d'un article à la demande, et un flux temps réel de chaque édition, création et suppression.

L'élément qui a de vraies conséquences éditoriales s'appelle Structured Contents. L'API extrait les infoboxes, les sections, les tableaux, les citations, les références et les images du wikitexte brut pour les renvoyer en JSON lisible par machine, sans parseur maison. Autrement dit : l'infobox d'un article est traitée comme une table de propriétés, pas comme du texte. C'est exactement la forme sous laquelle Wikidata existe, puisque le projet sert d'entrepôt central des données structurées des projets Wikimedia frères, Wikipédia en tête.

Conséquence directe pour un site : ce que vous publiez sur votre entité (nom, date de création, activité, adresses, liens) voyage dans des bases que les moteurs conversationnels interrogent. Le travail d'entity SEO ne consiste pas à obtenir un article, il consiste à ne pas contredire ses propres données ailleurs.

Deux mesures, deux réponses opposées#

Les deux études disponibles se contredisent sur un point, et c'est ce qui les rend utiles ensemble.

MesurePérimètreCe qu'elle dit de Wikipédia et des forums
Sorank, publiée le 30 août 2026301 025 réponses de cinq IA, 1 820 738 citations, 131 349 domaines, août 2025 à août 2026, 79 % des questions en françaisWikipédia cité dans 1,62 % des réponses sur les trois derniers mois, troisième plateforme suivie, en chute de 7,94 points entre les trois premiers et les trois derniers mois mesurés
Yext, publiée le 9 octobre 20256,8 millions de citations issues de 1,6 million de réponses de trois modèles, du 1er juillet au 31 août 2025, 20 820 domainesLes forums type Reddit pèsent un peu plus de 2 % des citations, soit 154 000, et 86 % des citations proviennent de canaux que les marques peuvent influencer ou gérer

Yext explique d'ailleurs pourquoi l'autre narratif a autant circulé : les études menées au niveau de la marque, qui ignorent la localisation et le contexte de l'utilisateur, font apparaître Wikipédia ou Reddit comme premières sources citées. Le raisonnement par « fan-out » de requêtes produit du commentaire généraliste, pas la réponse à un besoin localisé.

Sorank mesure autre chose : des questions d'acheteurs, posées chaque mois, dans les secteurs où travaillent ses utilisateurs. Son auteur le dit lui-même, le panel n'est pas un échantillon neutre du web. Les deux chiffres ne s'additionnent pas, ils se lisent comme deux fenêtres sur le même objet.

La série mensuelle, et le trou d'avril 2026#

Ce n'est pas une baisse régulière. Sur treize mois, Wikipédia passe de 5,28 % en août 2025 à 11,31 % en octobre 2025, puis à 0,17 % en avril 2026, avant de remonter à 1,39 % en août 2026. Un effondrement suivi d'un demi-retour, sur une seule année de mesure.

La lecture la plus prudente est celle que propose Sorank : les modèles ont diversifié leurs sources, Wikipédia n'a pas nécessairement perdu en qualité. Pour une entreprise, les informations d'entité portées par le projet comptent toujours, mais elles ne font plus le travail d'une stratégie de citation.

Modèle par modèle, le rendement n'est pas le même#

IA mesurée par SorankTaux de citation de WikipédiaRéponses dans l'échantillon
ChatGPT3,43 %87 008
Gemini1,38 %87 000
Grok1,08 %20 002
Perplexity0,19 %87 004
Claude0,03 %20 011

L'écart entre le modèle qui cite le plus Wikipédia et celui qui le cite le moins est de 3,4 points. C'est lui qui devrait décider d'un budget, pas la moyenne : le même travail rapporte beaucoup plus sur un modèle que sur un autre. Deux réserves à poser, parce que l'auteur les pose lui-même : les échantillons de Claude et de Grok sont les plus petits du panel, 20 011 et 20 002 réponses contre 87 008, 87 004 et 87 000 pour les trois autres, et se lisent comme une direction, pas comme une valeur précise.

Les secteurs, eux, ne se ressemblent pas non plus. Dans le panel, Wikipédia pèse 4,39 % des citations dans l'automobile, 3,58 % dans la mode et 2,67 % dans le sport. Ailleurs, il descend sous la moyenne. Un conseil GEO qui ignore cette dispersion vend du générique.

Ce qu'il faut faire à la place#

Quatre chantiers, dans cet ordre.

Un : la cohérence factuelle entre votre site, vos données légales et toute fiche encyclopédique qui vous concerne. Les données d'entité voyagent, et une divergence se propage dans les trois sens. Deux : ne pas commander un article encyclopédique comme stratégie de citation, le rendement mesuré a chuté sur la période. Trois : structurer ce que vous contrôlez. Les sites web de marques représentent 44 % des citations maîtrisables, les fiches d'entreprise 42 %, les avis et réseaux sociaux 8 %, selon les chiffres de l'étude Yext relayés par la presse spécialisée française. Quatre : travailler les pages locales. Les sites web locaux pèsent de 8 % à près de 20 % des citations selon les modèles et les types de requêtes, et la restauration dépend à 41,63 % des fiches et à 13,28 % des avis, le plus haut niveau de dépendance au contenu généré par les utilisateurs de tous les secteurs mesurés.

Le reste de la chaîne ne change pas : un contenu qui se cite se construit en passages autonomes et en données balisées, pas en supplique adressée à un bot. L'audit de citabilité IA donne la grille de contrôle, le guide du schema markup la couche technique, et l'article sur les études propriétaires explique pourquoi ce que vous êtes seul à publier pèse plus que ce que tout le monde reprend. Sur le versant communautaire, ce que Reddit est devenu dans les résultats de Google est documenté ici, et le canal d'API de recherche qu'empruntent les agents conversationnels est détaillé là.

Je ne trancherai pas entre les deux lectures de ces chiffres. Dire que Wikipédia ne sert plus à rien et dire qu'il reste la source dominante sont deux affirmations que les jeux de données disponibles ne départagent pas, parce qu'ils ne mesurent pas le même panel ni la même période.

FAQ#

Faut-il encore chercher à être cité par Wikipédia ?#

Ce n'est plus un raccourci de citation mesurable. Dans le panel Sorank, Wikipédia n'apparaît que dans 1,62 % des réponses sur les trois derniers mois mesurés, après un pic à 11,31 % en octobre 2025, et l'étude déconseille explicitement de commander un article comme stratégie de citation. Les données d'entité que le projet porte restent utiles, à condition d'être cohérentes avec votre site et vos données légales.

Quelle est la différence entre Wikipédia et Wikidata pour une entreprise ?#

Wikipédia est un contenu textuel, Wikidata une base d'entités. Le projet sert d'entrepôt central des données structurées des projets Wikimedia, avec 123 569 270 items, et ses données structurées sont placées sous licence CC0, donc réutilisables sans accord. C'est cette couche d'entités, plus que l'article, qu'un moteur conversationnel interroge.

Comment les IA récupèrent-elles ces données ?#

Par des API, pas en lisant des pages. Wikimedia Enterprise propose des API de niveau entreprise pour Wikipédia, Wikidata et tous les projets Wikimedia, en trois collections : instantanés de projet, article à la demande, flux temps réel, avec un schéma JSON commun. L'initiative Structured Contents transforme infoboxes, sections, tableaux, citations et images du wikitexte en JSON lisible par machine.

Wikipédia est-il cité de la même façon par toutes les IA ?#

Non. Le taux va de 3,43 % sur ChatGPT à 0,03 % sur Claude, en passant par 1,38 % sur Gemini, 1,08 % sur Grok et 0,19 % sur Perplexity. Les échantillons de Claude et Grok sont les plus petits du panel, 20 011 et 20 002 réponses contre 87 008, 87 004 et 87 000 pour les trois autres, donc à lire comme une direction.

Que faire si les plateformes communautaires ne pèsent presque rien ?#

Renforcer ce que vous contrôlez. L'étude Yext, sur 6,8 millions de citations, montre qu'environ 86 % proviennent de canaux influençables par les marques : sites de marques, fiches d'entreprise, avis. Les forums type Reddit tombent à un peu plus de 2 % dès que la localisation de l'utilisateur est prise en compte.

Sources#

Lien copié dans le presse-papiers

À lire aussi