← Tous les articles

Données structurées et IA : le schema aide-t-il à être cité ?

Ahrefs constate que les pages citées par l'IA portent du JSON-LD près de 3 fois plus souvent, mais son test contrôlé n'a mesuré aucun gain causal.

Les données structurées sont un balisage lisible par machine — le vocabulaire schema.org, le plus souvent écrit en JSON-LD — qui décrit ce que contient une page. Les preuves de leur effet sur la visibilité IA sont contrastées : Microsoft confirme que ses LLM utilisent le schema, Google affirme qu’aucun balisage particulier n’est requis pour ses fonctionnalités IA, et Ahrefs a constaté que les pages citées par l’IA portent du JSON-LD près de 3× plus souvent — alors que son expérience contrôlée n’a trouvé aucun gain causal. Le schema aide les systèmes d’IA à comprendre votre site ; à lui seul, il ne les fait pas vous citer.

Que sont les données structurées et quelle part du web les utilise déjà ?

Les données structurées sont du code qui étiquette le sens du contenu d’une page avec le vocabulaire partagé schema.org, le plus souvent sous forme d’un bloc JSON-LD. Elles indiquent aux machines que ceci est un produit, ceci son prix, ceci l’organisation derrière le site — sans les obliger à analyser de la prose.

Ce n’est plus une pratique de niche. Selon Web Data Commons de l’université de Mannheim (décembre 2024), 51,25 % des 2,4 milliards de pages HTML du Common Crawl d’octobre 2024 contiennent des données structurées, contre 5,7 % en 2010. Environ 11,5 millions de sites utilisent JSON-LD — 70 % de tous les sites qui annotent — et les sites avec un balisage Product sont passés de 581 000 à 3,3 millions.

Le Web Almanac 2024 de HTTP Archive (novembre 2024) a mesuré du JSON-LD sur 41 % des pages mobiles, contre 34 % en 2022. Les types JSON-LD les plus fréquents sont WebSite (12,73 %), Organization (7,16 %), BreadcrumbList (5,66 %) et LocalBusiness (3,97 %). La moitié du web parle déjà cette langue. La vraie question est de savoir si les moteurs d’IA l’écoutent.

Quelles entreprises d’IA confirment réellement utiliser le balisage schema ?

Seul Microsoft a confirmé que le balisage schema alimente les LLM derrière son assistant. Les confirmations publiques de Google portent sur la recherche en général — pour les AI Overviews et l’AI Mode, sa documentation indique qu’aucun schema particulier n’est requis. OpenAI, Perplexity et Anthropic n’ont rien confirmé. Au SMX Munich de mars 2025, Fabrice Canel, Principal Product Manager chez Microsoft Bing, a confirmé que le balisage schema aide les LLM de Microsoft — les modèles derrière Copilot — à comprendre le contenu web, et a recommandé de pousser le contenu frais via IndexNow, comme le rapporte Search Engine Land (mars 2025) :

“Gen AIs value fresh content in particular, partly as a reference check of their LLM training data.” — Fabrice Canel, Microsoft Bing, au SMX Munich, mars 2025

Google se montre plus prudent. Sa documentation sur les fonctionnalités IA (consultée en juillet 2026) indique qu’il n’existe « aucune donnée structurée schema.org particulière à ajouter » pour apparaître dans les AI Overviews ou l’AI Mode, ni aucun fichier lisible par machine supplémentaire. Le guide d’optimisation pour l’IA qui l’accompagne (mis à jour le 10 juillet 2026) répète que les données structurées ne sont pas requises pour la recherche générative, tout en recommandant de les conserver pour les résultats enrichis, dans le cadre de votre stratégie SEO générale.

John Mueller, de Google, interrogé sur l’utilité d’un schema étendu pour les LLM, a répondu « oui, non, et ça dépend », selon Search Engine Roundtable (janvier 2026). Certaines fonctionnalités dépendent fortement des données structurées — le Shopping a besoin du prix, de la livraison et de la disponibilité — tandis que dans d’autres elles ne font qu’enrichir le résultat. Il a précisé qu’il ne s’agissait pas d’une recommandation officielle.

Et les autres ? En mars 2026, OpenAI, Perplexity et Anthropic n’avaient publié aucune confirmation officielle de l’usage du balisage schema on-page dans leurs réponses, d’après Search Engine Land (mars 2026).

Ajouter du balisage schema augmente-t-il les citations dans l’IA ?

Réponse honnête : la corrélation est forte, mais la causalité n’est pas démontrée. Trois jeux de données racontent l’histoire.

Ahrefs (mai 2026) a analysé 6 millions d’URL et constaté que les pages citées par l’IA étaient presque trois fois plus susceptibles de contenir du JSON-LD que les pages non citées. La même équipe a ensuite mené une expérience contrôlée : 1 885 pages ayant ajouté du JSON-LD entre août 2025 et mars 2026, face à un groupe témoin de 4 000 pages. L’ajout de schema n’a produit aucun gain notable de citations sur aucune plateforme — AI Overviews -4,6 %, AI Mode +2,4 % (non significatif), ChatGPT +2,2 % (non significatif).

Une étude d’AirOps compilée par Analyzify (16 851 requêtes ChatGPT, 353 799 pages) penche dans l’autre sens : les pages avec JSON-LD affichaient un taux de citation de 38,5 % contre 32,0 % sans, soit 6,5 points d’écart. Les types aux taux de citation les plus élevés étaient BreadcrumbList (46,2 %), FAQPage (45,6 %) et Organization (44,3 %). Pourtant, la même synthèse inclut des résultats contradictoires : OtterlyAI n’a trouvé aucun impact sur Perplexity.

ÉtudeÉchantillonRésultatLimite
Corrélation Ahrefs (mai 2026)6 millions d’URLPages citées par l’IA presque 3× plus susceptibles d’avoir du JSON-LDCorrélation seule, pas de causalité
Expérience contrôlée Ahrefs (août 2025 – mars 2026)1 885 pages test contre 4 000 témoinsAucun gain de citations significatif sur aucune plateformeUne seule expérience, une seule fenêtre temporelle
AirOps via Analyzify16 851 requêtes ChatGPT, 353 799 pagesTaux de citation de 38,5 % avec JSON-LD contre 32,0 % sansCorrélationnel ; contredit par OtterlyAI sur Perplexity

Dans le système d’étiquetage d’UpgradePro : l’écart de 3× est MESURÉ, mais l’affirmation selon laquelle le schema cause les citations reste SUPPOSÉE — et le seul test contrôlé disponible n’a pas su la confirmer.

Comment votre balisage arrive-t-il dans une réponse IA : fetch direct ou index de recherche ?

Il existe deux chemins distincts, et le schema n’en emprunte qu’un seul. Quand un chatbot récupère votre page en direct pour composer une réponse, il lit le HTML visible. Quand il s’appuie sur un index de recherche — celui de Google ou de Bing — votre balisage a déjà façonné la compréhension que cet index a de la page.

searchVIU (décembre 2025) a mené 8 tests en octobre 2025 avec une page dont des prix fictifs étaient répartis entre HTML visible, JavaScript et JSON-LD. Aucun des cinq systèmes testés — ChatGPT, Claude, Perplexity, Gemini et Google AI Mode — n’a lu le prix qui n’existait que dans le JSON-LD lors d’une récupération directe. Seul Gemini a exécuté le JavaScript.

“JSON-LD Schema is NOT read by AI chatbots during direct fetch” — searchVIU, décembre 2025

L’implication pratique : le schema influence les réponses IA indirectement, via les index de recherche que les assistants interrogent, et non via le crawl à la demande. C’est la nuance que la plupart des contenus d’éditeurs escamotent. La façon dont les assistants sélectionnent et classent leurs sources est un sujet à part entière — nous la détaillons dans comment les moteurs d’IA choisissent ce qu’ils citent.

Quels types de schema une PME doit-elle prioriser en 2026 ?

Priorisez Organization, Product si vous vendez, et Article avec BreadcrumbList sur le contenu — et cessez d’attendre quoi que ce soit de FAQPage chez Google.

Type de schemaIdéal pourPreuvesDéconseillé pour
OrganizationConsolider votre entité : name, url, logo, sameAsTaux de citation ChatGPT de 44,3 % (AirOps) ; deuxième type JSON-LD le plus fréquent à 7,16 % (Web Almanac 2024)En attendre à lui seul des résultats enrichis visibles
ProductE-commerce ; prix et disponibilité structurésLes fonctionnalités Shopping dépendent fortement des données structurées (Mueller, rapporté) ; le shopping ChatGPT exige des flux produitsLes sites sans pages transactionnelles
Article + BreadcrumbListBlogs et sites de contenuBreadcrumbList affichait le meilleur taux de citation ChatGPT chez AirOps (46,2 %)
FAQPageContenus questions-réponses, à faible coûtTaux de citation ChatGPT de 45,6 % (AirOps)Les résultats enrichis Google — disparus depuis le 7 mai 2026

C’est avec Product que la structuration mord vraiment. La spécification de flux produits d’OpenAI pour le shopping ChatGPT (Agentic Commerce) exige un flux structuré avec des champs obligatoires — item_id, title, description, brand, prix en ISO 4217, url, image_url, availability — qui déterminent si un produit apparaît dans les recherches ChatGPT et s’il peut être acheté par checkout direct. C’est la preuve directe que le commerce IA fonctionne aux données structurées, même si c’est via un flux plutôt que du JSON-LD on-page.

FAQPage est un avertissement. Google a restreint les résultats enrichis FAQ aux sites publics et de santé autorisés en août 2023, et depuis le 7 mai 2026 ils ont totalement cessé d’apparaître, les rapports et l’API étant retirés entre juin et août 2026, d’après Search Engine Journal (mai 2026). Gardez le balisage si vous l’avez ; n’en faites pas une stratégie.

Tout cela ne paie que sur une base saine : un balisage valide, servi dans le HTML, sur des pages crawlables. Cette base, c’est ce que nous traitons dans les fondations du SEO technique, et c’est la première chose qu’un audit SEO technique doit vérifier.

Quel rôle jouent le SEO d’entités et les knowledge graphs ?

Le SEO d’entités déplace l’unité d’optimisation des pages vers les entités : les entreprises, produits et personnes dont parle votre contenu. Un balisage Organization cohérent — un @id stable, plus des liens sameAs vers vos profils réels — donne aux knowledge graphs une identité non ambiguë à ancrer, pour que les systèmes puissent déterminer qui vous êtes à travers le web.

Le signal le plus clair que schema.org devient une infrastructure IA, c’est NLWeb. Microsoft l’a annoncé le 19 mai 2025 : un projet open source qui transforme les sites web en interfaces IA conversationnelles, bâti sur les données schema.org et RSS que les sites publient déjà. Son créateur est R.V. Guha — également créateur de schema.org, RDF et RSS — et chaque instance NLWeb fait aussi office de serveur MCP, prête à dialoguer avec les agents IA.

Un site au balisage propre est à mi-chemin d’être lisible par les agents. D’autres propositions lisibles par machine, comme llms.txt, visent le même objectif sous un autre angle — nous comparons adoption et preuves dans notre guide llms.txt.

Que ne faut-il pas attendre du balisage schema ?

N’attendez pas du schema seul qu’il vous vaille des citations. En mars 2026, il n’existait aucune étude évaluée par les pairs sur le balisage schema et la visibilité IA, d’après Search Engine Land (mars 2026) — les preuves disponibles viennent de recherches d’éditeurs et du secteur SEO, avec les contradictions exposées plus haut.

Méfiez-vous d’une mauvaise attribution courante. L’article académique qui a forgé le terme GEO, Aggarwal et al. (KDD 2024), a mesuré que des tactiques comme l’ajout de citations de sources, de statistiques et de citations textuelles augmentent la visibilité jusqu’à 40 % dans les réponses des moteurs génératifs — visibilité mesurée en Position-Adjusted Word Count, et non en trafic. L’article n’a pas testé schema.org comme méthode. Les blogs rattachent régulièrement ces 40 % au balisage ; l’article ne le soutient pas.

Et rappelez-vous la position de Google lui-même : les données structurées ne sont pas requises pour la recherche IA générative. Le schema est une infrastructure de compréhension, pas un levier de citation.

Que faire cette semaine ?

Une checklist réaliste pour une PME, dans l’ordre :

  1. Inventoriez et validez votre balisage existant. Un JSON-LD cassé ou contradictoire n’aide personne ; corrigez ce qui est déjà en place avant d’en ajouter.
  2. Servez le JSON-LD dans le HTML initial, pas injecté par JavaScript. Dans les tests de searchVIU, seul Gemini a exécuté le JavaScript ; tout ce qui dépend uniquement du JS est invisible pour les autres lors des récupérations directes.
  3. Ajoutez ou complétez le balisage Organization sur votre page d’accueil — name, url, logo, un @id stable et des liens sameAs vers vos profils réels — pour que les knowledge graphs puissent résoudre votre entité.
  4. Si vous vendez en ligne, préparez des données produits structurées. Le shopping ChatGPT exige un flux conforme, et les fonctionnalités Shopping dépendent fortement d’un prix, d’une livraison et d’une disponibilité structurés, selon John Mueller (Search Engine Roundtable, janvier 2026 ; ce n’est pas une recommandation officielle).
  5. Cessez d’attendre les résultats enrichis FAQPage. Ils ont disparu de Google depuis le 7 mai 2026. Gardez plutôt du contenu en forme de réponse visible sur la page.
  6. Ne bloquez pas les crawlers qui alimentent les index. Le schema atteint les réponses IA via les index Google et Bing ; s’ils ne peuvent pas vous crawler, le balisage ne sert à rien.
  7. Mesurez avant et après. Établissez la ligne de base de vos mentions IA avant de toucher au balisage — sinon vous ne distinguerez pas le signal du bruit.

Cette dernière étape est la séquence que nous suivons dans notre service de visibilité IA : audit de référence d’abord, implémentation ensuite, mesure face à la ligne de base en troisième. Le balisage schema y gagne sa place — comme infrastructure, pas comme levier magique.

Questions fréquentes

Les moteurs d'IA lisent-ils le JSON-LD de mon site ?

Cela dépend du chemin emprunté. Lors de tests menés en octobre 2025 et publiés en décembre 2025, searchVIU a constaté que ChatGPT, Claude, Perplexity, Gemini et Google AI Mode ignoraient tous le JSON-LD pendant une récupération directe de la page et ne lisaient que le HTML visible. Via l'index de recherche, l'histoire change : Microsoft a confirmé que le balisage schema aide les LLM derrière Copilot à comprendre le contenu web. La position publique de Google est plus étroite : sa documentation indique qu'aucune donnée structurée schema.org particulière n'est nécessaire pour les AI Overviews ou l'AI Mode, et le bénéfice qu'elle confirme publiquement concerne la recherche en général.

Google exige-t-il un balisage schema particulier pour les AI Overviews ou l'AI Mode ?

Non. La documentation officielle de Google indique qu'il n'y a aucune donnée structurée schema.org spécifique à ajouter, ni fichier lisible par machine ni exigence supplémentaire au-delà des pratiques SEO standard. Google recommande malgré tout de conserver les données structurées dans votre stratégie SEO globale, car elles continuent d'alimenter les résultats enrichis.

Est-il prouvé qu'ajouter du schema augmente les citations dans l'IA ?

La corrélation est forte, la causalité n'est pas démontrée. Ahrefs a constaté que les pages citées par l'IA sont presque trois fois plus susceptibles de porter du JSON-LD, et AirOps a mesuré un taux de citation de 38,5 pour cent avec JSON-LD contre 32,0 pour cent sans, sur 16 851 requêtes ChatGPT. Mais l'expérience contrôlée d'Ahrefs sur 1 885 pages n'a trouvé aucun gain significatif après l'ajout du balisage. La lecture honnête : le schema accompagne les sites bien entretenus, et à lui seul il n'est pas un levier magique.

Quels types de schema une PME doit-elle prioriser ?

Organization avec des liens sameAs pour consolider votre identité dans les knowledge graphs, les données Product si vous vendez en ligne puisque le shopping ChatGPT repose sur des flux produits structurés obligatoires, et Article avec BreadcrumbList sur les pages de contenu. BreadcrumbList, FAQPage et Organization affichent les taux de citation les plus élevés dans l'étude AirOps.

Le schema FAQPage vaut-il encore la peine ?

Google n'affiche plus rien pour lui. Les résultats enrichis FAQ ont été restreints aux sites publics et de santé autorisés en août 2023, puis ont totalement cessé d'apparaître dans Google Search le 7 mai 2026. Le balisage ne nuit pas, et AirOps le corrèle aux citations ChatGPT, mais n'en attendez aucun résultat enrichi de la part de Google.

Quel rapport entre les données structurées et le web agentique ?

Un rapport étroit. NLWeb, le projet open source de Microsoft créé par R.V. Guha, le créateur de schema.org, transforme les sites web en interfaces conversationnelles à partir des données schema.org et RSS qu'un site publie déjà, et chaque instance NLWeb fait aussi office de serveur MCP pour les agents IA. Un site au balisage propre a déjà fait la moitié du chemin.


Dites-nous où vous voulez aller. Nous vous dirons, clairement, comment nous vous y mènerions.

Discutons