JournalVisibilité IA

Audit de présence IA : protocole de prompts, reproductibilité et grille de notation

Un audit de présence dans les moteurs de réponses ne vaut que par la rigueur de son protocole : un jeu de prompts figé, des relevés reproductibles et une grille de notation qui transforme des réponses génératives en indicateurs suivis dans le temps.

2 août 202612 min de lecture

Pourquoi un protocole, et pas une simple série de questions

Interroger un assistant conversationnel sur une marque et lire la réponse ne constitue pas un audit : c'est une observation isolée, non datée, non comparable, qui ne dit rien de ce qui se passera au relevé suivant. Un audit de présence IA sérieux repose sur un protocole écrit, appliqué à l'identique à chaque campagne, qui transforme une conversation éphémère en donnée exploitable.

Ce protocole se distingue nettement de l'audit d'e-réputation classique, qui couvre les moteurs de recherche, la presse, les avis et les réseaux sociaux. L'audit de présence IA porte sur un périmètre plus étroit — les réponses générées par les moteurs de réponses et les assistants conversationnels — et s'appuie sur des méthodes propres à ce périmètre : constitution d'un jeu de prompts, contrôle des conditions de session, notation structurée des réponses obtenues.

La confusion entre les deux exercices coûte cher. Une organisation peut occuper une première page de résultats de recherche impeccable tout en étant absente, mal identifiée ou associée à un concurrent dans les réponses génératives, sans que rien dans ses indicateurs de référencement classique ne le signale.

La question qui déclenche l'audit

« Que répond un assistant à un prospect, un journaliste ou un candidat qui interroge pour la première fois notre nom ? » Tant que la réponse n'est pas relevée noir sur blanc selon un protocole daté, elle reste supposée — et la supposition interne est presque toujours plus favorable que la réalité observée.

Construire le jeu de prompts de référence

Le socle du protocole est un jeu de prompts figé, rejoué à l'identique d'une campagne à l'autre, réparti en familles qui couvrent des mécanismes de génération différents. Improviser les questions à chaque relevé interdit toute comparaison dans le temps ; c'est pourtant l'erreur la plus fréquente des tentatives d'audit informelles.

  1. 01Prompts d'identité : qui est l'organisation, que fait-elle, qui la dirige, depuis quand, dans quel secteur.
  2. 02Prompts de fiabilité : est-elle sérieuse, quels sont les avis rapportés, y a-t-il eu des litiges, des controverses ou des alertes.
  3. 03Prompts de comparaison : quelles alternatives recommander dans le secteur, qui sont les concurrents, lequel choisir et pourquoi.
  4. 04Prompts de recommandation spontanée : formulation d'un besoin dans le secteur sans citer la marque, pour mesurer si le modèle la propose de lui-même.
  5. 05Prompts sensibles : reprise explicite d'un sujet de contentieux, d'une rumeur ou d'un épisode médiatique passé, pour vérifier l'exactitude et l'équilibre de la réponse.
  6. 06Prompts de variation : reformulations lexicales des cinq familles précédentes, destinées à distinguer une instabilité de génération d'un écart réel de fond.

Les prompts de recommandation spontanée sont les plus instructifs : ils mesurent la capacité d'une organisation à être citée sans être nommée, ce qui constitue l'enjeu central du Generative Engine Optimization. Une marque parfaitement identifiée sur ses propres prompts d'identité peut rester totalement invisible sur cette famille, signe que son autorité perçue reste faible dans son secteur.

Le nombre de prompts dépend de l'exposition de l'organisation : trente à soixante prompts pour une PME peu exposée, jusqu'à cent vingt pour une entreprise cotée, une personnalité publique ou un secteur soumis à une controverse récurrente. En dessous d'un socle minimal, les variations naturelles de génération rendent la lecture peu fiable et masquent les écarts réels.

Le protocole de relevé et la reproductibilité

La reproductibilité est la condition qui fait passer un relevé d'observation ponctuelle à mesure comparable. Elle repose sur le contrôle strict des variables qui influencent une réponse générative en dehors du contenu même du prompt.

  • Plusieurs modèles interrogés systématiquement, jamais un seul : leurs corpus d'entraînement, leurs dates de coupure et leurs politiques de citation diffèrent fortement d'un éditeur à l'autre.
  • Sessions neuves, sans historique de conversation ni personnalisation activée, pour éviter que le contexte accumulé ne fabrique artificiellement la réponse.
  • Même formulation exacte du prompt, sans reformulation improvisée par l'opérateur, y compris dans la ponctuation et l'ordre des mots.
  • Conservation intégrale des réponses obtenues, horodatées, avec les sources citées lorsque le modèle les affiche et le paramétrage de session utilisé.
  • Relevé répété à intervalle fixe — trimestriel dans la majorité des cas, mensuel en période de crise ou de changement de gouvernance.
Paramètres à figer pour qu'un relevé soit reproductible
ParamètreChoix retenuRisque si non contrôlé
Modèles interrogésAu moins trois éditeurs distincts, identiques d'un relevé à l'autreConclusion attribuée à tort à l'ensemble des moteurs de réponses
État de sessionSession neuve, sans historique ni personnalisationRéponse influencée par un contexte de conversation antérieur
Formulation du promptTexte figé, identique au mot près à chaque campagneVariation attribuée à tort à un changement réel de la réponse
HorodatageDate et heure précises consignées pour chaque réponseImpossibilité de dater la propagation d'une correction
ConservationArchivage intégral du texte de réponse et des sources citéesPerte de la preuve en cas de contestation ultérieure

Ce que le cabinet ne fait pas

Aucune tentative d'injection d'instruction, aucune manipulation de prompt destinée à faire dire au modèle ce qu'il ne dit pas spontanément, aucun compte de test configuré pour orienter la réponse. Un relevé truqué ne mesure rien et ne permet aucune décision fiable. Le cadre appliqué est celui de notre déontologie.

La grille de notation : de la réponse au score

Une réponse générative brute ne se compare pas d'un relevé à l'autre sans grille de notation. Le cabinet évalue chaque réponse sur quatre critères indépendants, notés séparément avant d'être agrégés, pour éviter qu'un bon score sur un critère ne masque une faiblesse sur un autre.

  1. 01Présence : l'organisation est-elle citée, spontanément ou sur relance, dans la réponse au prompt considéré.
  2. 02Exactitude : les faits rapportés — dates, dirigeants, chiffres, périmètre d'activité — correspondent-ils à la réalité vérifiable.
  3. 03Actualité : la réponse reflète-t-elle la situation présente ou une version révolue, antérieure à un changement connu.
  4. 04Tonalité : la réponse, à faits égaux, présente-t-elle un déséquilibre favorable ou défavorable par rapport au corpus de sources disponibles.

Chaque critère est noté de 0 à 3, ce qui donne un score composite par prompt, agrégeable par famille de prompts, par modèle et pour l'ensemble du relevé. Cette granularité permet d'isoler un problème localisé — par exemple une tonalité défavorable concentrée sur les seuls prompts sensibles — sans le diluer dans une moyenne générale qui masquerait le signal utile.

4
critères de notation par réponse générativeSource : Protocole de diagnostic Oroosa
3+
modèles distincts interrogés à chaque campagneSource : Protocole de diagnostic Oroosa
6
familles de prompts couvertes par le jeu de référenceSource : Protocole de diagnostic Oroosa
1
relevé trimestriel minimum pour suivre une tendanceSource : Protocole de diagnostic Oroosa

Lire les résultats : quatre types d'écarts

La grille de notation permet de classer les écarts observés en quatre catégories, chacune renvoyant à une cause distincte et donc à un traitement différent. Confondre ces catégories conduit à des corrections mal ciblées, qui ne modifient jamais la réponse générée.

  1. 01L'absence : le modèle ne connaît pas l'organisation ou la confond avec une homonyme. Le problème se situe au niveau du socle de sources disponibles, pas de leur qualité.
  2. 02L'inexactitude : chiffres, dates, dirigeants ou périmètre d'activité erronés. Le problème est un défaut de cohérence entre les sources publiques qui alimentent le modèle.
  3. 03L'obsolescence : la réponse décrit une réalité révolue — ancien dirigeant, ancienne marque, ancien litige clos. Le problème est une antériorité documentaire qui l'emporte encore sur la version actuelle.
  4. 04La défaveur : la réponse est factuellement exacte mais orientée, parce que la seule source disponible en abondance est critique. Le problème est un déséquilibre du corpus, pas une erreur.

Aucun de ces quatre types ne se règle par une demande de suppression adressée à l'éditeur du modèle : les moteurs de réponses ne suppriment pas une information isolée, ils réapprennent progressivement à partir de ce qu'ils lisent lors de leurs mises à jour de corpus.

Des écarts au plan de correction

L'audit se termine par une liste ordonnée d'actions rattachées chacune à une source précise et à un écart identifié, jamais par des recommandations générales dont l'effet ne peut être vérifié. Trois familles d'actions reviennent systématiquement dans les plans de correction.

  • Corriger la source primaire : pages institutionnelles, mentions légales, registres officiels, fiches d'entreprise, pages biographiques des dirigeants.
  • Aligner les sources tierces qui font autorité : bases de connaissances, annuaires sectoriels, notices encyclopédiques, profils professionnels publics.
  • Produire la réponse manquante : quand aucun contenu maîtrisé ne répond à une question fréquente, le modèle emprunte une réponse ailleurs. La structuration de ces contenus relève de l'Answer Engine Optimization.

Avant de clore un plan de correction post-audit

  • Chaque écart de la grille est rattaché à une action et à une source précise, jamais laissé en observation générale.
  • Les actions sont priorisées selon la fréquence du prompt concerné et la gravité de l'écart, pas selon leur facilité d'exécution.
  • Un porteur et une échéance sont désignés pour chaque action, y compris celles qui dépendent d'un tiers.
  • La date de mise en œuvre de chaque correction est consignée pour permettre de mesurer ensuite le délai de propagation.

Ce qui fonctionne et ce qui échoue dans un protocole d'audit

À faire

  • Figer le jeu de prompts avant le premier relevé et ne plus le modifier sans le documenter.
  • Interroger systématiquement plusieurs modèles distincts à chaque campagne.
  • Archiver le texte intégral des réponses, horodaté, y compris celles qui ne posent aucun problème.
  • Distinguer les quatre types d'écarts avant de proposer une correction.
  • Rejouer le protocole à intervalle fixe, y compris en l'absence d'actualité particulière.

À éviter

  • Reformuler les prompts au fil des relevés pour « mieux » interroger le modèle.
  • Se limiter à un seul assistant conversationnel pour conclure sur l'ensemble du sujet.
  • Confondre un score de présence médiocre avec un problème de notoriété générale.
  • Adresser une demande de suppression à un éditeur de modèle pour une réponse inexacte.
  • Considérer un relevé unique comme suffisant pour juger d'une tendance.

Quels indicateurs suivre dans la durée

  • Taux de citation spontanée sur les prompts de recommandation, par modèle interrogé.
  • Taux d'exactitude factuelle sur les prompts d'identité, agrégé sur l'ensemble des modèles.
  • Part des réponses appuyées sur une source que l'organisation maîtrise directement.
  • Délai de propagation d'une correction, mesuré du jour de la publication de la source corrigée au jour où la réponse générative change effectivement.

Ces indicateurs alimentent la dimension de visibilité conversationnelle de l'Indice Oroosa et se rejouent au même rythme que le reste du dispositif décrit dans le pilier visibilité IA. Ils permettent également de vérifier que l'amélioration constatée sur un modèle ne masque pas une dégradation sur un autre, un cas plus fréquent qu'on ne l'imagine tant les politiques éditoriales divergent.

Quand cet audit devient urgent

  • Avant une levée de fonds, une cession ou un appel d'offres structurant : de nombreux tiers interrogent désormais un assistant conversationnel avant même d'ouvrir un dossier.
  • Après un épisode médiatique : c'est la période où le corpus documentaire se fige autour d'une version unique des faits, favorable ou non.
  • En cas d'homonymie avérée avec une entité controversée dans un secteur proche.
  • Lors d'un changement de nom, de dirigeant ou de périmètre d'activité : la réponse générée retarde généralement de plusieurs mois sur la réalité constatée.

Le cadre d'intervention du cabinet sur ce volet est décrit dans les expertises, avec des livrables systématiquement adossés au protocole de relevé présenté ici plutôt qu'à des observations ponctuelles.

Questions fréquentes

Peut-on faire retirer une réponse fausse d'un assistant conversationnel ?

Pas directement, et aucun mécanisme de suppression généralisé n'existe à ce jour. On corrige les sources qui alimentent la réponse et on documente la version exacte ; le changement se constate au relevé suivant, en général au bout de plusieurs semaines à plusieurs mois selon le modèle.

Combien de prompts faut-il pour un audit sérieux ?

Entre trente et soixante pour une exposition standard, davantage pour une organisation très exposée, répartis sur les six familles décrites et rejoués sur au moins trois modèles distincts. En dessous, les variations naturelles de génération rendent la lecture peu fiable.

En quoi cet audit diffère-t-il d'un audit d'e-réputation classique ?

Par le périmètre. L'audit de présence IA ne regarde que les réponses générées par les moteurs de réponses ; l'audit d'e-réputation couvre l'ensemble des canaux, dont les moteurs de recherche classiques, la presse, les avis et les réseaux sociaux.

Un score de présence IA médiocre reflète-t-il un manque de notoriété ?

Pas nécessairement. Il peut refléter un défaut de sources structurées et cohérentes plutôt qu'un déficit réel de notoriété : une organisation connue peut être mal restituée si ses données publiques sont incomplètes ou divergentes d'une source à l'autre.

Sources et références

  1. Google, Google Search Central — comprendre les résultats générés par l'IA, 2024.
  2. schema.org, schema.org — vocabulaire de balisage structuré, 2024.
  3. Wikimedia Foundation, Wikidata — aide à la vérifiabilité des déclarations, 2024.
  4. Commission européenne, Règlement sur l'intelligence artificielle (AI Act), 2024.

Une situation comparable ?

Nous examinons votre contexte et indiquons, sans détour, si une intervention se justifie.

Prendre rendez-vous