Growli
Blog

Comment les assistants IA choisissent les entreprises citées

Zakaria Reziki

Par Zakaria Reziki

CEO — Growli · 14 août 2026 · 12 min de lecture

Rédigé avec l'aide de l'IA selon les standards éditoriaux définis par Zakaria Reziki, puis publié après des contrôles automatisés des sources et de la qualité.

Les assistants IA recommandent des entreprises en exécutant un pipeline de récupération : ils reformulent votre question en requêtes, rapatrient un ensemble de documents, pondèrent ces sources selon leur fiabilité, déterminent à quelle entreprise réelle chaque mention renvoie, puis synthétisent une réponse courte en nommant les entités qui ont franchi les quatre filtres. Aucun assistant ne détient un classement des « meilleurs plombiers de Lyon » qu'il n'aurait qu'à réciter. La liste est fabriquée au moment de la question, à partir de ce que le modèle a pu récupérer et juger crédible dans les secondes qui suivent votre validation.

Cette distinction change tout. Si vous y voyez une opinion, vous cherchez à convaincre le modèle. Si vous y voyez un pipeline, vous allez corriger l'étape précise où vous décrochez — et ces étapes ne se comportent pas de la même manière sur ChatGPT, Gemini, Claude, Perplexity et Copilot, ce qui explique pourquoi la même question produit des noms différents sur chacun.

Ce qui suit parcourt le pipeline de bout en bout, en s'appuyant sur le comportement documenté de chaque plateforme quand il existe, et indique clairement les leviers dont une entreprise dispose réellement à chaque étape.

Les quatre étapes entre une question et un nom

Une question comme « à qui confier l'aménagement de mes locaux commerciaux à Lille ? » n'est pas une requête de recherche. Avant toute récupération, l'assistant décide s'il a besoin du web, puis décline la demande en plusieurs recherches concrètes — généralement un mélange de termes de catégorie, de modificateurs géographiques et de mots d'intention comme « meilleur », « avis » ou « comparatif ». OpenAI décrit ChatGPT search comme la combinaison de son modèle et d'informations issues du web, avec des liens vers les sources, plutôt qu'une réponse tirée des seules données d'entraînement (OpenAI).

La récupération renvoie un ensemble de candidats : le plus souvent quelques dizaines d'URL, dont une poignée seulement tient dans le contexte de travail. Ces documents sont ensuite filtrés — certaines sources sont considérées comme fiables pour des affirmations commerciales, d'autres ignorées, d'autres écartées parce que l'éditeur a bloqué le crawler. La recherche web de Claude, par exemple, renvoie des réponses accompagnées de citations vers les pages utilisées (Anthropic) : les sources sont donc porteuses et vérifiables.

Vient ensuite l'étape à laquelle presque aucune entreprise ne pense : la résolution d'entité. L'assistant doit établir que « Northgate Interiors », « Northgate Interiors Ltd » et l'entreprise anonyme décrite dans un article de presse professionnelle sont la même société — ou non. Enfin, la synthèse : le modèle inscrit deux à cinq noms dans un texte, dans un ordre déterminé par la force et la cohérence de la présence de chaque candidat dans les preuves récupérées.

Chaque étape est un filtre. Vous pouvez être parfaitement crawlable, bien noté et objectivement la meilleure option, et perdre malgré tout à la résolution d'entité. Identifier quel filtre vous a éliminé est bien plus utile que n'importe quel conseil général sur « l'optimisation pour l'IA ».

  • placeholder
  • x
  • Étapes-filtres
  • :

Pipeline de recommandation

De la question au nom d'entreprise, en quatre filtres

  1. Interpréter et décliner

    L'assistant détermine s'il a besoin du web, puis reformule la question en plusieurs recherches concrètes avec le vocabulaire des acheteurs.

  2. Récupérer

    Des dizaines d'URL sont extraites de l'index de la plateforme ; seule une poignée tient dans le contexte de travail.

  3. Pondérer la fiabilité des sources

    Les pages indépendantes qui comparent les options passent devant les autodescriptions ; les sources bloquées ou obsolètes sortent.

  4. Résoudre les entités

    Les mentions sont regroupées en une entreprise réelle — ou éclatées, ce qui affaiblit chaque preuve.

  5. Synthétiser

    Deux à cinq noms sont inscrits dans le texte, avec un avantage aux candidats dotés de critères explicites et citables.

Étape 1 : la récupération — accessible d'abord, trouvable ensuite

Rien de ce qui suit ne compte si la récupération échoue. Chaque assistant utilise ses propres crawlers et son propre index, et chacun publie les user agents concernés : OpenAI documente OAI-SearchBot pour l'affichage des sites dans ChatGPT search, en plus de GPTBot pour l'entraînement (OpenAI), et bloquer l'un n'équivaut pas à bloquer l'autre. Un robots.txt rédigé en 2023 pour tenir l'entraînement IA à distance exclut fréquemment aussi le bot de recherche — une exclusion auto-infligée qu'aucun travail éditorial ne viendra corriger.

L'index derrière l'assistant pèse tout autant. Google indique que ses fonctionnalités IA dans la recherche s'appuient sur les mêmes systèmes et la même indexation que la recherche elle-même, et que les recommandations sont celles des Search Essentials (Google Search Central). Microsoft Copilot hérite de l'index de Bing : les consignes aux webmasters de Bing sur la crawlabilité, les URL canoniques et la qualité du contenu font donc office de règlement applicable (consignes aux webmasters Bing). Perplexity opère sa propre récupération, cite ses sources en ligne et a noué des accords commerciaux avec des éditeurs via son Publishers Program (Perplexity).

Reste le décalage de vocabulaire. Les assistants cherchent avec les mots de l'utilisateur, pas avec ceux de votre marketing. Une entreprise qui se présente comme un fournisseur de « solutions intégrées d'environnement de travail » est invisible face à une déclinaison de requêtes du type « entreprise aménagement bureaux Lille », « société d'agencement de locaux professionnels France » et « meilleures entreprises d'aménagement de bureaux ». Un langage de catégorie explicite sur vos pages de services, avec les mots que les acheteurs emploient réellement, est ce qui rend une page récupérable pour les requêtes effectivement lancées.

Ce que vous maîtrisez ici : l'accès des crawlers, l'indexabilité page par page, la fraîcheur de vos pages clés, et la correspondance entre votre terminologie et les formulations de recherche qu'un assistant est susceptible de générer.

Étape 2 : la fiabilité des sources — les pages tierces composent la liste

Une fois les documents récupérés, ils ne se valent pas. Les assistants s'appuient massivement sur les pages qui se lisent comme des évaluations indépendantes — annuaires, plateformes d'avis, presse professionnelle, comparatifs, listes de membres d'associations, profils de places de marché — parce que ce sont elles qui contiennent des listes d'options concurrentes. Le site d'un prestataire est excellent pour confirmer des informations et déplorable comme preuve de supériorité : « nous sommes le leader du marché » est une affirmation que le modèle a appris à minorer.

D'où ce constat : la liste effective est souvent arrêtée avant même que votre site ne soit lu. Si cinq comparatifs de votre catégorie citent huit entreprises et que vous n'en faites pas partie, l'ensemble de candidats de l'assistant se limite à ces huit-là. Votre site ne sera consulté que pour enrichir un nom déjà présent, ou pas du tout. L'asymétrie est inconfortable mais exploitable : obtenir une ligne dans les pages qui se classent déjà sur « meilleur X à Y » vous fait avancer davantage qu'une nouvelle réécriture de page d'accueil.

La cohérence entre les sources agit comme un second signal de confiance. Quand six pages indépendantes vous décrivent de la même façon — même spécialité, même ville, même taille de clients — le modèle traite cette description comme un fait établi. Quand elles se contredisent, il nuance, et les entités nuancées disparaissent des réponses courtes parce qu'elles coûtent des mots à expliquer.

La fraîcheur compte plus que la plupart des équipes ne le pensent. Les assistants privilégient les documents récents pour les questions commerciales : une fiche d'annuaire de 2019 avec un numéro hors service est donc pire que pas de fiche du tout. Auditer où vous apparaissez et faire corriger les profils obsolètes est un travail ingrat, à effet direct sur la récupération. Nous traitons le volet mesure dans visibilité IA.

  • Les pages qui construisent les listes : panoramas de catégorie, listes « meilleurs de », comparatifs et articles « alternatives à », plateformes d'avis, annuaires sectoriels et registres d'associations professionnelles.
  • Les pages qui confirment les informations : vos pages de services, votre page tarifs, vos études de cas, votre page « à propos » et vos données structurées.
  • Les pages qui vous nuisent : profils obsolètes avec de mauvaises coordonnées, fiches en double abandonnées, et pages décrivant une offre que vous ne proposez plus.

Audit de fiabilité des sources

À corriger avant de réécrire une page de plus

  • Figurer dans les pages qui se classent déjà sur les questions de votre catégorie

    Panoramas, comparatifs, annuaires et registres d'associations forment l'ensemble de candidats sur lequel travaille un assistant.

  • Faire concorder les descriptions indépendantes de votre entreprise

    Six sources décrivant la même spécialité et la même localisation transforment une affirmation en fait établi ; des sources contradictoires provoquent des réponses nuancées.

  • Supprimer ou corriger les profils obsolètes

    Une fiche périmée avec un numéro hors service ou une offre abandonnée est pire que pas de fiche du tout pour les questions commerciales.

  • Publier des différenciateurs vérifiables, pas des adjectifs

    Secteur, taille de projet, certification et délais sont citables ; « primé » est minoré.

Étape 3 : la résolution d'entité — être une entreprise sans ambiguïté

Le modèle dispose désormais d'un tas de mentions et doit les regrouper en entités. C'est là que les noms quasi identiques, les changements de marque, les activités multi-sites et les structures de holding provoquent des pertes silencieuses. Si les preuves relatives à votre société sont éclatées entre trois identités à moitié formées, aucune des trois ne paraît assez solide pour être recommandée, alors que leur somme le serait.

L'identité lisible par machine est le correctif le moins coûteux à disposition. La documentation de Google sur les données structurées des établissements locaux précise les propriétés qui décrivent une entreprise physique — nom, adresse, téléphone, horaires d'ouverture, géolocalisation, fourchette de prix (Google Search Central) — et la propriété sameAs de Schema.org existe précisément pour relier votre page aux références canoniques de la même entité, comme un profil officiel ou une page de base de connaissances (Schema.org). Les renseigner donne à chaque crawler le même énoncé sans ambiguïté de votre identité.

Le reste est une affaire de discipline. Utilisez partout le même schéma « raison sociale + nom commercial ». Conservez les mêmes mots de catégorie dans votre balise title, vos profils d'annuaires et votre description LinkedIn. Vérifiez que l'adresse et le numéro de téléphone des fiches tierces correspondent caractère pour caractère à ceux de votre site. Si vous avez plusieurs implantations, donnez à chacune sa page indexable avec ses propres données structurées, plutôt qu'une page unique pilotée par un menu déroulant.

Les assistants résolvent aussi les entités par co-occurrence : les marques, technologies, certifications et types de clients qui apparaissent près de votre nom. Si rien dans les preuves récupérées ne vous relie au service précis évoqué dans la question, vous serez identifié comme une entreprise générique de votre secteur — récupérable, mais jamais la réponse à une question précise.

Étape 4 : la synthèse — comment une liste devient une phrase

Au moment de la synthèse, le modèle dispose peut-être de 5 000 à 20 000 mots de texte récupéré et doit en produire 120. La compression décide de tout. Les candidats appuyés par des affirmations explicites et citables survivent ; ceux qui exigent une inférence sont coupés, faute de place pour argumenter.

La position dans le contexte récupéré a un effet mesurable. Liu et ses coauteurs ont montré que les modèles de langage exploitent le mieux l'information lorsqu'elle figure au début ou à la fin d'une longue entrée, avec une précision qui se dégrade nettement quand le passage pertinent se trouve au milieu (Liu et al., « Lost in the Middle »). Concrètement, cela récompense la structure : une affirmation énoncée dans la première phrase d'une section, ou dans un tableau comparatif clairement identifié, a beaucoup plus de chances de survivre à la compression que la même affirmation au neuvième paragraphe.

La forme de la réponse suit aussi celle de ses sources. Si les documents récupérés sont des comparatifs, vous obtenez un comparatif. Si ce sont des pages d'avis, vous obtenez du ressenti client. Si une source a déjà cadré un marché en « trois options entreprise et deux options économiques », l'assistant tend à reproduire ce cadrage et à y insérer des noms. Celui qui écrit le cadrage qui sera récupéré a plus d'influence que celui qui écrit le meilleur argumentaire commercial.

Enfin, le modèle a besoin d'un motif pour vous nommer. « Adapté aux secteurs régulés grâce à sa certification ISO 27001 » est une phrase que l'assistant peut reprendre et défendre. « Primé et orienté client » ne l'est pas. Publier les critères précis et vérifiables sur lesquels un acheteur filtrerait — secteur, taille de projet, zone géographique, conformité, intégrations, délais — vous fournit les différenciateurs qui vous rendent citable.

Pourquoi la même question donne des réponses différentes selon l'assistant

La divergence est structurelle, pas aléatoire. Copilot répond depuis l'index de Bing ; les fonctionnalités IA de Gemini s'appuient sur les systèmes de recherche et l'indexation de Google (Google Search Central) ; Perplexity récupère via sa propre infrastructure et cite en ligne ; Claude cherche sur le web et rattache des citations aux affirmations qu'il en tire (Anthropic) ; ChatGPT search combine le modèle et des informations du web, avec des liens sortants (OpenAI). Des index différents contiennent des documents différents, rafraîchis à des rythmes différents. Même question, preuves différentes.

À cela s'ajoutent quatre autres sources de variance. La déclinaison des requêtes diffère, donc les recherches réellement lancées ne sont pas les mêmes. L'échantillonnage rend la génération non déterministe : le même assistant peut produire deux ordres différents à la suite. La localisation modifie les résultats selon le pays et la ville déduits. Et la personnalisation — historique de conversation ou fonctions de mémoire — peut orienter les réponses d'un utilisateur vers des marques dont il a déjà parlé.

Conséquence opérationnelle : un sondage ponctuel ne vous apprend presque rien. Pour savoir si vous êtes recommandé, il faut lancer le même jeu de questions à intention d'achat, de façon répétée, sur plusieurs assistants, depuis les zones géographiques où vous vendez, en capturant chaque fois les sources citées. C'est ce que fait Growli : nous suivons les mentions, les comparaisons et les recommandations assistant par assistant, montrons sur quelles sources les réponses ont été construites, et transformons les écarts en une liste priorisée de correctifs — voir comment ça marche.

Le diagnostic suit les quatre mêmes étapes. Jamais récupéré, nulle part ? Suspectez l'accès des crawlers ou le décalage de vocabulaire. Récupéré mais jamais nommé ? Suspectez la fiabilité des sources ou l'ambiguïté d'entité. Nommé mais mal décrit ? Une source obsolète précise l'emporte, et les citations permettent de l'identifier.

Diagnostic des écarts

Remonter du symptôme à l'étape défaillante

  1. Jamais récupéré, sur aucun assistant

    Vérifiez l'accès des crawlers pour chaque user agent documenté, l'indexabilité des pages, et la correspondance entre vos formulations et les termes de recherche des acheteurs.

  2. Récupéré mais jamais nommé

    Fiabilité des sources ou ambiguïté d'entité : vous apparaissez dans des sources faibles, ou vos preuves sont éclatées entre des identités incohérentes.

  3. Nommé sur un seul assistant

    Problème de couverture d'index : le document qui vous appuie existe dans l'index d'une plateforme et pas dans les autres.

  4. Nommé mais mal décrit

    Une source obsolète précise l'emporte sur la description ; les citations de la réponse vous indiqueront laquelle corriger.

Ce que vous pouvez réellement influencer, étape par étape

Presque rien dans ce pipeline ne réagit à la persuasion, et presque tout réagit aux preuves. Le travail se répartit nettement par étape, et mieux vaut le séquencer ainsi que de tout mener de front.

À la récupération, les leviers sont techniques et linguistiques : autoriser les crawlers de recherche souhaités (en vérifiant les user agents documentés de chaque plateforme), maintenir vos pages commerciales clés indexables et à jour, et employer les mots de catégorie que vos acheteurs tapent réellement. À l'étape de la fiabilité des sources, les leviers sont externes : entrer dans les comparatifs et annuaires qui se classent déjà sur les questions de votre catégorie, faire corriger les profils obsolètes, et veiller à ce que les descriptions indépendantes de votre entreprise concordent.

À la résolution d'entité, les leviers sont structurels : un seul schéma de nommage, des coordonnées identiques partout, des données structurées LocalBusiness ou Organization, et des liens sameAs vers vos profils canoniques. À la synthèse, les leviers sont éditoriaux : énoncer les faits qualifiants dès la première phrase d'une section, publier du contenu de format comparatif avec des tableaux, et fournir au modèle des différenciateurs vérifiables qu'il peut citer sans risque.

Rien de tout cela n'est une astuce, et rien n'est définitif. Les index se rafraîchissent, les concurrents publient, et les assistants modifient leur comportement de récupération sans préavis : la boucle de mesure compte donc autant que les correctifs. Les entreprises recommandées de façon régulière sont celles dont la base de preuves est facile à trouver, facile à croire, et impossible à confondre avec celle d'un autre.

Voyez ce que l'IA dit de votre entreprise

Growli mesure votre part de réponses IA sur ChatGPT, Gemini, Claude et Perplexity — et transforme chaque écart en actions priorisées.

Commencer

FAQ

ChatGPT décline votre question en recherches web, récupère un ensemble de pages et rédige une réponse à partir de celles qu'il juge fiables, en liant ses sources — OpenAI décrit ChatGPT search comme la combinaison de son modèle et d'informations issues du web. Comme la liste finale provient des documents récupérés, ce sont généralement des pages tierces — annuaires, sites d'avis, listes « meilleurs de » — qui déterminent quelles entreprises sont candidates, tandis que le site de l'entreprise sert surtout à confirmer des informations.

On n'achète pas une place dans une recommandation organique. Ce que vous pouvez influencer, ce sont les preuves que l'assistant récupère : l'accès de ses crawlers à vos pages, l'exactitude des descriptions de sources indépendantes et le caractère non ambigu de votre identité. Certaines plateformes ont des accords commerciaux distincts avec des éditeurs ou des annonceurs, mais cela n'a rien à voir avec la recommandation synthétisée elle-même.

Parce que la couche de récupération diffère. Google indique que ses fonctionnalités IA dans la recherche utilisent les mêmes systèmes et la même indexation que la recherche, tandis que Perplexity récupère via sa propre infrastructure et cite ses sources en ligne, et que Copilot hérite de l'index de Bing. Des index différents contiennent des documents différents, avec des niveaux de fraîcheur différents : l'ensemble de preuves — et donc les noms — divergent, avant même de tenir compte de la génération non déterministe et de la localisation.

C'est possible. OpenAI documente des bots distincts pour l'entraînement et pour l'affichage des sites dans ChatGPT search : un blocage global dans le robots.txt rédigé pour empêcher l'entraînement peut aussi vous retirer des réponses adossées à la recherche. Vérifiez les user agents publiés par chaque plateforme et décidez bot par bot, plutôt que de bloquer par défaut tous les crawlers liés à l'IA.

Des faits précis, vérifiables et énoncés tôt : les secteurs que vous servez, les tailles de projet, les zones géographiques, les certifications, les intégrations et les délais. Les recherches sur le comportement en contexte long montrent que les modèles exploitent plus fiablement l'information située au début et à la fin d'une entrée que celle enfouie au milieu : placez donc l'affirmation qualifiante dans la première phrase d'une section et gardez vos contenus comparatifs dans des tableaux clairement structurés.

En continu plutôt qu'à l'occasion, car les réponses changent au rythme des rafraîchissements d'index, des publications de concurrents et des évolutions de la récupération. Un contrôle isolé n'est pas fiable, puisque la génération est non déterministe et que les résultats varient selon la localisation. Lancer régulièrement un jeu fixe de questions à intention d'achat sur plusieurs assistants, en consignant les sources citées, est le seul moyen de voir de véritables évolutions — c'est la boucle que Growli automatise.

Newsletter hebdomadaire

Conseils hebdomadaires de croissance en recherche IA

Rejoignez les entrepreneurs qui reçoivent des conseils concrets pour être trouvés sur Google et recommandés par les IA.