Growli
博客

AI 助手如何决定推荐哪些企业

Zakaria Reziki

作者: Zakaria Reziki

Growli 首席执行官 · 2026年8月14日 · 12 分钟阅读

在 Zakaria Reziki 制定的编辑标准下借助 AI 撰写,并在通过来源与质量的自动检查后发布。

AI 助手推荐企业的方式,是跑一条检索流水线:先把你的提问改写成若干次搜索,召回一批文档,按可信度给来源加权,判断每一处提及对应现实中的哪家企业,然后综合出一段简短回答,点名那些通过了全部四道过滤的实体。没有哪个助手手里握着一份现成的“利兹最好的水管工”排行榜等着念给你听。这份名单是在你按下回车后的几秒钟内,用模型当时能抓到、且愿意信任的材料现场拼出来的。

这个区别决定了打法。如果你把它当成一种观点,你会想去说服模型;如果你把它当成一条流水线,你会去修那个让你掉队的具体环节——而这些环节在 ChatGPT、Gemini、Claude、Perplexity 和 Copilot 上的表现并不一样,这正是同一句提问在各家给出不同名字的原因。

下面把这条流水线从头走到尾,凡有官方公开说明的平台行为都会标明出处,并明确指出每一步企业真正能撬动的是什么。

从提问到点名之间的四个阶段

“曼彻斯特做商业空间精装,该找谁?”这类提问并不是一条搜索词。在召回任何内容之前,助手会先判断这个问题是否需要联网,然后把请求扩展成几条具体的搜索——通常是品类词、地域限定词,再加上“最好”“评价”“对比”这类意图词的组合。OpenAI 的说明是,ChatGPT 搜索把模型与网络信息结合起来,并给出来源链接,而不是纯靠训练数据作答(OpenAI)。

召回会返回一个候选集:通常是几十条 URL,其中只有少数几条能塞进工作上下文。接着是过滤——有些来源在商业类论断上被视为可靠,有些被忽略,有些则因为站点屏蔽了爬虫而被排除。以 Claude 的联网搜索为例,Anthropic 说明其回答会附带所用页面的引用(Anthropic),这意味着来源是承重的,也是可核查的。

然后是绝大多数企业从没想过的一步:实体识别。助手必须判断“Northgate Interiors”“Northgate Interiors Ltd”和某篇行业杂志里没点名的那家承包商,是不是同一家公司——或者根本不是。最后是综合生成:模型把两到五个名字写进一段话里,顺序取决于每个候选在召回证据中出现得有多强、有多一致。

每一个阶段都是一道过滤。你可以做到爬虫可抓、口碑良好、确实是最优选,却仍然在实体识别这一关掉下去。判断到底是哪道过滤把你筛掉了,比任何泛泛的“为 AI 做优化”建议都有用。

  • placeholder
  • x
  • 阶段闸口

推荐流水线

四道过滤:从一句提问到点名一家企业

  1. 理解并扩展检索

    助手先判断是否需要联网,再用买家的说法把提问改写成若干条具体搜索。

  2. 召回

    从该平台的索引中拉取几十条 URL,其中只有少数几条能进入工作上下文。

  3. 按来源可信度加权

    横向对比选项的独立页面优先于自我描述;被屏蔽或过期的来源被淘汰。

  4. 识别实体

    各处提及被收拢成同一家真实企业——或者被拆开,从而削弱每一份证据。

  5. 综合生成

    两到五个名字被写进一段话,带有明确、可引用限定条件的候选更占优。

阶段一:召回——先能被抓取,再谈能被找到

抓取失败,后面一切都无从谈起。每家助手都有自己的爬虫和索引,也都公开了对应的 user agent:OpenAI 明确 OAI-SearchBot 用于让站点出现在 ChatGPT 搜索结果中,GPTBot 用于训练(OpenAI),屏蔽其中一个并不等于屏蔽另一个。很多站点在 2023 年为了挡住 AI 训练而写的 robots.txt,往往连搜索爬虫一起挡在了门外——这是自己给自己下的封杀令,再多的内容功夫都补不回来。

助手背后的索引同样关键。Google 表示,其搜索中的 AI 功能依托与搜索相同的系统和索引,适用的也是同一套 Search Essentials 指南(Google Search Central)。Microsoft Copilot 沿用 Bing 的索引,因此 Bing 站长指南中关于可抓取性、规范 URL 和内容质量的要求就是实际规则书(Bing 站长指南)。Perplexity 使用自建检索并在正文中标注来源,还通过 Publishers Program 与出版方建立了商业合作(Perplexity)。

还有一类问题是措辞错配。助手用的是用户的说法,不是你市场部的说法。一家自称提供“一体化职场空间解决方案”的公司,在“曼彻斯特办公室精装承包商”“英国商业室内精装公司”“最好的办公空间精装公司”这类扩展检索面前,等于隐形。服务页面上用买家真正使用的品类白话,才能让页面在真实被执行的查询里被召回。

这一步你能控制的是:爬虫访问权限、页面级可索引性、关键页面的更新时效,以及你的术语是否对得上助手可能生成的搜索措辞。

阶段二:来源可信度——入围名单通常由第三方页面决定

文档召回之后并非一视同仁。助手会大量倚重那些读起来像独立评估的页面——目录站、点评平台、行业媒体、对比文章、协会会员名录、平台商家主页——因为这些页面本身就列着相互竞争的候选项。厂商自己的官网非常适合佐证细节,却完全不能作为“更优”的证据;“我们是行业领先服务商”这类说法,模型早就被训练成打折处理。

所以现实中的入围名单,往往在你的官网被读到之前就已经定了。如果关于你所在品类的五篇盘点文章一共提到八家公司,而你一家都不在其中,助手的候选集就是那八家。你的站点只有在名字已经出现之后才会被抓来补充细节,或者干脆不被抓。这种不对称让人不舒服,但可执行:在那些已经能排到“某地最好的某某”的页面上争取到一行位置,比再改一版官网首页有用得多。

跨来源的一致性是第二重信任信号。当六个彼此独立的页面用同样的说法描述你——同样的专长、同样的城市、同样规模的客户——模型就会把这段描述当成既定事实。当它们互相矛盾时,模型就会含糊其辞,而含糊的实体会被从简短回答里删掉,因为解释它们太费字数。

时效性的分量比多数团队预想的更重。面对商业类问题,助手偏好日期较新的文档,所以一条 2019 年、电话号码已停机的目录信息,比根本没有这条信息更糟。盘点你出现在哪些地方、把过期资料改掉,是没什么光彩但直接作用于召回的活儿。测量这一侧的方法,我们在 AI 可见度里做了展开。

  • 构建入围名单的页面:品类盘点、“最佳榜单”、对比与替代方案文章、点评平台、行业目录和协会名录。
  • 佐证细节的页面:服务页、价格页、客户案例、关于我们,以及结构化数据。
  • 会拖你后腿的页面:联系方式错误的过期资料、无人维护的重复条目,以及描述你已不再提供的业务线的页面。

来源可信度盘点

在再改一版页面之前,先修这些

  • 出现在已经能为你品类提问排名的页面上

    盘点文章、对比文章、目录站和协会名录,构成了助手可用的候选集。

  • 让各处对你的独立描述保持一致

    六个来源说的是同一专长、同一地域,论断就变成既定事实;来源互相矛盾则会导致含糊表述。

  • 清理或修正过期资料

    面对商业类问题,一条号码停机、业务已停的过期条目比根本没有条目更糟。

  • 发布可验证的差异点,而不是形容词

    行业、单量规模、资质认证和交付周期可被引用;“屡获殊荣”会被打折处理。

阶段三:实体识别——成为一家没有歧义的企业

模型此时手上是一堆提及,必须把它们收拢成实体。名称高度相似、品牌更名、多地经营、控股架构,都会在这里造成看不见的损失。如果关于你公司的证据被分摊到三个残缺的身份上,哪一个看起来都不够格被推荐,尽管加总起来完全够。

机器可读的身份是成本最低的解法。Google 面向本地商家的结构化数据文档规定了描述实体门店的属性——名称、地址、电话、营业时间、地理坐标、价格区间(Google Search Central)——而 Schema.org 的 sameAs 属性,存在的意义正是把你的页面与同一实体的权威引用关联起来,比如官方主页或知识库条目(Schema.org)。把这些填全,等于给每个爬虫同一份关于“你是谁”的无歧义声明。

剩下的就是纪律。全网统一使用同一套“注册名+商用名”的写法。标题标签、目录站资料、LinkedIn 简介里保持同样的品类用词。第三方平台上的地址和电话要与官网逐字一致。如果你有多个网点,就给每个网点单独一个可索引页面并配各自的结构化数据,而不是用一个下拉菜单页糊弄过去。

助手还会通过共现来识别实体:出现在你名字附近的品牌、技术、资质和客户类型。如果召回的证据里没有任何内容把你和提问中的那项具体服务挂上钩,你就会被识别成行业里的一家普通公司——能被召回,但永远不会成为某个具体问题的答案。

阶段四:综合生成——入围名单如何变成一句话

到了综合生成这一步,模型手上大约有 5000 到 20000 词的召回文本,却只需要产出 120 词。压缩决定一切。有明确、可直接引用的表述支撑的候选活了下来;需要模型自己推理才能成立的候选被砍掉,因为它没有篇幅去论证。

内容在召回上下文中的位置有可测量的影响。Liu 及其同事的研究显示,语言模型在信息出现于长输入的开头或结尾时利用得最好,当相关段落位于中部时,准确率会明显下降(Liu 等人,《Lost in the Middle》)。落到实操上,这是在奖励内容结构:写在某个小节第一句里的论断,或放进标注清晰的对比表格里的论断,比同一句话埋在第九段中要更容易熬过压缩。

答案的形态也随来源的形态走。召回的是对比文章,你得到的就是一份对比;召回的是点评页面,你得到的就是口碑倾向。如果某个来源已经把这个市场框定为“三家企业级选项加两家高性价比选项”,助手往往会照搬这套框架,再把名字填进去。谁写出了那份被召回的框架,谁的影响力就大过写出最好销售文案的人。

最后,模型需要一个点名你的理由。“因为拥有 ISO 27001 认证,适合强监管行业”是一句助手可以直接摘用并站得住脚的话;“屡获殊荣、以客户为中心”不是。把买家真正会用来筛选的具体、可验证的限定条件公开出来——行业、单量规模、地域、合规资质、集成能力、交付周期——才是让你变得“可被引用”的差异点。

为什么同一句提问在各家助手上答案不同

分化是结构性的,不是随机的。Copilot 基于 Bing 的索引作答;Gemini 的 AI 功能运行在 Google 的搜索系统与索引之上(Google Search Central);Perplexity 通过自建体系检索并在正文标注来源;Claude 联网搜索,并为引用自网络的论断附上出处(Anthropic);ChatGPT 搜索把模型与网络信息结合并给出外链(OpenAI)。不同索引收录不同文档,更新节奏也不同。同一个问题,证据不同。

在这之上还叠加着四重变量。查询扩展方式不同,实际执行的搜索就不一样。采样让生成具有不确定性,同一个助手连问两次都可能给出不同顺序。地域推断会改变结果。而个性化——聊天记录或记忆功能——可能让某位用户的答案偏向他此前讨论过的品牌。

由此带来的操作层结论是:随手抽查一次几乎说明不了任何问题。要知道自己是否被推荐,你需要用同一组买家意图提问,在多个助手上、从你实际覆盖的地域出发反复运行,并且每次都记录被引用的来源。这正是 Growli 在做的事:我们按助手追踪提及、对比和推荐,展示答案是基于哪些来源生成的,再把缺口整理成一份带优先级的整改清单——详见产品原理

诊断也沿着这四个阶段走。哪儿都没被召回?怀疑爬虫权限或措辞错配。被召回却从不被点名?怀疑来源可信度或实体歧义。被点名但描述错了?说明某个过期来源占了上风,而它可以从引用里被定位出来。

缺口诊断

从症状倒推是哪一阶段出了问题

  1. 在任何助手上都没被召回

    逐一核对各平台公开 user agent 的爬虫权限、页面可索引性,以及你的措辞是否对得上买家的搜索用词。

  2. 被召回但从不被点名

    问题出在来源可信度或实体歧义——你只出现在弱来源里,或证据被拆散到几个口径不一的身份上。

  3. 只在某一家助手上被点名

    这是索引覆盖问题:支撑你的那份文档只存在于一个平台的索引里,其他平台没有。

  4. 被点名但描述有误

    某个过期来源占了上风;回答里的引用会告诉你该去修哪一个。

逐阶段来看,你真正能施加的影响

这条流水线上几乎没有什么会响应“说服”,但几乎所有环节都响应证据。工作按阶段划分得很清楚,值得按顺序推进,而不是一股脑全上。

在召回阶段,抓手是技术和语言:放行你想要的搜索爬虫(对照各平台公开的 user agent 逐一核对),让关键商业页面保持可索引且内容新鲜,使用买家真正会输入的品类白话。在来源可信度阶段,抓手在站外:进入那些已经能在你品类提问下排名靠前的盘点和目录,修正过期资料,让各处对你的独立描述彼此吻合。

在实体识别阶段,抓手是结构:统一一套命名方式、各处联系方式一致、部署 LocalBusiness 或 Organization 结构化数据,并用 sameAs 链接指向你的权威主页。在综合生成阶段,抓手是编辑手法:把限定性事实写在小节第一句,发布带表格的对比型内容,给模型可以放心引用的、可验证的差异点。

这些都不是什么技巧,也都不是一劳永逸。索引会刷新,竞争对手会发内容,助手也会不打招呼地改变检索行为,所以测量闭环和整改本身同样重要。能被持续推荐的企业,是那些证据基础容易被找到、容易被信任、且不可能和别人混淆的企业。

看看 AI 如何谈论你的企业

Growli 测量你在 ChatGPT、Gemini、Claude 和 Perplexity 中的 AI 答案份额,并把每个差距转化为按优先级排列的行动。

立即开始

FAQ

ChatGPT 会把你的提问扩展成若干次网络搜索,召回一批页面,再用它信任的那部分写出回答并链接来源——OpenAI 的说明是,ChatGPT 搜索把模型与网络信息结合起来。由于入围名单来自召回的文档,目录站、点评平台和“最佳榜单”这类第三方页面通常决定了哪些公司能成为候选,而企业自己的官网主要起佐证细节的作用。

自然推荐里的位置买不到。你能影响的是助手召回到的证据:它的爬虫能否访问你的页面、独立来源对你的描述是否准确、你的身份是否没有歧义。有些平台确实与出版方或广告主存在单独的商业合作,但那与综合生成出来的推荐本身是两回事。

因为检索层不同。Google 表示其搜索中的 AI 功能使用与搜索相同的系统和索引,Perplexity 则通过自建体系检索并在正文标注来源,而 Copilot 沿用 Bing 的索引。不同索引收录的文档不同、新鲜度不同,证据集因此分化,名字自然也不同——这还没算上生成的不确定性和地域化因素。

有可能。OpenAI 为训练和为在 ChatGPT 搜索中呈现站点分别公开了不同的爬虫,因此一条为阻止训练而写的“一刀切”robots.txt 屏蔽规则,也可能把你从基于搜索的回答里剔除。请查阅各平台公开的 user agent,逐个爬虫做决定,而不是默认屏蔽所有与 AI 相关的爬虫。

具体、可验证、且写在前面的事实:你服务的行业、单量规模、覆盖地域、资质认证、集成能力和交付周期。关于长上下文行为的研究显示,模型对输入开头和结尾信息的利用比埋在中间的内容更稳定,所以把限定性论断放在小节第一句,并把对比内容整理成结构清晰的表格。

应该持续监测,而不是偶尔看一眼,因为索引刷新、竞争对手发内容或检索行为变化都会改变答案。考虑到生成具有不确定性、结果还随地域变化,单次抽查并不可靠。用一组固定的买家意图提问,按固定周期在多个助手上运行并记录被引用的来源,是唯一能看清真实变化的方式——这正是 Growli 自动化的那套闭环。

每周通讯

每周 AI 搜索增长技巧

和众多企业主一起,获取被 Google 收录、被 AI 推荐的实用建议。