Growli
博客

AI 声量占比:如何测量与建立基准

Zakaria Reziki

作者: Zakaria Reziki

Growli 首席执行官 · 2026年8月13日 · 11 分钟阅读

在 Zakaria Reziki 制定的编辑标准下借助 AI 撰写,并在通过来源与质量的自动检查后发布。

AI 声量占比,是指在某个 AI 助手上,你追踪的提问运行中提到你品牌的比例——品牌提及次数 ÷ 总提问运行次数,按助手分别计算,而不是混合成一个数字。 它是答案引擎时代最接近自然搜索声量占比(share of search)的指标;与后者一样,只有在问题集、样本量和计数规则保持不变时,这个数字才有意义。

这个指标之所以重要,是因为点击已不再是必然结果。Pew Research Center 的研究发现,当 Google 用户看到 AI 摘要时,只有 8% 的访问会点击传统搜索结果,而没有 AI 摘要时这一比例为 15%(Pew Research Center)。当答案取代了结果页,在答案里被点名本身就是曝光。

本文会给出精确的计算公式,解释为什么各助手的基准分化是合理的,提供一份今天就能复制进表格的模板,并说明如何把每一类缺口转化为具体动作,而不是一份含糊的内容需求单。

把指标定义讲清楚

多数团队把两件不同的事塞进同一个标签里。把它们拆开,诊断会容易得多。

提及率回答的是一个是非题:你到底有没有出现?答案份额回答的是竞争问题:在助手点名的所有品牌里,你占了多少露出?一款 B2B 工具的提及率可以高达 90% 却依然失败——因为它在十个品牌的列表里排第九,而买家的注意力只落在前三个上。

两者都要按助手、按提问簇分别计算。所谓提问簇,是指属于同一个决策环节的一组购买意图问题——价格对比、某个具体竞品的替代方案、某场景下的最佳工具、集成能力等。跨簇取平均,得到的数字会因为你无法追溯的原因而上下浮动。

  • 提及率(%) = 出现你品牌的运行次数 ÷ 总提问运行次数(限定单个助手、单个提问簇)× 100。
  • AI 答案份额(%) = 你的品牌提及数 ÷ 同批答案中所有品牌提及数 × 100。这才是真正的份额指标,因为它相对于一个明确的竞品集是零和的。
  • 加权份额(可选) = 同一比值,但按出现位置为每次提及加权,让列表首位比脚注更值钱。用一套简单权重(首位 = 1.0、中部 = 0.6、末位 = 0.3)并把它记录下来。
  • 推荐率 = 你被作为推荐点名(而不仅仅是被举例提到)的运行次数占比。高意图提问值得单列这一项。

为什么重要

有无 AI 摘要时的结果点击率

来源: Pew Research Center

决定你的数字有没有意义的三个输入

AI 可见度指标的稳定性,取决于测量方式的稳定性。有三个决策一旦草率处理,破坏力最大。

第一是提问集。用文字固定下来——确切的表述方式、市场、语言、人物设定框架——并做好版本管理。每次新增提问,趋势线就会断裂,所以要把新问题作为一个新簇添加,而不是去改动旧簇。提问数量的目标是覆盖完整决策,而不是显得工作量大:每个市场挑选 20 到 40 个精准的购买类问题,胜过几百个泛泛的问题。

第二是运行次数。助手的输出并不确定,同一个提问问两次,可能点名不同的品牌,涉及实时检索时尤其如此。也就是说,单次运行只是个案。每个助手每个周期,每条提问都要跑多次——5 次是可行的下限,如果你所在品类竞品长尾很长就要更多——并把小样本上的小差距当作噪音,而不是变化。

第三是提及规则。提前决定:裸链接算不算?出现在信息源列表里的引用算不算提及?错别写法和母品牌名怎么处理?负面提及算不算?把规则写下来;关于可见度到底有没有提升的争论,大多源自这里的不一致。

各助手基准为何分化——以及为什么这是对的

同样的提问下,一个品牌在 Perplexity 的答案份额是 55%,在 ChatGPT 只有 12%,这不是测量错误。这些系统在"哪些品牌有资格被点名"这一层就不一样。

最大的分野在于检索式与参数化知识。依赖实时网页搜索的助手,呈现的是当前索引和排序层所偏好的内容;而主要来自模型权重的答案,反映的是品牌在训练数据中的显著程度。OpenAI 表示 ChatGPT search 结合了模型本身与来自网络及第三方提供方的信息(OpenAI),Anthropic 把网页搜索做成一个由 Claude 自行决定何时调用的工具(Anthropic),Perplexity 从设计上就默认围绕检索与引用(Perplexity),Google 则将其 AI 功能记录为叠加在搜索之上、具有自身链接行为的一层(Google Search Central)。资格判定不同,品牌名单自然不同。

第二个驱动因素是信息源偏好。有的助手偏向编辑类盘点文章和评测平台,有的更信任技术文档、论坛和官方站点。如果你所在品类的第三方报道集中在少数几篇清单式文章上,那么信任这些页面的助手,就会过度放大在这些页面上排名靠前的品牌。

第三是时效与依据规则。一个新上线的竞品,可以立刻出现在偏检索的助手里,却在偏权重的助手里数月隐形。地区、语言,以及工具是否判断自己需要联网搜索,都会带来更多合理的差异。

实际结论是:永远不要把跨助手的混合平均值作为核心结论。要给出一个矩阵。助手之间的落差本身就是洞察,因为它能告诉你问题出在信息源覆盖、在别人页面上的排名,还是干脆缺席于语料。这种按助手拆解的视角,正是我们在 Growli 所构建的核心,也正是为什么一个全局单一分数是整份报告里最没用的数字。

结构性差异,不是噪音

数字分化背后的三个因素

  • 检索 vs 模型权重

    带实时搜索的助手反映索引;依赖权重的助手反映训练数据。

  • 来源偏好

    有的助手偏向盘点和评价平台,有的偏向文档、论坛和官网。

  • 新鲜度与接地

    新竞品会立刻出现在检索型助手里,数月后才进入权重型助手。

可直接复制的基准表模板

按"每个助手 × 每个提问簇 × 每个周期"建一行。列的顺序如下:

有两种读法。横着读一行,你能看出某个提问簇在一个助手上健康、在另一个助手上崩了。竖着读一列,你能看出某个竞品是到处都赢(语料与权威度问题),还是只在某一个入口赢(可以定点解决的信息源问题)。

再加一张表,记录竞品集——5 到 8 个指定对手,本周期内固定不变——以及完整的提问清单和提及规则。没有这些,下个季度的数字就无法和本季度对比。

  • 周期 —— 周或月,并注明运行日期。
  • 助手 —— ChatGPT、Gemini、Claude、Perplexity、Copilot、Grok。各占一行,不做混合。
  • 提问簇 —— 例如某场景最佳工具、某竞品替代方案、价格。
  • 运行次数 —— 该行背后的总提问运行次数。每条提问低于 5 次的都应标注为低置信度。
  • 你的提及数 —— 按已记录规则计算,包含你品牌的运行次数。
  • 提及率 % —— 你的提及数 ÷ 运行次数。
  • 品牌提及总数 —— 同批答案中,你和所追踪竞品集的全部提及次数。
  • 答案份额 % —— 你的提及数 ÷ 品牌提及总数。
  • 平均位置 —— 被列入清单时的平均排名。
  • 头号竞品 + 其份额 % —— 到底是谁占了这个位置。
  • 主要被引用域名 —— 助手最依赖的三个信息源;这就是你的行动清单。
  • 较上期变化 —— 用百分点表示,而非百分比变化,避免小基数夸大波动。

把声量缺口转化为动作

一份以百分比收尾的声量占比报告,只是一块仪表盘。真正的价值在于从缺口类型到干预手段的映射,而值得单独命名的缺口类型其实只有几种。

某个提问簇在所有助手上都缺席,说明你不在答案所依据的原始素材里。要做的是覆盖:在助手已经会引用的那些页面上被点名、被描述、被拿来对比——评测平台、品类盘点、社区讨论帖、行业媒体——同时确保自己的页面直白讲清你做什么、给谁用、多少钱。

在偏检索的助手里出现、在偏权重的助手里缺席,指向的是时效问题。你存在于实时网络,但还没进入更深层的语料。要预留滞后期,同时把精力集中在由检索决定资格的入口上。

被点名但排在最后,是对比性证据的问题。助手会按它在信息源里看到的表述框架来排序列表。如果竞品有明确的对比页、价目表和使用场景说明,而你没有,你就会被归入陪跑者。把细节写出来——说明你不适合谁,和说明你适合谁一样有用。

被点名但属性错误,危害最大,而且如果你只数提及次数就最容易漏掉。要记录别人对你的具体说法,而不只是记录"被提到了":错误的定价模式、漏掉的集成、过时的定位。到被引用的那个源头上去纠正它。

某个竞品在某一个助手上独大,通常能追溯到单个页面。在"被引用域名"这一列里找到它,然后判断该走哪条路:进入该页面、在同等权重的域名上做一个更强的替代内容,还是提出事实更正请求。

按商业价值排优先级,而不是按缺口大小。高意图的"替代方案"类提问上 10 个百分点的差距,比定义类问题上 40 个百分点的差距更值钱。如果你想了解提及率、情感倾向和引用来源之间更完整的框架,可以看我们的入门文章 AI 可见度

从缺口到动作

先判断缺口类型,再选对策

  1. 到处缺席

    你不在答案的来源材料里 — 去助手引用的页面上赢得报道。

  2. 被提及但排最后

    对比证据不足 — 发布明确的对比、价格和用例页面。

  3. 属性有误

    记录错误说法,去被引用的来源处更正。

  4. 单一竞品垄断

    找到起作用的那一个页面,争取收录或做出替代。

测量频率、置信度,以及什么才算真正的变化

月度测量适合大多数品类;在产品发布、品牌重塑或正在推进事实更正时,周度才有必要。无论选哪种,都要在一个较短的时间窗内跑完整套提问集,避免模型更新横跨你的样本。

在出报告之前先设定变化阈值。每条提问跑 5 次的情况下,单个提问簇上几个百分点的波动完全在抽样误差范围内——只有当它连续两个周期保持,或在同一助手的多个提问簇上同时出现时,才能称为变化。每份报告都要标注可能解释跳变的事件:模型更新、新竞品上线、某篇大型第三方文章上线、你自己网站的改动。

最后一条纪律:保留原始答案,而不只是统计结果。半年后,统计数据只会告诉你份额下降了,而存档的答案会告诉你为什么——这正是一个站得住脚的 AI 可见度指标,与一个只会引发争吵的数字之间的区别。

看看 AI 如何谈论你的企业

Growli 测量你在 ChatGPT、Gemini、Claude 和 Perplexity 中的 AI 答案份额,并把每个差距转化为按优先级排列的行动。

立即开始

FAQ

不存在通用基准,因为这个数字完全取决于你的提问集和竞品集。有用的参照是相对值:在相同提问、相同助手上,你的答案份额与最接近的三个竞品的对比,以及你自己跨周期的走势。在一个只有五个品牌的市场里,领跑者的答案份额可能超过 30%;而在有三十款可信工具的拥挤市场里,同样的数字就相当出色了。

搜索声量占比衡量的是品类搜索需求中提到你品牌的比例,依据的是查询量。AI 声量占比衡量的是 AI 生成答案中提到你品牌的比例,依据的是你自己掌控的提问运行。前者反映既有需求;后者反映助手认为哪些品牌有资格被推荐,因此即使需求持平,它也可能发生变化。

由于助手输出并不确定,每条提问只跑一次只能算个案。每个助手每个周期,每条提问跑 5 次,是取得稳定提及率的可行下限;在竞品高度同质化的品类里,次数越多越好。务必把运行次数与百分比一并记录,便于读者判断置信度。

应该汇报按助手拆分的矩阵,下面可以附一个可选的加权汇总,但绝不要只给一个混合数字。各助手在检索架构、信息源偏好和时效性上都不同,单一平均值会掩盖真正告诉你该修什么的规律。如果管理层一定要一个数字,就按各助手在你真实受众中的占比加权,并把各项分量列在下方。

这由你决定,但必须一次性定好并记录下来。很多团队把答案正文里点名的品牌算作提及,而把信息源引用单列一列跟踪,因为两者含义不同:正文提及是推荐,引用是实现机制。混在一起会虚高你的分数,也会模糊要采取的行动。

可以,前提是提问集较小。固定 20 条提问,在两三个助手上各跑 5 次,记录被点名的品牌和被引用的信息源,然后在表格里算出那两个比值。一旦你需要在多个助手、多个市场和语言上按固定节奏重复,并保存原始答案,手动就不现实了——这也正是团队开始上工具的时候,用我们的或用别家的都一样。

每周通讯

每周 AI 搜索增长技巧

和众多企业主一起,获取被 Google 收录、被 AI 推荐的实用建议。