如何追踪品牌在 ChatGPT 中的提及情况
作者: Zakaria Reziki
Growli 首席执行官 · 2026年8月19日 · 10 分钟阅读
在 Zakaria Reziki 制定的编辑标准下借助 AI 撰写,并在通过来源与质量的自动检查后发布。
要追踪品牌在 ChatGPT 中的提及情况,就用一组固定的买家式提示词按周期反复跑测,并在每次运行时记录:品牌是否出现、出现在回答的哪个位置、以什么情感倾向被描述、有哪些竞品与它同时出现、以及回答引用了哪些来源。 在 AI 助手里被提及是一种概率,而不是一个事实,所以唯一诚实的测量方式,就是用稳定的提示词跑很多次,看观察到的出现率。
多数团队的起点是:把品类问题往 ChatGPT 里输一遍,截个图,丢进群里。这不是监测,这是轶事。一小时后再问同一个问题,品牌排序会变,竞品会凭空冒出来,引用来源可能整套换掉。本文接下来讲的,就是把这些轶事变成可以做趋势、可以汇报、可以据此行动的可靠测量的方法。
为什么一次性人工抽查会误导你
大语言模型的推理默认是不可复现的。Thinking Machines Lab 的工程师记录过:即使温度设为 0,批处理和内核层面的非确定性也会让完全相同的请求返回不同的补全结果——他们那篇关于攻克 LLM 推理中的非确定性的文章解释了同一条提示词为何会在多次运行间漂移。OpenAI API 在其chat completions 接口文档中提供了尽力而为的 `seed` 参数和温度控制,但你和你的买家实际使用的 ChatGPT 消费端界面,两者都不提供。
除了采样带来的方差,ChatGPT 还叠加了个性化。OpenAI 的记忆功能常见问题说明了助手如何把此前对话中的细节带入新对话。如果你已经用这个账号讨论了半年自家公司,那这个账号恰恰是全世界最不适合用来测量「陌生人会不会听说你公司」的地方。
还有一层检索。当 ChatGPT 联网搜索时,它会抓取实时页面并给出链接,OpenAI 在其ChatGPT search 发布说明中对此有说明。相隔几秒的两次运行,可能检索到不同页面,因而得出不同结论。
这件事之所以比「好奇心」更重要,在于它的利害关系。Pew Research Center 发现,Google 用户在出现 AI 摘要的访问中点击结果链接的比例为 8%,而没有 AI 摘要时为 15%。当回答本身吸走了点击,被写进回答里才是真正算数的曝光——而这件事,靠截图是管不住的。
回答为何重要
Google 搜索中的链接点击率:有无 AI 摘要对比
出现 AI 摘要的访问
8%
未出现 AI 摘要的访问
15%
来源: Pew Research Center
搭建贴合真实买家问题的提示词集
提示词集就是你的仪器。它错了,后面所有数字都是噪音。几乎所有人一开始都会犯同一个错:追踪带自家品牌名的提示词——「Growli 好用吗?」——这什么都测不出来,因为你已经把答案递给助手了。要追踪的是买家在还不知道你存在之前会问的问题。
素材要从真实语言存在的地方挖:销售通话录音、客服工单、站内搜索日志、开通引导表单里的提问,以及 Google Search Console 里的长尾查询。然后把它们归成四类。
目标是 30 到 60 条提示词,向与你营收最相关的类别倾斜。要照人打字的样子写,而不是市场人写标题的样子——写「月费 50 美元以内、适合小团队的最佳 X」,而不是「X 解决方案概览」。然后锁定措辞。每一次改动都会重置基线,所以要留变更记录,并把改写过的提示词当作一条全新的提示词、开一段新的历史,而不是老数据的延续。
- 品类发现类: 「建筑公司最好用的项目管理工具」「哪家给种子轮初创公司做 SOC 2 审计」。
- 对比类: 「面向大型企业,X 和 Y 怎么选」「X 的替代品」「比 X 便宜又支持 SSO 的方案」。
- 场景与任务类: 「怎么把 4 万个 SKU 迁移到新的 PIM」「追踪 AI 搜索可见度的工具」。
- 顾虑与风险类: 「X 的安全性够处理医疗数据吗」「这个品类里哪些厂商的售后很差」。
确定跑测频率,并保持条件恒定
频率是统计置信度与成本之间的权衡。每条提示词每周只跑一次,几乎什么都说明不了,因为运行间的方差比你关心的大多数周环比波动还大。可行的下限是每个周期每条提示词跑三次、每周一轮,这样「是否被提及」就能表达为一个比率——「12 次运行中被提及 7 次」——而不是一个是或否。
要在有事件时临时提高频率,而不是长期加密:产品发布、调价、竞品拿到融资、评测站上出现一波新内容。没有事件时,每周一轮足以看清方向,同时让数据序列保持可读。
条件和频率一样重要。规则很枯燥,但不可妥协:一次只改一个变量,绝不在同一周里同时改动测量设置和内容策略。
另外,每次运行都要一并记录模型版本。模型更新是 AI 回答出现台阶式变化的最大单一来源,一条没有版本标注的趋势线,会让你去追查内容问题,而真实原因其实是平台变动。
- 退出登录后跑测,或使用一个关闭了记忆和自定义指令的干净账号。
- 逐条固定地区与语言;同一个问题在第二个市场跑测,要当作另一条独立提示词,而不是变体。
- 始终使用同一个入口——开启搜索的网页端与纯 API 调用,表现并不一样。
- 所有时间戳统一用 UTC,周期之间才有可比性。
每次运行都记录五个字段
出现率是头条数字,但只有出现率,说不清下一步该做什么。每次运行记录这五个字段,诊断结论通常自己就浮出来了。
是否出现。 品牌到底有没有被提到?先按提示词汇总为「被提及的运行占比」,再汇总为整个提示词集的整体占比。这就是你对外汇报的数字。
位置。 这次提及落在回答的哪里——第一个被点名的选项、名单中段,还是推荐结论之后的一句附注?助手的回答天然前重后轻;在六个选项里排第六,更接近「没出现」而不是「出现了」。
情感倾向与表述框架。 不只是正面或负面,而是挂在你名字上的那个限定语:「适合大型企业但偏贵」「报表很强,集成偏少」。这些限定语是助手对它读过的所有关于你的内容所做的压缩总结,也是整个数据集里最能指导行动的文本。
同现竞品。 记录回答里出现的每一个其他品牌。这会告诉你助手对你所在品类的真实定义——往往和你定位 PPT 上那个不一样——同时给出一份排序清单:你实际上在把「回答份额」输给谁。
引用来源。 抓取回答里链接到的每一个 URL。这是因果层。如果某个竞品在某条提示词上赢,是因为第三方站点的一篇清单文章把它排在第一,那要改的是那个页面——对外沟通、纠错、给一个更好的数据点——而不是在自己域名上再发一篇博客。OpenAI 在其爬虫文档中说明了自家爬虫以及发布方如何控制它们;在你断定自己的内容「因为质量问题而不被看见」之前,值得先确认问题是不是出在抓取权限上。
每次运行都记录
每条提示词每次运行要记的五个字段
是否出现
品牌到底有没有被提到?汇总成运行占比,永远不要记成是或否。
位置
第一个被点名的选项、名单中段,还是推荐结论之后的一句附注。
情感倾向与表述框架
原样抓下挂在你名字上的限定语——那是助手对它读过的一切所做的总结。
同现竞品
揭示助手对你所在品类的真实定义,以及谁握着「回答份额」。
引用来源
回答背后的那些 URL,才是你真正能改动的阵地。
看趋势,别看单条回答
积累了四五个周期之后,就该停止逐条读回答,开始读数据序列。有三种模式值得动手,有一种值得直接忽略。
某一类提示词——比如你所有的对比类问题——的出现率出现持续上升或下降,是真实信号,通常可以追溯到有新的第三方内容进入或退出了引用池。整个提示词集在同一天出现台阶式变化,几乎总是模型更新;改任何内容之前,先看你的版本标注。而如果出现率持平、但挂在你品牌上的限定语变了,这是你能拿到的最早的预警信号:一种叙事正在形成,而此时修正的成本也最低。
该忽略的是:单条提示词、单个周期的波动。那是采样噪音,追着它跑,比汇报「本周无变化」更快耗尽你在管理层那里的信誉。
汇报之前,先按提示词类别拆分汇总结果。场景类问题表现强、品类发现类表现弱,和反过来的情况是完全不同的两个问题——前者是定位缺口,后者是助手取材的那些渠道上的覆盖缺口。关于这套诊断思路,我们在AI 可见度指南里讲得更细。
追踪闭环
从提示词集到优先级行动清单
搭建并锁定提示词集
30~60 条不带品牌名的买家问题,措辞锁定并留变更记录。
按固定频率跑测
每条提示词每周跑三次,退出登录、关闭记忆、每条对应一个地区语言。
给五个字段打标
是否出现、位置、情感倾向、竞品、引用来源——每个周期用同一套规则。
按提示词类别看趋势
忽略单周期噪音;在诊断内容之前,先标注模型版本。
去改那些被引用的来源
优先处理决定回答的第三方页面,而不是只盯自己的域名。
人工追踪,以及自动化真正的价值所在
这套流程完全可以手工跑。用表格搭好提示词集,在干净的浏览器会话里每条跑三遍,然后记录那五个字段。30 条提示词各跑三次,每个周期就是 90 段对话要读、要打标——大概每周一天的专注工作量,而打标是慢的那部分,因为要在 90 条回答里前后一致地判断位置和情感倾向,比听起来难得多。
有两件事会让人工追踪在规模上崩掉。第一是一致性:两个人对情感倾向的打标标准不同,同一个人在周五的标准也和平时不同。第二是覆盖面——买家不只用 ChatGPT,而只在一个助手上跑的提示词集,完全说明不了 Gemini、Perplexity、Claude 或 Copilot 的情况,它们的检索来源不同、引用的内容也不同。
这正是我们做Growli要解决的问题:它按计划在各主流助手上跑你的提示词集,每个周期用同一套规则记录是否出现、位置、情感倾向、竞品同现和引用来源,并把缺口转化成一份按优先级排序的「待修页面与来源」清单。不管你走哪条路,方法都一样——固定提示词、重复运行、五个字段,用趋势而不是截图来做决策。
FAQ
大语言模型的推理默认不是确定性的。Thinking Machines Lab 的工程师已经证明,即使温度为 0,批处理和内核层面的效应也会让完全相同的请求产出不同的补全结果。除此之外,ChatGPT 在不同运行间可能检索到不同的实时网页,也可能利用已存储的记忆做个性化,因此相同的提示词完全有理由给出不同的品牌名单。
对大多数单一品类的企业来说,30 到 60 条就够了,分布在品类发现、对比、场景和顾虑四类问题上。少于 20 条左右,单条提示词的噪音会主导整体汇总;远超 60 条,通常只是在增加近似重复的问题,而不是新信息。整套提示词要向你实际赢单的那些问题倾斜。
每周一轮、每个周期每条提示词至少跑三次,是一个稳妥的基线。这样「是否被提及」才是一个比率而不是是或否,也只有这种形式才能扛住运行间的方差。在产品发布、调价或竞品有新闻时临时提高频率,并且每次都记录模型版本,这样你才能把平台更新和自己的内容改动区分开。
只能作为次要的一组。带品牌名的提示词衡量的是 ChatGPT 在已经知道你是谁之后如何描述你,这对发现事实性错误和负面表述很有用。但它们测不到「发现」这一环,而发现才是带来新需求的部分——那需要不带品牌名的品类、对比和场景类问题。
可能会。OpenAI 在其爬虫文档中说明了自家爬虫以及发布方如何放行或屏蔽它们,而一个被排除在检索之外的站点,无法在联网回答中被作为来源引用。在断定自己内容不行之前,先确认 robots.txt 以及任何 CDN 或机器人管理规则没有阻挡访问。
ChatGPT 通常是单一体量最大的阵地,但每个助手的检索和引用方式都不同,所以在一个平台上的表现不会自动迁移。如果你的买家在用 Gemini、Perplexity、Claude 或 Copilot,就把同一套提示词集在每个平台上都测一遍并做对比——助手之间的差距,往往直接指向你缺失了哪些第三方来源。
