Cómo monitorizar las menciones de tu marca en ChatGPT
Por Zakaria Reziki
CEO — Growli · 19 de agosto de 2026 · 10 min de lectura
Redactado con ayuda de IA siguiendo los estándares editoriales de Zakaria Reziki, y publicado tras controles automáticos de fuentes y calidad.
Para monitorizar las menciones de tu marca en ChatGPT, ejecuta un conjunto fijo de prompts con lenguaje de comprador de forma periódica y registra, en cada ejecución, si tu marca aparece, en qué parte de la respuesta, con qué sentimiento, qué competidores aparecen a su lado y qué fuentes cita la respuesta. La presencia en un asistente de IA es una probabilidad, no un hecho, así que la única medición honesta es una tasa observada en muchas ejecuciones sobre prompts estables.
La mayoría de los equipos empiezan escribiendo una vez la pregunta de su categoría en ChatGPT, hacen una captura de pantalla y la pegan en Slack. Eso no es monitorización: es una anécdota. Haz la misma pregunta una hora después y el orden de las marcas puede cambiar, un competidor puede aparecer de la nada y las citas pueden ser completamente distintas. El resto de este artículo es el método que convierte esas anécdotas en una medición defendible que puedes seguir en el tiempo, reportar y accionar.
Por qué las comprobaciones manuales puntuales engañan
La inferencia de los modelos de lenguaje no es reproducible por defecto. Los ingenieros de Thinking Machines Lab documentaron que, incluso con temperatura cero, el batching y el no determinismo a nivel de kernel hacen que peticiones idénticas devuelvan respuestas distintas: su artículo sobre cómo vencer el no determinismo en la inferencia de LLM explica por qué el mismo prompt varía de una ejecución a otra. La API de OpenAI expone un parámetro `seed` de mejor esfuerzo y control de temperatura en su referencia de chat completions, pero la interfaz de consumo de ChatGPT que usas tú y usan tus compradores no expone ninguno de los dos.
A la varianza del muestreo, ChatGPT añade una capa de personalización. Las preguntas frecuentes sobre memoria de OpenAI describen cómo el asistente puede arrastrar detalles de conversaciones anteriores a las nuevas. Si llevas seis meses hablando de tu propia empresa en esa cuenta, tu cuenta es el peor sitio posible para medir si los desconocidos oyen hablar de tu empresa.
También hay una capa de recuperación. Cuando ChatGPT busca en la web, extrae páginas en vivo y enlaza a ellas, tal como describe OpenAI en su anuncio de ChatGPT search. Dos ejecuciones separadas por segundos pueden recuperar páginas distintas y, por tanto, llegar a conclusiones distintas.
Lo que está en juego es lo que convierte esto en algo más que una curiosidad. Pew Research Center detectó que los usuarios de Google hacían clic en un enlace de resultados en el 8 % de las visitas en las que aparecía un resumen de IA, frente al 15 % de las visitas sin resumen. Cuando la respuesta absorbe el clic, aparecer nombrado dentro de la respuesta pasa a ser la visibilidad que cuenta, y eso no se gestiona con una captura de pantalla.
POR QUÉ IMPORTAN LAS RESPUESTAS
Clics en enlaces en búsquedas de Google, con y sin resumen de IA
Visitas con resumen de IA visible
8 %
Visitas sin resumen de IA
15 %
Fuente: Pew Research Center
Construye un set de prompts que refleje las preguntas reales del comprador
Tu set de prompts es el instrumento. Si lo haces mal, todos los números posteriores son ruido. El error que casi todo el mundo comete al principio es monitorizar prompts que contienen su propia marca — «¿es bueno Growli?» —, lo cual no mide nada, porque ya le has dado la respuesta al asistente. Monitoriza las preguntas que hace un comprador antes de saber que existes.
Saca la materia prima de los sitios donde vive el lenguaje real: grabaciones de llamadas comerciales, tickets de soporte, los registros del buscador interno de tu web, las preguntas del formulario de onboarding y las consultas de cola larga de Google Search Console. Después, ordénalas en cuatro familias.
Apunta a entre 30 y 60 prompts, con más peso en las familias que se corresponden con tus ingresos. Escríbelos como escribe una persona, no como redacta titulares un responsable de marketing: «mejor X para equipos pequeños por menos de 50 €/mes», no «visión general de soluciones X». Luego congela la redacción. Cada edición reinicia la línea base, así que mantén un registro de cambios y trata un prompt reformulado como un prompt nuevo con un histórico nuevo, no como la continuación del anterior.
- Descubrimiento de categoría: «mejor herramienta de gestión de proyectos para constructoras», «quién hace auditorías SOC 2 para startups en fase seed».
- Comparación: «X vs Y para grandes empresas», «alternativas a X», «opción más barata que X con SSO».
- Caso de uso y trabajo por resolver: «cómo migro 40.000 SKU a un nuevo PIM», «herramienta para medir la visibilidad en búsquedas con IA».
- Objeción y riesgo: «¿es X lo bastante seguro para datos sanitarios?», «qué proveedores de esta categoría tienen mal soporte».
Decide la cadencia y mantén las condiciones constantes
La cadencia es un equilibrio entre confianza estadística y coste. Una sola ejecución por prompt a la semana no te dice casi nada, porque la varianza entre ejecuciones es mayor que la mayoría de las variaciones semanales que te importan. Un suelo práctico son tres ejecuciones por prompt y ciclo, con periodicidad semanal, para que la presencia se exprese como una tasa — «nombrado en 7 de 12 ejecuciones» — y no como un binario.
Aumenta la frecuencia en torno a eventos concretos, no de forma permanente: el lanzamiento de un producto, un cambio de precios, la ronda de financiación de un competidor, una oleada de contenido nuevo en sitios de reseñas. Entre eventos, semanal es suficiente para ver la dirección manteniendo la serie legible.
Las condiciones importan tanto como la frecuencia. La regla es aburrida y no negociable: cambia una sola cosa a la vez y nunca modifiques el montaje de medición y la estrategia de contenidos en la misma semana.
Registra también la versión del modelo en cada ejecución. Las actualizaciones de modelo son la mayor fuente de saltos bruscos en las respuestas de IA, y una línea de tendencia sin anotaciones de versión te hará persiguir problemas de contenido que en realidad eran cambios de plataforma.
- Ejecuta sin iniciar sesión, o en una cuenta limpia con la memoria y las instrucciones personalizadas desactivadas.
- Fija el mercado y el idioma en cada prompt; monitoriza la misma pregunta en un segundo mercado como un prompt aparte, no como una variante.
- Usa siempre la misma superficie: la interfaz web con búsqueda activada se comporta de forma distinta a una llamada directa a la API.
- Pon marca temporal a todo en UTC para que los ciclos sean comparables.
Registra cinco campos en cada ejecución
La presencia es el titular, pero la presencia por sí sola no te dice qué hacer después. Registra cinco campos por ejecución y el diagnóstico casi se escribe solo.
Presencia. ¿Se nombró la marca? Agrégalo como porcentaje de ejecuciones por prompt y después consolídalo como porcentaje sobre todo el set. Este es el número que reportas.
Posición. ¿Dónde cayó la mención dentro de la respuesta: primera opción nombrada, mitad de la lista o una nota al final tras la recomendación? Los asistentes concentran el peso al principio; ser el sexto de una lista de seis está más cerca de la ausencia que de la presencia.
Sentimiento y enfoque. No solo positivo o negativo, sino el calificativo que te acompaña: «bueno para grandes empresas, pero caro», «buen reporting, integraciones limitadas». Esos calificativos son el resumen comprimido que hace el asistente de todo lo que ha leído sobre ti, y son el texto más accionable de todo el conjunto de datos.
Competidores nombrados. Registra todas las demás marcas de la respuesta. Esto te da la definición real que el asistente tiene de tu categoría, que a menudo no es la de tu diapositiva de posicionamiento, además de una lista ordenada de quién te está quitando cuota de respuesta.
Citas. Captura todas las URL a las que enlaza la respuesta. Esta es la capa causal. Si un competidor gana un prompt porque un listado en un sitio de terceros lo pone primero, lo que hay que arreglar es esa página — contacto, una corrección, un dato mejor — y no otro artículo en tu propio dominio. OpenAI documenta sus rastreadores y cómo pueden controlarlos los editores en su documentación de bots, que conviene revisar antes de concluir que tu contenido es invisible por razones de contenido y no de acceso.
REGISTRA CADA EJECUCIÓN
Los cinco campos que anotar por ejecución de prompt
Presencia
¿Se nombró la marca? Agrégalo como porcentaje de ejecuciones, nunca como un sí/no.
Posición
Primera opción nombrada, mitad de la lista o nota al final tras la recomendación.
Sentimiento y enfoque
Captura el calificativo exacto que te acompaña: es el resumen del asistente de todo lo que ha leído.
Competidores nombrados
Revela la definición real que el asistente tiene de tu categoría y quién domina la cuota de respuesta.
Citas
Las URL que hay detrás de la respuesta son las superficies que sí puedes cambiar.
Lee la tendencia, no la respuesta
Con cuatro o cinco ciclos registrados, deja de leer respuestas individuales y empieza a leer la serie. Hay tres patrones que merecen acción y uno que merece que lo ignores.
Una subida o bajada sostenida de la tasa de presencia en una familia de prompts — por ejemplo, todos tus prompts de comparación — es una señal real, normalmente rastreable a contenido nuevo de terceros que entra o sale del conjunto de fuentes citadas. Un salto brusco en todo el set el mismo día es casi siempre una actualización de modelo: revisa tus anotaciones de versión antes de reescribir nada. Un cambio en el calificativo asociado a tu marca, incluso con la presencia plana, es el aviso más temprano que vas a tener de que se está formando un relato, y el más barato de corregir.
Lo que hay que ignorar: el movimiento de un solo prompt en un solo ciclo. Eso es ruido de muestreo, y perseguirlo quema credibilidad ante tu dirección más rápido que reportar que no ha habido movimiento.
Segmenta la vista agregada por familia de prompts antes de presentarla. Ser fuerte en prompts de caso de uso y débil en descubrimiento de categoría es un problema completamente distinto al inverso: el primero es una brecha de posicionamiento, el segundo es una brecha de cobertura en los sitios de los que se nutren los asistentes. Desarrollamos el marco de diagnóstico con más detalle en nuestra guía sobre visibilidad en IA.
EL CICLO DE MEDICIÓN
Del set de prompts a la acción priorizada
Crea y congela el set de prompts
De 30 a 60 preguntas de comprador sin marca, con la redacción bloqueada y un registro de cambios.
Ejecuta con una cadencia fija
Tres ejecuciones por prompt cada semana, sin iniciar sesión, memoria desactivada y un mercado por prompt.
Codifica los cinco campos
Presencia, posición, sentimiento, competidores y citas, con las mismas reglas en cada ciclo.
Lee la tendencia por familia de prompts
Ignora el ruido de un solo ciclo; anota las versiones de modelo antes de diagnosticar el contenido.
Corrige las fuentes citadas
Prioriza las páginas de terceros que deciden la respuesta, no solo tu propio dominio.
Monitorización manual y dónde la automatización se gana su sitio
Puedes hacerlo a mano. Monta el set de prompts en una hoja de cálculo, ejecuta tres pasadas por prompt en una sesión de navegador limpia y registra los cinco campos. Con 30 prompts a tres ejecuciones son 90 conversaciones que leer y codificar por ciclo — más o menos un día de trabajo concentrado por semana —, y la codificación es la parte lenta, porque valorar la posición y el sentimiento de forma consistente en 90 respuestas es más difícil de lo que parece.
Dos cosas rompen la monitorización manual cuando escala. La primera es la consistencia: dos personas codifican el sentimiento de forma distinta, y una misma persona lo codifica distinto un viernes. La segunda es la cobertura: los compradores no usan solo ChatGPT, y un set de prompts medido en un único asistente no te dice nada sobre Gemini, Perplexity, Claude o Copilot, que se apoyan en recuperaciones distintas y citan fuentes distintas.
Este es el problema para el que construimos Growli: ejecuta tu set de prompts en los principales asistentes de forma programada, registra presencia, posición, sentimiento, comenciones de competidores y citas igual en cada ciclo, y convierte las brechas en una lista priorizada de páginas y fuentes que corregir. Elijas la vía que elijas, el método es el mismo: prompts fijos, ejecuciones repetidas, cinco campos y decisiones basadas en tendencias, no en capturas de pantalla.
Mira qué dice la IA de tu negocio
Growli mide tu cuota de respuestas IA en ChatGPT, Gemini, Claude y Perplexity — y convierte cada brecha en acciones priorizadas.
ComenzarFAQ
La inferencia de los LLM no es determinista por defecto. Los ingenieros de Thinking Machines Lab han demostrado que el batching y los efectos a nivel de kernel producen respuestas distintas ante peticiones idénticas incluso con temperatura cero. Además, ChatGPT puede recuperar páginas web en vivo diferentes entre ejecuciones y personalizar con la memoria almacenada, así que prompts idénticos pueden producir legítimamente listas de marcas distintas.
Entre treinta y sesenta prompts bastan para la mayoría de negocios de una sola categoría, repartidos entre preguntas de descubrimiento de categoría, comparación, caso de uso y objeción. Con menos de unos veinte, el ruido de un solo prompt domina la vista agregada; con bastante más de sesenta, normalmente estás añadiendo casi duplicados en lugar de información nueva. Da más peso al conjunto de preguntas que refleja cómo ganas operaciones de verdad.
Semanal, con al menos tres ejecuciones por prompt y ciclo, es una base sólida. Así obtienes la presencia como tasa y no como un sí/no, que es la única forma que sobrevive a la varianza entre ejecuciones. Aumenta la frecuencia de forma temporal en lanzamientos, cambios de precios o noticias de la competencia, y registra siempre la versión del modelo para poder separar las actualizaciones de plataforma de tus propios cambios de contenido.
Solo como set secundario. Los prompts de marca miden cómo te describe ChatGPT una vez que ya sabe a quién te refieres, lo cual sirve para detectar errores factuales y enfoques negativos. No miden el descubrimiento, que es la parte que genera demanda nueva; para eso necesitas preguntas sin marca de categoría, comparación y caso de uso.
Puede afectar. OpenAI documenta sus rastreadores y cómo los editores pueden permitirlos o bloquearlos en su documentación de bots, y un sitio excluido de la recuperación no puede ser citado como fuente en una respuesta basada en la web. Antes de concluir que tu contenido es débil, verifica que tu robots.txt y las reglas de tu CDN o de gestión de bots no estén bloqueando el acceso.
ChatGPT suele ser la superficie individual más grande, pero cada asistente recupera y cita de forma distinta, así que la presencia no se transfiere. Si tus compradores usan Gemini, Perplexity, Claude o Copilot, mide el mismo set de prompts en cada uno y compara: las brechas entre asistentes suelen señalar directamente qué fuentes de terceros te faltan.
