Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios (si los hay). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics o YouTube. Al utilizar el sitio web, usted acepta el uso de cookies. Hemos actualizado nuestra Política de Privacidad. Haga clic en el botón para consultar nuestra Política de Privacidad.

¿Puede una marca manipular su visibilidad en la IA? Un estudio científico advierte sobre los límites de las métricas actuales

¿Puede una marca manipular su visibilidad en la IA? Un estudio científico advierte sobre los límites de las métricas actuales

La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha lanzado en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con la firma de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos dados por la línea investigativa centrada en Generative Engine Optimization (GEO) que Centria Group impulsa en colaboración con centros universitarios y académicos de cuatro naciones.

Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión científica: al sugerir un hotel, una póliza de seguros o una entidad financiera un asistente de inteligencia artificial, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán fiable resulta? Con el fin de despejar esta incógnita, los investigadores llevaron a cabo una revisión exhaustiva basada en la metodología del Joanna Briggs Institute (JBI), ajustándose además a la directriz PRISMA-ScR; de este modo, se traza un mapa sistemático sobre la forma en que los estudios recientes cuantifican la visibilidad, las menciones y el posicionamiento de marcas y fuentes dentro de los sistemas conversacionales.

«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El artículo parte de una constatación que el propio corpus revisado respalda con evidencia empírica: las fuentes que cita un motor generativo se solapan poco con las que posicionan en la búsqueda tradicional, y la lógica de selección varía de un motor a otro. Dicho de otro modo, la visibilidad en Google no predice la visibilidad en un asistente generativo, lo que invalida la transferencia directa de indicadores y obliga a repensar qué se mide y cómo. A ello se suma el fenómeno «cero clics», acelerado por los resúmenes generativos integrados en los buscadores: una parte sustancial de las consultas se resuelve hoy sin que el usuario visite ningún sitio web.

«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.

 Las cinco preguntas de investigación junto con sus respuestas

RQ Pregunta Respuesta del estudio
RQ1 ¿Qué familias de métricas se emplean? Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador.
RQ2 ¿Sobre qué unidad de análisis se operacionalizan? Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa.
RQ3 ¿Cómo se controla la variabilidad estocástica de los motores? Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error.
RQ4 ¿Qué evidencia de fiabilidad y validez se reporta? Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta.
RQ5 ¿Existe un instrumento integrado y validado de presencia generativa? En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.

«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.

Siete conjuntos de métricas y ausencia de un marco unificado

El mapeo identifica siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que conviven sin un marco integrador compartido. El estudio destaca además que la frontera conceptual más fértil del campo es la distinción entre citación (que una fuente sea seleccionada) y absorción (que su contenido se incorpore efectivamente al texto de la respuesta), un desdoblamiento en dos capas de lo que antes se medía como un binario.

La unidad de análisis se mueve: de la URL a la marca y a la trayectoria de los agentes

No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.

Clasificación de los datos probatorios accesibles

Grado de evidencia

Casos prácticos

Incidencia en el corpus

Evaluación por benchmark

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Predominante

Métrica directa (plataformas reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Escasa

Investigación aplicada / sectorial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Restringida

Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.

La IA no siempre contesta lo mismo, y prácticamente nadie lo evalúa

Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.

«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el principio, y no como un simple añadido opcional», apunta Romero.

El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco

El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso de validación psicométrica riguroso. En su lugar, se implementan supervisiones periféricas y fragmentadas (como índices de estabilidad, certeza en la asignación, contrastación metodológica o solidez ante secuencias), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier dispositivo— rara vez se documenta. Por su parte, la validez, al momento de defenderse, se sustenta en la armonía interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos métricos. De este modo se desprende la premisa principal del análisis: aún no se cuenta con un mecanismo consolidado y verificado para cuantificar el impacto generativo de marca.

Criterios de elegibilidad

Parámetro

Adisión

Descarte

Enfoque

Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas

Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito

Periodo

2023-2026 (ámbito nativo digital)

Previo a 2023

Idioma

Castellano e inglés

Idiomas restantes que carezcan de traducción accesible

Clasificación

Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas

Artículos de opinión, editoriales y material de índole comercial

Condición

Se aceptan preprints conforme a los criterios de sensibilidad establecidos

Documentación informal difundida sin supervisión editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Encontramos un campo que mide mucho y valida poco. Lo que falta no son ideas de medición, que abundan: lo que falta es validez de constructo y fiabilidad documentada. Y conviene decirlo con precisión, porque confundir un benchmark con un instrumento validado infla la aparente madurez metodológica del campo. Ese vacío es, exactamente, la oportunidad científica», afirma Néstor Romero.

Una distancia considerable entre la praxis profesional y la academia

El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

Adicionalmente, este análisis arroja una valiosa aportación metodológica que interpela directamente a los investigadores hispanohablantes. Cierta producción científica en castellano, difundida en publicaciones de Biblioteconomía y Documentación, examina la visibilidad ante la inteligencia artificial generativa desde perspectivas complementarias, tales como la inestabilidad de las marcas en sugerencias turísticas automatizadas o el acondicionamiento de repositorios universitarios para facilitar su indexación por motores conversacionales, aspectos que los estudios anglosajones hegemónicos suelen soslayar. Dicho corpus solo afloró gracias a consultas multilingües, lo que pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A esto se añade una segunda enseñanza derivada del propio procedimiento: el cotejo en una base indexada arrojó 360 entradas en bruto, de las cuales se examinaron las 136 disponibles en abierto —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna nueva investigación válida de medición. En resumen, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura insuficiente en los índices convencionales; de hecho, el 64 % de los textos preliminares se divulga mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Proceso de elección de los estudios (PRISMA-ScR, dos vías)

Fase

Desenlace

Rama de descubrimiento (Consensus)

Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo

Rama de otros métodos

Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra

Verificación en Web of Science

Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional

Evaluación a texto completo

Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia

Inclusión final

Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los datos de identificación y cribado se consideran definitivos, mientras que los correspondientes a la evaluación a texto completo y a la inclusión tienen carácter provisional, tal como señalan los autores.

Se puede manipular la visibilidad generativa

Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.

«Una prueba de rendimiento comprueba si una estrategia da resultado o si un elemento varía de posición, pero no determina si un indicador mide con validez un concepto. Mezclar ambos planos exagera la falsa sensación de madurez de la disciplina».

«En este ámbito, evaluar un único intento resulta epistemológicamente endeble; los sistemas generativos son capaces de ofrecer respuestas diferentes ante idéntica consulta».

Qué viene ahora: del diagnóstico al instrumento

Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.

«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.

Limitaciones declaradas por los autores

El artículo explicita sus propios límites: la inestabilidad de la base de evidencia en un campo tan reciente y dominado por preprints, que hace provisionales sus conclusiones; la no reproducibilidad de la ruta de descubrimiento inicial —mitigada, aunque no eliminada, por OpenAlex, el rastreo de citas y la verificación indexada—; el alcance lingüístico restringido a español e inglés y la imposibilidad de verificar en Scopus por falta de acceso institucional; la codificación parcialmente realizada a nivel de resumen, con cifras de inclusión provisionales; una amenaza de circularidad, dado que numerosos estudios emplean modelos de lenguaje como jueces de su propia medición; y la validez temporal limitada de cualquier fotografía de un campo que opera sobre sistemas propietarios en evolución constante.

Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».