SEO para medios en la era de los asistentes: lo que Google ya no mide y los LLMs sí
Google te mira el clic. ChatGPT, Perplexity y Claude te miran si eres citable. Aquí va la capa on-page, la medición con logs y los errores que te dejan invisible.
En este artículo
Llevas optimizando para un juez que ya no es el único
Si tu dashboard de SEO solo enseña posiciones, CTR y backlinks, estás midiendo al juez de siempre. El otro juez, ChatGPT, Claude, Perplexity, Gemini, no te rankea en una SERP. Te cita o te ignora. Y cuando te ignora, no hay “posición 14” que te consuele: simplemente no existes en la respuesta.
Eso no es un eslogan de consultora. Es un cambio de interfaz. El usuario ya no siempre aterriza en tu home: lee un resumen con tres enlaces al pie. Si no eres uno de esos tres, el clic nunca se produce. El SEO clásico sigue importando, Google no ha muerto, pero deja fuera señales que los motores de respuesta sí miran: bloques atómicos de pregunta-respuesta, frescura real del documento, y si tu dominio pesa lo suficiente como para no ser un blog de marketing disfrazado de medio.
La promesa de esta guía es operativa. Cuando la cierres deberías poder:
- Montar una capa de citabilidad on-page en tu sitio (sin magia, con archivos y schema).
- Medir crawlers y citas sin atarte a un SaaS de “AI visibility”.
- Meter un filtro de autoridad de dominios en el pipeline editorial para no citar basura que luego te contagia.
- Evitar los errores que convierten el volumen IA en ruido que ni Google ni un LLM quieren tocar.
No hay garantía de que “hagas esto y Perplexity te cite mañana”. Quien te lo venda miente. Lo que sí hay es ingeniería reproducible: señales que los sistemas de respuesta ya consumen, y una medición que no depende de una caja negra con precio de enterprise.
Qué mide Google y qué miran los asistentes (sin mistificarlo)
Según un repaso de Blend Expert (2025), Google prioriza contenido útil, original y alineado con la intención del usuario, sin importar si lo escribió un humano o una IA. Eso desplaza el foco del keyword stuffing hacia señales de calidad. La misma fuente avisa de lo obvio que mucha gente se salta: el contenido generado puede inventar datos de forma convincente; si aspiras a que te citen, la precisión factual no es un “nice to have”, es el suelo.
Lo que Blend Expert describe para SEO clásico encaja, con matices, con lo que un medio necesita para no ser irrelevante ante LLMs:
- Utilidad real, no relleno. Publicar en volumen con IA sin propósito satura el sitio y perjudica el SEO porque el contenido de baja utilidad se castiga, no por ser IA, sino por ser basura.
- Voz y criterio propios. La IA tiende a textos genéricos y a evitar posiciones marcadas; sin contrapeso humano, tu archivo se homogeneiza y un modelo no tiene motivo para preferirte frente a otros mil clones.
- Actualidad supervisada. Los modelos no viven enganchados a tu feed en tiempo real: para noticias y tendencias, el borrador IA sin revisión experta es un riesgo, no un atajo.
Lo que no debes hacer es leer eso como “Google penaliza automáticamente todo lo IA” o como “si cumples la guía de 2023 ya estás cubierto en 2026”. Eso no consta. El juego ha cambiado de terreno: además del rankeo, existe la citabilidad, que un asistente te elija como fuente al montar una respuesta.
Los motores de respuestas suelen:
- Levantar bloques Q&A atómicos (pregunta clara + respuesta directa y autocontenida).
- Ponderar frescura del documento (una fecha falsa en el JSON-LD es peor que no poner fecha).
- Preferir dominios que huelen a referencia, no a perfil de Instagram ni a blog de un exchange vendiendo el token de la semana.
Tu trabajo de medio no es “hacer GEO mágico”. Es darles material que puedan citar sin sonrojarse, y comprobar si de verdad te están leyendo.
La capa de citabilidad on-page (el paquete mínimo que sí controlas)
Antes de comprar nada, monta señales que ya están en tu build. En un medio generado con pipeline de LLMs, la auditoría típica deja una base decente, SSG, robots que no echan a los crawlers de IA, TL;DR, fuentes visibles, y aun así falta la capa de citabilidad como paquete explícito. Esto es lo que entra en ese paquete y cómo se activa.
1. /llms.txt y /llms-full.txt en el build
No es un estándar sagrado tallado en piedra. Es un convenio práctico: un archivo en la raíz que le dice a bots y a humanos curiosos qué eres, qué secciones importan y dónde está el mapa del contenido. El “full” es la versión larga: más contexto, más rutas, menos misterio.
Cómo montarlo de verdad:
- En el pipeline de build (no a mano en el servidor), genera
llms.txtcon: nombre del medio, una frase de propuesta, enlaces a las secciones canónicas, y puntero a la política de fuentes o al archivo. - Genera
llms-full.txtcon el inventario de rutas importantes (secciones, hub de temas, piezas evergreens que quieras empujar). - Sírvelos en la raíz del dominio con
Content-Typede texto plano y caché agresiva de build, no de CMS caprichoso. - Comprueba en producción:
curl -I https://tudominio/llms.txttiene que devolver 200, no un 404 bonito de SPA.
Si tu front es una SPA que solo responde HTML vacío sin JS, ya has perdido: los crawlers de IA no ejecutan JavaScript. El archivo tiene que existir en el HTML/estático servido.
2. FAQ real al cierre de los formatos largos + schema FAQPage
Los formatos largos (artículo de fondo, guía, desmontaje) cierran con una sección de preguntas frecuentes: 2–4 preguntas que alguien teclearía en un buscador o en un chat, con respuestas de 40–80 palabras y la primera frase ya respondiendo. La web parsea esa sección y emite schema FAQPage.
En piezas cortas no lo hagas. Sería relleno, y el relleno es exactamente lo que no quieres enseñar a un modelo.
Paso a paso editorial:
- Antes de publicar un largo, escribe las preguntas como las haría un lector impaciente (“¿Qué es X?”, “¿Cómo se mide Y?”, “¿Sirve Z sin herramienta de pago?”).
- Respuesta autocontenida: si se corta y pega fuera del artículo, sigue siendo verdad.
- El generador de schema solo corre si detecta la sección; no inventes JSON-LD a mano en cada post si puedes evitarlo, se desincroniza.
- Prohibido el FAQ de autopromoción (“¿Por qué somos el mejor medio de IA?”). Eso no lo cita nadie con criterio.
El racional es simple: los motores de respuesta ya levantan bloques Q&A. Tú se los dejas en bandeja, con markup, en vez de enterrar la respuesta en el párrafo 14.
3. dateModified REAL en el JSON-LD
Los sistemas de respuesta ponderan frescura. Una fecha inventada o un “hoy” eterno en cada rebuild es una trampa que se vuelve en tu contra cuando el contenido no se ha tocado.
Regla operativa:
datePublished= cuando salió de verdad.dateModified= solo cuando el cuerpo cambió de sustancia (dato nuevo, corrección, sección añadida), no cuando alguien movió una coma del CSS.- Si no hubo cambio real, no toques la fecha. Mejor una fecha antigua honesta que un perfume de novedad falso.
4. Breadcrumbs con schema y robots.txt que declare crawlers de IA
Breadcrumbs legibles + schema de jerarquía ayudan a situar la pieza en el sitio. En robots.txt, deja de tratar a los bots de asistentes como enemigos por defecto: si quieres ser citado, echar al crawler es pegarte un tiro en el pie. Declara lo que permites; no asumas el default de “bloquear por si acaso”.
Los motores de respuesta levantan bloques atómicos Q&A y ponderan frescura. Schema y fecha real son señales directas; el resto es ruido de LinkedIn.
Con esto tienes capa on-page. Barata, versionable en git, sin vendor. Ahora viene la mitad que casi nadie monta: medición.
Medir citas y crawlers sin caja negra (logs, no fe ciega)
La primera vez que un asistente te cita de verdad, un Perplexity enlazando un artículo tuyo, lo confirmas a mano y te da un subidón. Al día siguiente intentas perseguirlo a mano y descubres que no escala. Ahí es donde la industria te empuja un SaaS de “AI visibility” con demos bonitas y poca autonomía.
La decisión de diseño, deliberada: medición con logs y sondeos propios, no herramienta externa. Motivo: autonomía para personalizar los detalles a lo que el medio necesita, sin atarse a una caja negra que redefine métricas cuando le conviene al pricing. Se descarta el agente GEO separado (duplica contexto y parte el briefing de SEO) y se descartan los SaaS caros de visibilidad en IA por dependencia externa.
El diseño separa tres naturalezas de dato. Mezclarlas es como sumar kilos con grados centígrados.
Señal 1, Determinista y diaria (sin LLM en el informe)
Regla de oro: los datos del informe diario no los redacta un modelo. Son contadores y parsers.
Qué entra:
- Clics cuyo referrer viene de asistentes (cuando el asistente enlaza y el usuario salta).
- Un parser del access log de nginx (o el access log de tu reverse proxy) para user-agents de crawlers de IA.
Detalle que tumba a media industria del analytics de moda: los bots no ejecutan JS. Tu beacon de analítica frontend no los ve. Si solo miras el panel de “visitas”, estás ciego al crawl. Solo el log del servidor cuenta esas peticiones con honestidad.
Cómo montar el parser sin dramatizar:
- Asegura que nginx (o equivalente) escribe access log con user-agent, path, status y timestamp.
- Mantén una lista versionada de patrones de UA de crawlers de asistentes (en código, no en un Excel del intern).
- Job diario: agrega hits por bot, por path, por status. 404 en
/llms.txtes un grito. 200 en un artículo evergreen es señal de interés. - Exporta a una tabla o un markdown de informe que no pase por un LLM antes de que lo lean humanos. El modelo puede comentar después; no puede inventar el número.
Señal 2, Sondeo activo semanal (aquí sí hay modelo, y está acotado)
Una vez a la semana, no cada hora: las citas se mueven a ritmo lento. Sondear a diario es pagar por medir ruido.
Diseño del sondeo:
- Saca ~15 preguntas derivadas de tus propias FAQ publicadas (no de keywords de fantasía).
- Lánzalas contra la API de un asistente que exponga citas o fuentes.
- Guarda si aparece tu dominio.
- Guarda también las derrotas: qué dominios rivales salieron. Las derrotas enseñan más que las victorias para priorizar huecos editoriales.
Semanal. Con histórico. Sin teatro de “monitorización 24/7”.
Señal 3, Razonamiento semanal en el mismo agente de SEO
Las palancas GEO no son una religión aparte: son las mismas que las de SEO (autoridad, claridad, frescura, cobertura de intención) aplicadas a otro canal de respuesta. Meter un “agente GEO” paralelo suele duplicar contexto y partir el briefing. Mejor: el mismo estratega de SEO recibe el paquete de datos (logs + sondeo) y devuelve acciones, qué pieza actualizar, qué FAQ falta, qué hub está huérfano, no prosa motivacional.
Si quieres rigor de evaluación en sistemas con LLMs en el camino, el mismo espíritu del pipeline de evaluación con datos propios aplica aquí: dataset congelado, comparación antes/después, y un gate que impida desplegar “un prompt que parece mejor” sin medir. El canario barato antes de producción es la misma filosofía con otro disfraz.
Autoridad de dominios: la única fuente de verdad que te salva del KuCoin de turno
Puedes tener el mejor FAQPage del mundo y seguir siendo un medio que cite basura. En un pipeline con LLMs, el fallo clásico es este: no hay criterio de autoridad en ningún sitio. La triangulación cuenta dominios sin pesarlos, dos fuentes flojas de dominios distintos pasan por “trianguladas”, y el exclude_domains del buscador está vacío como promesa de político.
El arreglo no es una allowlist cerrada (mata la cobertura de nicho) ni un score numérico continuo sin datos que lo calibren (sobreingeniería). Es un catálogo de tiers por sufijo de dominio registrable, módulo único, única fuente de verdad.
Los tiers (úsalos tal cual en el pipeline)
- Tier 0, vetados como fuente: redes sociales (un perfil no es un medio) y blogs de marketing de exchanges u homólogos. Se veta la clase, no el caso suelto que te dolió. Los foros con tracción medida (Reddit, Hacker News) no se vetan por defecto: pueden ser material legítimo.
- Tier 1, referencia: prensa top, labs oficiales, papers.
- Tier 2, sólidos: medios tech y blogs técnicos con reputación.
- Tier 3, desconocidos: se admiten. El nicho fresco es ventaja competitiva y a veces la mejor fuente es un blog pequeño. Pero un tier 3 no sostiene un artículo solo ni gana la diversificación si hay alternativa con más autoridad.
Dónde se cablea (cuatro puntos, no un PDF de normas)
- Buscador: los vetados van en
exclude_domains. Ni entran. - Research: aunque un buscador no respete exclude, el bucle de resultados salta vetados siempre.
- Diversificación: al elegir un dominio nuevo, gana el de mejor autoridad, no el primero de la lista.
- Reviewer: si hay “fuentes” pero ningún dominio tier 1–2 detrás, la nota se capa. No se publica el castillo sobre barro.
Dos excepciones deliberadas:
- Las URLs del autor no se filtran: son material primario y el autor decide.
- El filtrado ocurre antes de crear las citas. Filtrar después rompe índices de atribución y te deja citas huérfanas, el tipo de bug que solo duele en producción.
Sin este módulo, tu capa de citabilidad es maquillaje: el asistente puede citarte citando basura, y eso no construye autoridad; la limpia al revés.
Cómo se usa en el día a día del medio (flujo reproducible)
Esto es el circuito completo, de lunes a domingo, sin romanticismo.
Configuración base (una vez)
- Build estático o híbrido que emita HTML real para artículos, no cascarones vacíos.
- Generación de
/llms.txty/llms-full.txten cada release. - Parser de FAQ →
FAQPagesolo en formatos largos. - JSON-LD con fechas honestas.
robots.txtrevisado para crawlers de IA.- Catálogo de tiers de dominio en el repo del pipeline, importado en buscador, research, diversificación y reviewer.
- Rotación de logs de nginx + job diario de agregación por UA de bots.
- Script semanal de sondeo con las ~15 preguntas FAQ → almacén de victorias y derrotas.
Operación editorial por pieza
- Elige el formato. Si es largo, reserva sitio mental para el FAQ final.
- Exige fuentes que pasen tiers; si solo hay tier 3, o bajas la ambición de la pieza o consigues un tier 1–2 de ancla.
- Supervisa hechos sensibles: Blend Expert (2025) recuerda que la IA inventa con seguridad absurda y que no sustituye la verificación humana si no quieres difundir falsedades.
- Inyecta análisis propio. El texto genérico no conecta con audiencia ni le da a un LLM una razón para preferirte.
- Publica con
datePublishedreal. Si actualizas de verdad, tocadateModifiedy deja rastro de qué cambió. - Tras publicar evergreens clave, verifica que el path aparece en el log de crawlers en los días siguientes (no al minuto: no eres un day trader).
Lectura semanal de señales
- Informe diario de logs: ¿pican los bots? ¿dónde? ¿404 tontos?
- Sondeo semanal: ¿apareces? ¿quién te gana?
- Una lista corta de acciones: actualizar pieza X, matar zombie Y, escribir el hueco Z que los rivales cubren con mejor autoridad.
- Nada de “el futuro de la visibilidad es conversacional” en el informe. Acciones o silencio.
Errores comunes (donde la caga casi todo el mundo)
Confundir volumen IA con estrategia. Blend Expert (2025) lo deja claro en clave SEO: publicar a lo loco sin propósito satura y perjudica. Para citabilidad, el filtro editorial es aún más duro: solo lo auténticamente útil tiene opciones de sobrevivir al corte del asistente.
Medir bots con analítica de navegador. El beacon no ve al crawler. Si tu jefe pregunta “¿cuánto tráfico de ChatGPT tenemos?” y miras solo el JS, la respuesta es basura metodológica aunque el número salga con dos decimales.
Sondear cada día. Paginas varianza. Las citas no bailan al ritmo de tu ansiedad.
FAQ de relleno o de marketing. Si la respuesta no se sostiene sola en 40–80 palabras, no es FAQ: es adorno. El schema basura no te hace más citable; te hace más ruidoso.
Triangular con dos mierdas. Dos blogs de marketing no son dos fuentes. Son una sola clase de basura con dos dominios. Sin tiers, el pipeline aplaude.
Fecha cosmética. dateModified de mentira es una señal podrida. Los sistemas que ponderan frescura no te deben un favor.
Agente GEO aparte + SaaS de visibilidad + dashboard de vanidad. Tres capas de teatro que no tocan tu HTML ni tu log. La autonomía se va; el precio se queda.
Creer que el prompt “escribe como experto” arregla autoridad. La autoridad se construye con hechos verificables, fuentes de peso y criterio humano que contrarreste el sesgo del modelo a no mojarse. Blend Expert (2025) subraya sesgos de entrenamiento y tendencia a textos genéricos: el contrapeso es editorial, no cosmético.
Trampa fina: similitud ≠ respuesta (y otras confusiones de medición)
Cuando montes evaluación interna, por ejemplo, para ver si tu retrieval o tu asistente de redacción “responde” a una FAQ, no uses solo similitud de embeddings como veredicto. La similitud mide vecindad temática, no si el texto contesta la pregunta. Dos párrafos pueden estar cerca en el espacio vectorial y uno ser una respuesta y el otro una digresión elegante. Si evalúas citabilidad o cobertura de preguntas con un score de vecindad y te vas a casa tan pancho, te estás mintiendo con matemáticas.
El corpus de evaluación decente, cuando lo necesites para un bot o un clasificador interno, casi nunca es un set sintético bonito: es el canal donde la gente ya pedía ayuda antes del bot. Histórico de chat de soporte, segmentado en incidencias, con la respuesta humana como referencia. Replay en sandbox, informe de cuatro columnas (usuario / clasificación / respuesta bot / respuesta humana). Misma filosofía que la medición GEO: determinismo donde se pueda, modelo solo donde aporte, y gate de regresión con dataset congelado antes de desplegar cambios de prompt que “se sienten” mejores.
Cierre sin sermón
Google te sigue mirando el clic y la utilidad. Los asistentes te miran si eres un bloque citable, fresco de verdad y con dominio que no huela a humo. La capa on-page se monta en el build. La medición se saca del access log y de un sondeo semanal honesto. La autoridad se impone en el pipeline con tiers, no con charlas de redacción.
Abre el repo. Genera el llms.txt. Enchufa el parser al log. Ponle tiers al research. La próxima vez que un asistente te enlace, no será magia: será que por fin les diste algo que poder citar, y una forma de enterarte sin pagar un cuento.
Preguntas frecuentes
¿Qué es el SEO para IA o GEO en un medio?
Es optimizar tu sitio y tus piezas para que los modelos de respuesta (ChatGPT, Claude, Perplexity, Gemini) te comprendan y te consideren citable, no solo para rankear en Google. Se apoya en utilidad real, bloques Q&A claros, frescura honesta y autoridad de dominio. No garantiza citas; reduce la fricción para que un asistente pueda elegirte como fuente.
¿Cómo se mide si los asistentes de IA visitan o citan tu web?
Con tres capas: logs de servidor para crawlers (los bots no ejecutan JS, el beacon no los ve), clics con referrer de asistentes, y un sondeo semanal a la API del asistente con preguntas sacadas de tus FAQ, guardando también dominios rivales. El informe diario de contadores no debe redactarlo un LLM. Las herramientas SaaS de “AI visibility” son opcionales, no obligatorias.
¿Hace falta un SaaS de AI visibility para trabajar la citabilidad?
No. La capa on-page (llms.txt, FAQ con schema FAQPage, dateModified real, robots y breadcrumbs) se monta en tu build. La medición determinista sale del access log y de sondeos propios. Un SaaS puede ser cómodo, pero introduce dependencia externa y menos control sobre qué cuenta como señal.
¿El contenido generado con IA perjudica el SEO o la citabilidad?
No por ser IA en sí: Google, según Blend Expert (2025), mira utilidad, originalidad e intención. El riesgo real es inventar datos, publicar volumen sin propósito y producir texto genérico sin criterio humano. Para ser citable, la verificación factual y la voz propia son el filtro; el volumen sin calidad satura el sitio y no le da a un LLM ninguna razón para preferirte.