Directivas de Robots.txt no interpretadas por google
Todas las directivas del Robots.txt que no lee Google. Cuidado con su utilización.
Esta curiosidad viene con motivo del artículo de cómo hacer un buen robots.txt. He decidido hacer un pequeño listado de directivas que no son leídas por Google y se suelen emplear. Para satisfacer las ganas de saber de directivas de robots.txt por parte de los más curiosos.
Alerta: Cuando utilizamos directivas que son ignoradas por Googlebot, este las considera como un espacio en blanco, como un comentario o como si no hubiese nada. Esto es un riesgo alto, ya que cuando no hay nada entre los user-agents especificados, estos son afectados por las directivas que tengan debajo. Por lo que si ponemos a Googlebot simplemente directivas que ignore y tenemos más reglas debajo para otros user-agents, Googlebot pertenecerá a este listado.
Por no hablar de lo obvio, que es que estas directivas no funcionarán ya que son ignoradas.

Además, esto también afectaría si no se especifica Googlebot, pero se especifica "todos los user-agents":
User-agent: *
Crawl-delay: 60
User-agent: Spambot
Disallow: /
Para que sepáis identificar las directivas ignoradas más comunes, os he hecho este listado:
Host
Directiva que utiliza Yandex, sirve para indicar la versión importante de la web (por ejemplo con www o sin). Y en caso de conflicto solo funcionará la que haya más arriba.
Actualmente no aparece en su documentación.
Crawl-delay
Está creada para evitar que los rastreadores sobrepasen la capacidad de carga del servidor con demasiadas peticiones. Entonces sirve para establecer un tiempo de espera entre petición y petición.
Ejemplo:
Crawl-delay: 60
Google nunca la ha tenido en cuenta (lo dejó por escrito en 2019, cuando retiró el código de las reglas no documentadas) y Yandex dejó de leerla el 22 de febrero de 2018: ahora la velocidad de rastreo se ajusta desde Yandex Webmaster, no desde el robots.txt.
Visit-time
Directiva que sirve para establecer el tiempo permitido a los bots designados que puedan rastrear tu página.
Ejemplo:
Visit-time: 0345-0600
Visit-time: 03:45-06:00

Visitado el 08/04/2022
Request-rate
Es otra versión para indicar la frecuencia con la que debe rastrear un bot. En teoría es combinable con visit tame
Request-rate: 1/10m
Clean-param
Sirve para evitar que se Crawleen los parámetros de una web.
Ejemplo:
Disallow:
Clean-param: v /hacer-robots-txt/
Impediría el rastreo de los parámetros de la página https://sanchezdonate.net/articulo/hacer-robots-txt/ entonces https://sanchezdonate.net/articulo/hacer-robots-txt/?v=2 no se podría rastrear.
Hay que especificar antes de la ruta que parámetro no se puede rastrear en particular y se pueden concatenar los parámetros con el carácter "&"
Indexpage
Esta directiva solo funciona en 360 hasta donde tengo conocimiento, solo enfocado en el público chino, y sería para indicarle al motor de búsqueda qué páginas se actualizan con frecuencia. De esta forma 360 rastreará la web de forma más inteligente.
Content-Signal
Es la más reciente de la lista. La propuso Cloudflare en septiembre de 2025 con su Content Signals Policy: una línea más en el robots.txt para decir qué se puede hacer con el contenido una vez rastreado. Tiene tres señales: search (índice de búsqueda y resultados), ai-input (usar el contenido como entrada de una IA, por ejemplo en RAG o grounding) y ai-train (entrenar o afinar modelos).
Ejemplo:
Content-Signal: search=yes, ai-train=no
Allow: /
Ojo, que es una preferencia y no un bloqueo: la propia Cloudflare reconoce que no es una contramedida técnica y que habrá quien la ignore, y hasta donde tengo conocimiento ningún buscador ha dicho que la interprete. Para Googlebot es una línea en blanco más, con el riesgo de agrupación que explico arriba. Si quieres impedir algo de verdad, sigue siendo cosa del Disallow por user-agent.
Otras directivas
Hay otras directivas como Noindex, ASCP-Crawler, ASCP-disallow-crawl o ASCP-allow-crawl que no funcionan. Con el Noindex hay un matiz: Google llegó a hacerle caso sin documentarlo nunca, hasta que retiró ese código el 1 de septiembre de 2019. Desde entonces lo trata como una línea vacía más.
Bibliografía
- Cómo interpreta Google el robots.txt (solo user-agent, allow, disallow y sitemap)
- Nota de Google sobre las reglas no admitidas en robots.txt (crawl-delay, nofollow y noindex), julio de 2019
- Yandex: la directiva Crawl-delay dejó de tenerse en cuenta el 22 de febrero de 2018
- Cloudflare: Content Signals Policy (24 de septiembre de 2025)
Te falta mi máster. Accede a una formación avanzada que te permitirá aplicar e implementar SEO en cualquier tipo de web.
Accede al Máster de SEO Técnico