Entendiendo a los Rastreadores de Google: Detalles Clave Sobre Googlebot y Cambios en las Direcciones IP

Introducción

Googlebot, el rastreador web de Google, está envuelto en muchos mitos y malentendidos. Esta máquina de rastreo y indexación es un componente central de cómo Google entiende e interpreta la web. Este artículo arroja luz sobre cómo funciona Googlebot, cómo se comporta con su sitio web, y los cambios recientes en las direcciones IP de los rastreadores de Google.

Desmitificando a Googlebot

Contrario a la creencia popular, Googlebot no es un solo robot. En realidad, es una infraestructura compartida por muchos servicios de Google, como Google Shopping y AdSense. Cuando ve "Googlebot" en los registros de su servidor, está viendo solo el tráfico de Google Search. Muchos otros servicios utilizan la misma infraestructura bajo nombres de rastreadores diferentes.

¿Qué es lo que Googlebot realmente descarga?

Googlebot solo descarga los primeros 2 MB de una página HTML, incluyendo las cabeceras HTTP. Si una página supera este límite, la parte que excede el límite no se descarga, no se procesa y no se indexa. Sin embargo, cada recurso referenciado en el HTML se descarga por separado, con su propio contador de bytes.

Para la mayoría de los sitios web, 2 MB de HTML es un volumen considerable. Sin embargo, ciertos elementos como imágenes incrustadas en el HTML, grandes bloques de CSS o JavaScript, o menús extensos colocados al principio del código podrían hacer que su contenido textual o datos estructurados excedan el límite, lo que significa que Googlebot no los verá.

¿Cómo procesa Googlebot la información descargada?

Una vez que Googlebot ha descargado los datos, el Web Rendering Service (WRS) de Google toma el control. Este servicio procesa el JavaScript y el CSS del lado del cliente, al igual que un navegador moderno, para entender el estado final de la página. Sin embargo, WRS solo puede ejecutar el código que ha sido descargado por Googlebot, y opera sin estado, lo que puede afectar cómo interpreta elementos dinámicos que dependen de JavaScript.

Optimizando la interacción de su sitio web con Googlebot

Google ofrece varias recomendaciones para optimizar la interacción de su sitio web con Googlebot:

  • Mantenga su HTML ligero. Externalice CSS y JavaScript en archivos separados.
  • Coloque elementos críticos en la parte superior del documento HTML.
  • Monitoree los registros de su servidor. Los tiempos de respuesta altos pueden llevar a Googlebot a reducir la frecuencia de rastreo.

Cambios en la ubicación de las direcciones IP de los rastreadores de Google

Además, Google ha anunciado un cambio en la ubicación de sus archivos JSON que listan las direcciones IP de sus rastreadores. Estos archivos se han trasladado de su antigua ubicación en developers.google.com/search/apis/ipranges/ a developers.google.com/crawling/ipranges/. Este cambio se debe a que estas direcciones IP no solo se refieren a Googlebot Search, sino a todos los servicios que utilizan la infraestructura de Googlebot.

Conclusión

Entender cómo funciona Googlebot y cómo interactúa con su sitio web es esencial para asegurar que su contenido sea rastreado e indexado correctamente. Manténgase al tanto de los cambios en las prácticas y políticas de Google para garantizar que su sitio web esté optimizado para los rastreadores de Google.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *