El crawl budget es la capacidad y frecuencia con la que Google rastrea las URLs de un sitio. En sitios grandes importa porque, si Google pierde tiempo en páginas irrelevantes, puede tardar más en descubrir, actualizar o priorizar las URLs que sí generan tráfico y negocio.
Puntos clave
- El crawl budget combina demanda de rastreo y capacidad de rastreo del sitio.
- Importa sobre todo en webs grandes, ecommerce, medios, marketplaces y sitios con muchas URLs dinámicas.
- No suele ser un problema real en sitios pequeños con pocas páginas indexables.
- Las URLs duplicadas, filtros, parámetros, errores y redirecciones consumen rastreo sin aportar valor.
- La arquitectura, el enlazado interno y los sitemaps ayudan a guiar a Google hacia lo importante.
- Los logs del servidor muestran qué rastrea Googlebot de verdad, no lo que creemos que rastrea.
- Optimizar crawl budget no es bloquear todo: es limpiar señales y priorizar URLs útiles.
- Un buen manejo del rastreo mejora indexación, frescura y eficiencia técnica.
Qué es el crawl budget
El crawl budget es el volumen aproximado de URLs que Googlebot puede y quiere rastrear en un sitio durante un período determinado. No es un número fijo visible en Search Console, sino una consecuencia de cómo Google evalúa capacidad del servidor, demanda de actualización, popularidad, calidad y señales internas.
Google explica en su documentación sobre crawl budget en sitios grandes que este tema suele importar cuando una web tiene muchas URLs, cambios frecuentes o problemas que hacen que el rastreador invierta recursos en páginas poco útiles.
En una estrategia SEO, el crawl budget no se mira como una obsesión técnica aislada. Se revisa cuando el tamaño, la arquitectura o el historial de indexación indican que Google no está llegando bien a las páginas importantes.
Por qué el crawl budget importa para sitios grandes
El crawl budget importa para sitios grandes porque Google no rastrea infinitamente. Si una tienda online tiene miles de filtros, parámetros, paginaciones, productos agotados, duplicados y URLs internas sin valor, Googlebot puede gastar parte del rastreo en caminos que no deberían competir por indexación.
El problema no es solo que Google rastree de más. El problema es que rastree mal. Una URL comercial importante puede tardar más en refrescarse si el sitio empuja demasiadas URLs débiles, lentas, duplicadas o contradictorias.
En webs chicas, esto rara vez es una prioridad. Si un sitio tiene 80 páginas indexables y una estructura limpia, Google normalmente puede rastrearlo sin conflicto. Pero en un ecommerce con 80.000 URLs posibles, cada señal de arquitectura cuenta.
Cómo decide Google cuánto rastrear
Google combina dos ideas: límite de capacidad de rastreo y demanda de rastreo. La capacidad depende de cuánto puede visitar Googlebot sin afectar el servidor. Si el sitio responde lento, devuelve errores o se satura, Google puede reducir la frecuencia.
La demanda depende de cuánto interés tiene Google en volver. Las páginas populares, actualizadas, enlazadas internamente y de mayor calidad suelen recibir más atención. Las páginas duplicadas, pobres, bloqueadas o poco enlazadas reciben menos prioridad.
Por eso el crawl budget no se arregla solo con robots.txt. También depende de velocidad, estabilidad, contenido, arquitectura, enlaces internos, canonicals, sitemaps y señales de calidad.
Señales de que tenés un problema de crawl budget
- Google tarda demasiado en descubrir productos, categorías o artículos nuevos.
- Search Console muestra muchas páginas descubiertas pero no indexadas.
- Los logs revelan rastreo frecuente de parámetros, filtros o URLs irrelevantes.
- Hay miles de redirecciones, 404, duplicados o páginas thin content rastreadas.
- El sitemap incluye URLs que no deberían competir por indexación.
- Las páginas importantes tienen pocos enlaces internos o quedan muy profundas.
- Los cambios en URLs estratégicas tardan mucho en reflejarse en Google.
Crawl budget, indexación y arquitectura
Rastreo e indexación no son lo mismo. Google puede rastrear una URL y decidir no indexarla. También puede descubrir una URL y no rastrearla enseguida. Por eso conviene separar tres preguntas: si Google descubre la URL, si la rastrea y si finalmente la indexa.
Cuando hay problemas de indexación en Google, el crawl budget puede ser una de las causas, pero no la única. También pueden existir problemas de calidad, canibalización, canonical mal elegido, noindex, duplicación, falta de enlaces internos o baja demanda.
La arquitectura ayuda porque le dice a Google qué importa. Una URL enlazada desde navegación, categorías y contenidos relacionados tiene más señales que una URL enterrada a cinco clics sin contexto.
Cómo optimizar el crawl budget sin romper el sitio
Limpiá URLs sin valor indexable
El primer paso es identificar URLs que no deberían consumir rastreo: filtros combinados, búsquedas internas, parámetros de ordenamiento, duplicados, páginas vacías, thin content, archivos obsoletos o variantes que no tienen demanda propia.
No todas se bloquean igual. Algunas necesitan canonical, otras noindex, otras redirección, otras mejora de contenido y otras simplemente salir del sitemap. La decisión depende de si la URL tiene valor para el usuario y para Google.
Usá sitemaps como mapa de prioridades
El sitemap no fuerza indexación, pero ayuda a declarar qué URLs son importantes. En sitios grandes, el sitemap debe estar limpio, segmentado y actualizado. No debería incluir URLs con noindex, redirecciones, errores o páginas que no querés posicionar.
Mejorá enlazado interno y profundidad
Las páginas importantes no deberían depender solo del sitemap. Necesitan enlaces internos desde categorías, artículos, navegación o módulos relacionados. Si una URL estratégica está demasiado profunda, Google puede interpretarla como menos prioritaria.
Revisá logs del servidor
Search Console da pistas, pero los logs muestran el comportamiento real de Googlebot. Ahí se ve qué URLs visita, con qué frecuencia, qué códigos devuelve el servidor y cuánto rastreo se va en patrones inútiles.
Cuidá velocidad y estabilidad
Un sitio lento o inestable reduce eficiencia. Si Googlebot encuentra errores 5xx, timeouts o respuestas pesadas, puede ajustar su rastreo. Optimizar performance ayuda al usuario y también al rastreador.
Errores comunes al trabajar crawl budget
- Pensar que todo sitio necesita optimizar crawl budget aunque tenga pocas URLs.
- Bloquear con robots.txt URLs que deberían consolidarse con canonical o redirección.
- Meter en el sitemap páginas no indexables, duplicadas o de baja calidad.
- Crear filtros indexables sin demanda real ni contenido único.
- Mirar solo Search Console y no revisar logs cuando el sitio es grande.
- Confundir rastreo con indexación y atacar el síntoma equivocado.
- Eliminar páginas sin revisar tráfico, enlaces, demanda o función dentro del sitio.
Cuándo conviene auditar crawl budget
Conviene auditar crawl budget cuando el sitio tiene miles de URLs, mucha rotación de inventario, problemas de indexación, crecimiento desordenado de parámetros o cambios importantes de arquitectura. También cuando el sitemap y los logs cuentan historias distintas.
Una auditoría SEO permite cruzar rastreo, indexación, arquitectura, logs y negocio. La clave es no optimizar por prolijidad técnica, sino para que Google llegue antes y mejor a las URLs que importan.
Conclusión
El crawl budget importa cuando el tamaño o la complejidad del sitio hacen que Googlebot tenga que elegir dónde invertir su rastreo. En sitios grandes, cada URL inútil, duplicada o contradictoria puede restar claridad a las páginas que sí deberían posicionar.
La solución no es bloquear a ciegas. Es ordenar arquitectura, limpiar sitemaps, consolidar duplicados, mejorar velocidad, revisar logs y priorizar páginas con valor real. Si Google entiende qué importa, rastrea mejor.
Preguntas frecuentes sobre crawl budget
El crawl budget es la cantidad aproximada de URLs que Googlebot puede y quiere rastrear en un sitio durante un período determinado. Depende de capacidad del servidor, demanda de rastreo, calidad, enlaces internos y señales técnicas.
No con la misma intensidad. En sitios pequeños suele ser irrelevante. Importa más en ecommerce, medios, marketplaces y webs grandes con muchas URLs dinámicas, filtros, parámetros o cambios frecuentes.
Podés sospecharlo si Google tarda en descubrir páginas importantes, rastrea muchos parámetros o duplicados, muestra muchas URLs descubiertas pero no indexadas, o si los logs revelan consumo de rastreo en URLs sin valor.
Puede ayudar en algunos casos, pero no es una solución universal. A veces conviene canonical, noindex, redirección, limpieza de sitemap, mejora de contenido o cambios de enlazado interno.
El rastreo es la visita de Googlebot; la indexación es la decisión de guardar una URL en el índice. Mejorar crawl budget puede ayudar, pero una URL rastreada igual puede no indexarse si no tiene calidad o señales suficientes.
Search Console ayuda a ver estadísticas de rastreo e indexación, pero en sitios grandes los logs del servidor son clave para saber qué URLs visita Googlebot y qué recursos consume.