PREGUNTA FRECUENTE
? Qu? es un archivo robots.txt ?
El fichero robots.txt es un archivo de texto que dicta unas recomendaciones para que todos los crawlers y robots de buscadores cumplan (recomendaciones, no obligaciones)
Un crawler es un robot de una entidad (generalmente buscadores) que acceden a las p?ginas web de un sitio para buscar informaci?n en ella, a?adirla en los buscadores, etc. Tambi?n son llamados spiders, ara?as, bots o indexadores.
Por ejemplo, Googlebot es el nombre del crawler del buscador Google. Tambi?n existen otros como:
■Mediapartners-Google, que es el crawler que se encarga de revisar los anuncios de Google Adsense.
■Googlebot-Image, robot indexador de imagenes del buscador de Google.
■Slurp, crawler de indexaci?n del buscador Yahoo!
■noxtrumbot, del buscador Noxtrum.
■Scooter, del buscador Altavista.
Y much?simos m?s. Si establecemos un control en nuestro robots.txt, podremos conseguir una serie de beneficios:
■Impedir acceso a robots determinados: Puede parecer contradictorio, pero algunos crawlers no nos proporcionar?n sino problemas. Algunos robots no son de buscadores, e incluso algunos robots no son ni amigos. Pero de eso ya hablaremos m?s tarde.
■Reducir la sobrecarga del servidor: Podr?s controlar el flujo de algunos robots. Algunos de ellos son un verdadero descontrol de peticiones que pueden llegar a saturar tu servidor.
■Prohibir zonas: Nos puede interesar tener disponible una zona en nuestra web, que sea accesible para algunos, pero que no aparezca en buscadores.
■Eliminar contenido duplicado: Uno de los casos m?s importantes, que casi siempre es olvidado por los webmasters. Si eliminamos la duplicidad de contenido, los buscadores nos puntuaran muy alto, aumentando el flujo de visitas.
■Fijar mapas del sitio: Tambi?n es posible acoplar un sitemap para indicar el buen camino a los robots.
?Y entonces, que hay que hacer? Es muy sencillo.
S?lo tenemos que crear un fichero de texto robots.txt y comenzar a escribir en el. Partir? del siguiente ejemplo donde permitimos la entrada a todos los crawlers (igual que sin ning?n robots.txt):
User-agent: *
Disallow:
En User-agent debemos introducir el nombre del robot, y a continuaci?n las rutas donde queremos prohibir que acceda. Algunos ejemplos:
■Disallow: / prohibe la entrada a todo el sitio.
■Disallow: /foro/ prohibe la entrada a los documentos del directorio foro.
■Disallow: permite la entrada a todo el sitio.
En algunos casos suele utilizarse en lugar de Disallow, la palabra Allow. Aunque por definici?n es correcta, es conveniente no utilizarla, puesto que las rutas omitidas se asumen que est?n permitidas por defecto, y algunos crawlers no entienden la palabra Allow.
Es posible acumular varios Disallow bajo un mismo User-agent, pero no podemos utilizar varios User-agent encima de un Disallow. Bien, alg?n ejemplo:
# Crawler de MSN
User-agent: msnbot
Disallow: /links.html
Disallow: /private/
Disallow: /photos/
Este c?digo impide al crawler del buscador de Live (MSN) acceder a la p?gina links.html, y las carpetas private y photos (y todo su contenido) de nuestro sitio.
A?adiendo el car?cter # al principio de una linea podemos escribir comentarios que no interpretar? el crawler.
Es posible ir acumulando reglas para distintos crawlers, formando un robots.txt m?s largo y completo. Cada vez que escribamos un User-agent deberemos dejar una linea en blanco de separaci?n. Adem?s, existe una ligera adaptaci?n que permiten usar comodines ($ y *) en las rutas en algunos crawlers (s?lo Googlebot y Slurp):
User-agent: Slurp
Disallow: /*.js$
Disallow: /2006/*
Disallow: /2007/*
Disallow: /articulos/*/pagina/*
Se est? indicando al robot de Yahoo, que no indexe los ficheros que terminen en .js (javascript), direcciones que empiecen por 2007 o 2006 (fechas), ni art?culos con la palabra pagina (paginado de comentarios). Estos casos pertenecen a la idea de no indexar contenido duplicado.
En la mayor?a de los blogs, puedes acceder a un mismo art?culo por las direcciones:
■blog.com/articulo/titulo, la direcci?n principal.
■blog.com/2007/04/, el archivo del mes.
■blog.com/articulo/titulo/feed, feed RSS del art?culo.
■blog.com/articulo/titulo/pagina/2, pagina 2 de comentarios.
Todo esto es contenido duplicado, una de las razones m?s importantes de penalizaci?n para un buscador, a no ser, claro, que te las ingenies para que s?lo sea accesible desde una direcci?n. A la hora de ver los resultados te asombrar?s lo bien que estar?s quedando ante los ojos de Google, por ejemplo.
Hay que tener mucho cuidado con usar cosas como Disallow: /pagina o Disallow: /*pagina, puesto que en lugar de bloquear lo que quer?amos (carpeta pagina o art?culos paginados), terminen bloqueando direcciones como /decorar-mi-pagina o /paginas-para-amigos/.
Si revisas estad?sticas y dem?s, tambi?n puedes observar que a veces algunos crawlers ?se pasan? revisando nuestro sitio, y funden a peticiones a nuestro pobre servidor. Existe una manera de tranquilizar a los robots:
User-agent: noxtrumbot
Crawl-delay: 30
Con esto le decimos al robot de noxtrum que espere 30 segundos entre cada acceso. Cuidado, porque Crawl-delay no lo soportan todos los crawlers (al menos MSNBot y Slurp si lo soportan, y Googlebot desde el panel de webmasters tambi?n).
Finalmente, podemos tambi?n incluir un mapa del sitio en nuestro robots.txt de la siguiente forma:
Sitemap: http://www.inkawebdesign.com/sitemap.xml
En RobotsTXT.org podr?s encontrar documentaci?n oficial si quieres profundizar y en esta b?squeda de Google encontrar?s muchos robots.txt de ejemplo, incluso robots.txt optimizados para tu tipo de web. Adem?s, tambi?n tienes un validador de robots.txt.
Publicado el : 2011-02-19 03:48:20