Central : +51 5786934
Celular : 938157989
WhatsApp : 938157989
  1. Activación en 30 minutos.

    image
    Luego de verificado el pago, habilitaremos su cuenta en un período menor a 20 minutos.
  2. Panel de Contro Propio

    image
    Panel de Contro Propio.
  3. Servidores Seguros

    image
    Servidores Seguros.
  4. Respado de tu Web.

    image
    Nosotros respaldamos el contenido de tu web guardando una copia de seguridad.
  5. Soporte Técnico 24 horas

    image
    Seguridad de toda su información al 100%
PREGUNTA FRECUENTE
? Qu? es un archivo robots.txt ?

El fichero robots.txt es un archivo de texto que dicta unas recomendaciones para que todos los crawlers y robots de buscadores cumplan (recomendaciones, no obligaciones)

Un crawler es un robot de una entidad (generalmente buscadores) que acceden a las p?ginas web de un sitio para buscar informaci?n en ella, a?adirla en los buscadores, etc. Tambi?n son llamados spiders, ara?as, bots o indexadores.

Por ejemplo, Googlebot es el nombre del crawler del buscador Google. Tambi?n existen otros como:

■Mediapartners-Google, que es el crawler que se encarga de revisar los anuncios de Google Adsense.
■Googlebot-Image, robot indexador de imagenes del buscador de Google.
■Slurp, crawler de indexaci?n del buscador Yahoo!
■noxtrumbot, del buscador Noxtrum.
■Scooter, del buscador Altavista.
Y much?simos m?s. Si establecemos un control en nuestro robots.txt, podremos conseguir una serie de beneficios:

■Impedir acceso a robots determinados: Puede parecer contradictorio, pero algunos crawlers no nos proporcionar?n sino problemas. Algunos robots no son de buscadores, e incluso algunos robots no son ni amigos. Pero de eso ya hablaremos m?s tarde.
■Reducir la sobrecarga del servidor: Podr?s controlar el flujo de algunos robots. Algunos de ellos son un verdadero descontrol de peticiones que pueden llegar a saturar tu servidor.
■Prohibir zonas: Nos puede interesar tener disponible una zona en nuestra web, que sea accesible para algunos, pero que no aparezca en buscadores.
■Eliminar contenido duplicado: Uno de los casos m?s importantes, que casi siempre es olvidado por los webmasters. Si eliminamos la duplicidad de contenido, los buscadores nos puntuaran muy alto, aumentando el flujo de visitas.
■Fijar mapas del sitio: Tambi?n es posible acoplar un sitemap para indicar el buen camino a los robots.
?Y entonces, que hay que hacer? Es muy sencillo.

S?lo tenemos que crear un fichero de texto robots.txt y comenzar a escribir en el. Partir? del siguiente ejemplo donde permitimos la entrada a todos los crawlers (igual que sin ning?n robots.txt):

User-agent: *
Disallow:
En User-agent debemos introducir el nombre del robot, y a continuaci?n las rutas donde queremos prohibir que acceda. Algunos ejemplos:

■Disallow: / prohibe la entrada a todo el sitio.
■Disallow: /foro/ prohibe la entrada a los documentos del directorio foro.
■Disallow: permite la entrada a todo el sitio.
En algunos casos suele utilizarse en lugar de Disallow, la palabra Allow. Aunque por definici?n es correcta, es conveniente no utilizarla, puesto que las rutas omitidas se asumen que est?n permitidas por defecto, y algunos crawlers no entienden la palabra Allow.

Es posible acumular varios Disallow bajo un mismo User-agent, pero no podemos utilizar varios User-agent encima de un Disallow. Bien, alg?n ejemplo:

# Crawler de MSN
User-agent: msnbot
Disallow: /links.html
Disallow: /private/
Disallow: /photos/
Este c?digo impide al crawler del buscador de Live (MSN) acceder a la p?gina links.html, y las carpetas private y photos (y todo su contenido) de nuestro sitio.

A?adiendo el car?cter # al principio de una linea podemos escribir comentarios que no interpretar? el crawler.

Es posible ir acumulando reglas para distintos crawlers, formando un robots.txt m?s largo y completo. Cada vez que escribamos un User-agent deberemos dejar una linea en blanco de separaci?n. Adem?s, existe una ligera adaptaci?n que permiten usar comodines ($ y *) en las rutas en algunos crawlers (s?lo Googlebot y Slurp):

User-agent: Slurp
Disallow: /*.js$
Disallow: /2006/*
Disallow: /2007/*
Disallow: /articulos/*/pagina/*
Se est? indicando al robot de Yahoo, que no indexe los ficheros que terminen en .js (javascript), direcciones que empiecen por 2007 o 2006 (fechas), ni art?culos con la palabra pagina (paginado de comentarios). Estos casos pertenecen a la idea de no indexar contenido duplicado.

En la mayor?a de los blogs, puedes acceder a un mismo art?culo por las direcciones:

■blog.com/articulo/titulo, la direcci?n principal.
■blog.com/2007/04/, el archivo del mes.
■blog.com/articulo/titulo/feed, feed RSS del art?culo.
■blog.com/articulo/titulo/pagina/2, pagina 2 de comentarios.
Todo esto es contenido duplicado, una de las razones m?s importantes de penalizaci?n para un buscador, a no ser, claro, que te las ingenies para que s?lo sea accesible desde una direcci?n. A la hora de ver los resultados te asombrar?s lo bien que estar?s quedando ante los ojos de Google, por ejemplo.

Hay que tener mucho cuidado con usar cosas como Disallow: /pagina o Disallow: /*pagina, puesto que en lugar de bloquear lo que quer?amos (carpeta pagina o art?culos paginados), terminen bloqueando direcciones como /decorar-mi-pagina o /paginas-para-amigos/.

Si revisas estad?sticas y dem?s, tambi?n puedes observar que a veces algunos crawlers ?se pasan? revisando nuestro sitio, y funden a peticiones a nuestro pobre servidor. Existe una manera de tranquilizar a los robots:

User-agent: noxtrumbot
Crawl-delay: 30
Con esto le decimos al robot de noxtrum que espere 30 segundos entre cada acceso. Cuidado, porque Crawl-delay no lo soportan todos los crawlers (al menos MSNBot y Slurp si lo soportan, y Googlebot desde el panel de webmasters tambi?n).

Finalmente, podemos tambi?n incluir un mapa del sitio en nuestro robots.txt de la siguiente forma:

Sitemap: http://www.inkawebdesign.com/sitemap.xml
En RobotsTXT.org podr?s encontrar documentaci?n oficial si quieres profundizar y en esta b?squeda de Google encontrar?s muchos robots.txt de ejemplo, incluso robots.txt optimizados para tu tipo de web. Adem?s, tambi?n tienes un validador de robots.txt.

Publicado el : 2011-02-19 03:48:20

Te damos todas las facilidades
para Contactarnos

Central : +51 5786934
Celular : 938157989
WhatsApp : 938157989
Ventas : ventas@creatuhost.com
Soporte : soporte@creatuhost.com

Ultimos Tutoriales
Manuales y Tutoriales Online
Manuales y tutoriales de programacion y dise?o, cursos y manuales de todos los lenguajes de programacion asi como d ... leer más
Cute FTP
FTP es uno de los m?s importantes servicios de Internet, se usa para transferir ficheros desde un cliente al servid ... leer más
Configuraci?n Outlook Express
Outlook Express fue un cliente de correo electr?nico y de noticias de red producido por Microsoft para sus platafor ... leer más
Winamp
Winamp es un reproductor multimedia, para la plataforma Microsoft Windows creado el 21 de abril de 1997 y distribui ... leer más
PHPDesigner 2009
PHPDesigner 2009 es un excelente editor de programaci?n. PHPDesigner 2009 sirve como editor de c?digo PHP pero t ... leer más
Configuraci?n de email en Blackberry
BlackBerry es una linea de dispositivos handheld inal?mbricos introducida en 1999. Estos dispositivos entre otras f ... leer más
Compras Seguras en Línea con las Principales Tarjetas de Crédito y Paypal