Qué es FestroBot
FestroBot es el rastreador que usa Festro para mantener al día un calendario de eventos de Montreal. Lee las páginas de eventos y los calendarios públicos de salas y organizadores para que lo que pasa esta noche en la ciudad esté reunido en un solo lugar, con un enlace a quien vende la entrada.
Lee hechos: título, fecha y hora, sala, rango de precios y el enlace a la fuente. No copia tus imágenes ni tus textos, y no vende nada. Si encontraste una ficha de Festro de tu propio evento, la página que buscas es Cómo llegó tu evento a Festro.
Cómo identificarlo
FestroBot envía esta cabecera User-Agent en cada solicitud: FestroBot/1.0 (+https://festro.com/crawler)
El token de producto — la palabra que se usa en `robots.txt` — es FestroBot. Las solicitudes provienen de infraestructura de Google Cloud en Norteamérica; no publicamos un rango fijo de IP, así que filtra por el agente de usuario y no por una dirección.
Cualquier cosa que diga ser FestroBot y que ignore las reglas de abajo no somos nosotros. Si lo ves, avísanos: queremos saberlo tanto como tú.
Cómo bloquearlo
FestroBot respeta `robots.txt`. Para impedir que lea tu sitio por completo, añade estas dos líneas al archivo `robots.txt` en la raíz de tu dominio:
- User-agent: FestroBot
- Disallow: /
Para bloquear solo una parte del sitio, indica una ruta en vez de `/` — por ejemplo `Disallow: /privado/`. También se respeta una directiva `Crawl-delay:`, que solo puede hacernos más lentos. Los cambios surten efecto en menos de un día: releemos el `robots.txt` al menos cada 24 horas.
Si no logramos leer tu `robots.txt` en absoluto — error de servidor, tiempo agotado — lo tratamos como «no rastrear» y paramos, en vez de dar por hecho el permiso. Un archivo ausente (un 404 normal) significa que no hay restricciones, según la convención habitual.
No hace falta que edites un archivo si prefieres no hacerlo: avísanos con nuestro formulario de retiro y apagamos tu sitio por nuestro lado, el mismo día. Consulta Corregir o retirar una ficha.
Cómo se comporta
- Despacio. Al menos un segundo entre solicitudes al mismo sitio web, más si tu `robots.txt` lo pide. Una sala típica se lee unas pocas veces al día como mucho. Las API de venta de entradas con licencia son una vía aparte, consultada según los límites de velocidad de esos programas: es una llamada de API, no una exploración de tu sitio.
- Sin sesión. FestroBot nunca inicia sesión, nunca usa una cuenta y nunca envía credenciales ni claves de API de nadie.
- HTTP simple. No ejecuta JavaScript, no envía formularios, no pulsa botones ni intenta resolver ningún desafío o CAPTCHA.
- Honesto ante el fallo. Un 429 o un 5xx lo hacen retroceder. Un bloqueo lo hace parar, no insistir.
Si FestroBot está causando carga apreciable en tu servidor, es un error nuestro. Avísanos con nuestro formulario de contacto y lo ralentizamos o lo apagamos mientras lo revisamos.
Qué guardamos
De una página pública de eventos guardamos los hechos del evento y la URL de la que los leímos. Guardamos la fecha de la última comprobación, que se muestra públicamente en la ficha para que el lector sepa cuán reciente es. No guardamos copias de tus páginas más allá de lo necesario para extraer esos hechos.
También guardamos una copia fechada del `robots.txt` y de los términos públicos de cada fuente, para que nuestro registro de qué permitía un sitio, y cuándo, sea un documento y no un recuerdo.
Contacto
Preguntas, quejas o una petición de que paremos: nuestro formulario de contacto. Lo lee una persona. Si nos pides que paremos, paramos primero y hablamos después — no hace falta enviar un requerimiento formal para obtener respuesta.