# QUE ES ESTE FICHERO. Una senal que los rastreadores serios respetan, no un # candado: quien no quiera cumplirla la ignora sin que nada se lo impida. Varios # agentes que actuan "a peticion de un usuario" (ChatGPT-User, Perplexity-User, # meta-externalfetcher, Amzn-User) avisan en su propia documentacion de que # pueden saltarsela. La base para reclamar son los Terminos de uso # (https://kinistats.com/legal.html#terminos), que prohiben la extraccion # automatizada, la copia masiva de datos y su uso para entrenar o alimentar # sistemas de IA sin permiso por escrito. Este fichero refleja esa regla. # # /data/ esta cerrado a todos: son los JSON que alimentan la app, y rastrearlos # no aporta nada — el contenido esta en las paginas. Con UNA excepcion para los # buscadores: elo.json es el dato propio que /elo declara como Dataset, y un # `contentUrl` que el propio robots.txt prohibe es una fuente que se ofrece y no # se deja coger. # # EL ORDEN IMPORTA. Google aplica la regla mas especifica (la ruta mas larga que # casa); urllib.robotparser, la primera que casa. Este grupo decia `Allow: /` # delante de `Disallow: /data/`, y robotparser dejaba entrar en /data/ a todo el # mundo mientras Google no. Van de la mas especifica a la mas general, y sin # comodines ni `$`, que robotparser no entiende. Lo comprueba # tests/tools/test_robots_contra_agentes_ia.py con los dos criterios. # Sin `Allow: /`: lo que ninguna regla nombra ya esta abierto. Quitarlo no cambia # ningun veredicto (1.276 casos agente x ruta, robotparser y Protego). User-agent: * Content-Signal: search=yes, ai-train=no, ai-input=no Allow: /data/elo.json Disallow: /data/ # AGENTES Y RASTREADORES DE IA: fuera de los datos. Decision del dueno del # 2026-09-25, que sustituye a la anterior (todos con Allow: / para que citaran): # con las fichas de /partido/ se reconstruyen las jugadas Pro. Lo que no se # cierra aqui sigue abierto: la portada, /legal.html y /llms.txt, a proposito, y # los estaticos (escudos, og-card.png, sitemap.xml, los .js). Una ruta nueva # nace abierta hasta que se anada a esta lista. Los buscadores (Googlebot, # Bingbot, Applebot...) no estan aqui: siguen el grupo de arriba y el SEO no # cambia. # # Google-Extended y Applebot-Extended no rastrean: son la marca con la que Google # y Apple miran si lo que ya rastrearon sus buscadores puede ir a su IA. # /elo, /comparar, /historial y /app van SIN barra porque responden 308 hacia la # version con barra: con `/elo/` la primera peticion, a /elo, pasaria. /redes # pinta en el navegador las probabilidades de /data/predictions.json. # Nombres tomados de la documentacion de cada empresa el 2026-09-25. User-agent: GPTBot User-agent: ChatGPT-User User-agent: OAI-SearchBot User-agent: ClaudeBot User-agent: Claude-User User-agent: Claude-SearchBot User-agent: anthropic-ai User-agent: Google-Extended User-agent: Google-CloudVertexBot User-agent: PerplexityBot User-agent: Perplexity-User User-agent: Bytespider User-agent: Amazonbot User-agent: Amzn-SearchBot User-agent: Amzn-User User-agent: Applebot-Extended User-agent: meta-externalagent User-agent: meta-externalfetcher User-agent: meta-webindexer User-agent: FacebookBot User-agent: MistralAI-User User-agent: MistralAI-Index User-agent: MistralAI-Training User-agent: DuckAssistBot User-agent: cohere-ai User-agent: cohere-training-data-crawler User-agent: Diffbot User-agent: Diffbot-User User-agent: Timpibot User-agent: ImagesiftBot User-agent: omgili User-agent: omgilibot User-agent: Webzio-Extended User-agent: YouBot Disallow: /partido/ Disallow: /liga/ Disallow: /club/ Disallow: /elo Disallow: /comparar Disallow: /historial Disallow: /app Disallow: /api/ Disallow: /data/ Disallow: /redes # CCBot sigue cerrado entero, como antes: alimenta Common Crawl, un corpus que se # usa para entrenar sin devolver ni una visita ni una mencion. Ni la portada. User-agent: CCBot Disallow: / Sitemap: https://kinistats.com/sitemap.xml