En resumen
- Dice quién es en cada pedido y enlaza a esta página.
- Respeta robots.txt, incluidas las reglas escritas sólo para TypesearchBot.
- Pide como mucho tres páginas o feeds a la vez a tu sitio, sumando todos nuestros servicios, y va más despacio si nos lo pides.
- No inicia sesión y no intenta pasar verificaciones antibots.
- Nuestros clientes reciben enlaces, titulares y fragmentos breves, nunca tus notas completas.
Quiénes somos
typesearch es una API de búsqueda que los desarrolladores usan para dar a sus agentes de IA acceso a noticias recientes. Nuestros clientes reciben enlaces a tus notas con su titular, su fecha y un fragmento breve, así que quien quiere leer la nota completa va a tu sitio. Nunca devolvemos el texto completo de una nota.
Qué descarga
- Feeds y sitemaps de noticias. De los sitios de nuestro índice, revisa tus feeds RSS y tus sitemaps de noticias cada pocos minutos, en general con uno o dos pedidos por revisión. Si muchas búsquedas necesitan el mismo sitio a la vez, lo descarga una sola vez.
- Portadas y secciones. Para encontrar notas nuevas cuando un sitio no tiene un feed que funcione, y para responder búsquedas en vivo dentro de un sitio.
- Notas. Sólo las pocas que coinciden con la búsqueda de un cliente, para comprobar que son relevantes y elegir un fragmento breve. Guardamos el texto dos días como mucho; nuestro índice guarda sólo el enlace, el titular, la bajada y la fecha.
- El buscador de tu sitio. Cuando un cliente hace una búsqueda en vivo en tu sitio, TypesearchBot puede usar tu buscador, como lo haría un lector, y leer la página de resultados si tu robots.txt lo permite.
Descarga páginas, feeds y sitemaps. Cuando una página sólo funciona con JavaScript, la abre en un navegador sin interfaz que no carga imágenes, videos, tipografías ni hojas de estilo. No inicia sesión y no envía ningún formulario salvo tu buscador público.
Cómo se identifica
La mayoría de los pedidos son pedidos HTTP simples, con este user-agent:
Mozilla/5.0 (compatible; TypesearchBot/1.0; +https://typesearch.ai/bot)Cuando una página necesita un navegador, usa Chrome sin interfaz, que mantiene el user-agent habitual de Chrome y agrega nuestro nombre al final:
Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/<version> Safari/537.36 TypesearchBot/1.0 (+https://typesearch.ai/bot)Para reconocer los dos, busca TypesearchBot. Todavía no publicamos una lista de direcciones IP. Si algo dice ser TypesearchBot y no respeta tu robots.txt, avísanos.
robots.txt
TypesearchBot lee tu robots.txt y lo consulta antes de descargar cualquier página o feed de tu sitio: feeds, sitemaps, portadas, secciones, notas y la página de resultados a la que lleva tu buscador. Si una página redirige a una dirección prohibida, no lee el destino.
- Un grupo para
User-agent: TypesearchBottiene prioridad sobre el grupo*. Si no hay uno, sigue el de*. - Las reglas se aplican como indica el RFC 9309: gana la regla más larga que coincide y, a igual largo, gana
Allow. Los comodines*y$funcionan. - Guarda una copia de tu robots.txt hasta una hora, así que los cambios se aplican dentro de la hora.
- Si tu robots.txt responde con un error 4xx, como 404, trata tu sitio como si no tuviera reglas.
- Si tu robots.txt responde con un error 5xx o 429, o tu servidor no responde, trata todo tu sitio como prohibido y no descarga nada de él. Lo vuelve a intentar unos 10 minutos después.
Para bloquearlo en todo tu sitio:
User-agent: TypesearchBot
Disallow: /Para dejarlo fuera de una parte de tu sitio y permitir el resto:
User-agent: TypesearchBot
Disallow: /premium/
Disallow: /archivo/La carga sobre tus servidores
- Pocas conexiones. TypesearchBot pide como mucho tres páginas o feeds a la vez al mismo sitio, contando juntos todos sus subdominios y todos nuestros servicios de rastreo, sin importar cuántos clientes estén buscando. Cien búsquedas sobre la misma noticia llegan a tus servidores como unos pocos pedidos.
- Más despacio, si lo pides. Podemos fijar una pausa mínima entre pedidos a tu sitio, menos conexiones a la vez, o las dos cosas. El límite vale para tu dominio y sus subdominios, y para todos nuestros servicios desde el pedido siguiente.
- Trabajo compartido. Las notas ya leídas se reutilizan durante un día, y las búsquedas idénticas dentro de los 10 minutos se responden desde nuestra caché, sin tocar tu sitio.
- Pausas. Si los feeds de un sitio fallan o nos bloquean una y otra vez, lo pausamos: una hora la primera vez, y el doble cada vez, hasta seis horas.
- Sin resolver desafíos. Si tu sitio muestra una verificación antibots (como «Just a moment…»), TypesearchBot se detiene ahí. No intenta resolverla.
TypesearchBot no lee Crawl-delay. Si nuestras visitas son demasiado frecuentes para tus servidores, escribe a bot@typesearch.ai con tu dominio y el ritmo que pueden soportar, por ejemplo un pedido cada 10 segundos o una sola conexión, y vamos más despacio. Para frenarlo del todo, usa robots.txt.
Contacto
¿Preguntas, un problema con nuestro rastreador o un pedido para que rastree menos? Escribe a bot@typesearch.ai e incluye tu dominio. En general respondemos dentro de un día hábil.