NuevoTu SDK de Exa o Tako, 5× más barato.

Nuestro rastreador

TypesearchBot

TypesearchBot es el rastreador de typesearch, una API de búsqueda de noticias para agentes de IA. Si tienes un sitio y lo viste en tus registros, esta página explica qué hace y cómo controlarlo.

En resumen

  • Dice quién es en cada pedido y enlaza a esta página.
  • Respeta robots.txt, incluidas las reglas escritas sólo para TypesearchBot.
  • Pide como mucho tres páginas o feeds a la vez a tu sitio, sumando todos nuestros servicios, y va más despacio si nos lo pides.
  • No inicia sesión y no intenta pasar verificaciones antibots.
  • Nuestros clientes reciben enlaces, titulares y fragmentos breves, nunca tus notas completas.

Quiénes somos

typesearch es una API de búsqueda que los desarrolladores usan para dar a sus agentes de IA acceso a noticias recientes. Nuestros clientes reciben enlaces a tus notas con su titular, su fecha y un fragmento breve, así que quien quiere leer la nota completa va a tu sitio. Nunca devolvemos el texto completo de una nota.

Qué descarga

  • Feeds y sitemaps de noticias. De los sitios de nuestro índice, revisa tus feeds RSS y tus sitemaps de noticias cada pocos minutos, en general con uno o dos pedidos por revisión. Si muchas búsquedas necesitan el mismo sitio a la vez, lo descarga una sola vez.
  • Portadas y secciones. Para encontrar notas nuevas cuando un sitio no tiene un feed que funcione, y para responder búsquedas en vivo dentro de un sitio.
  • Notas. Sólo las pocas que coinciden con la búsqueda de un cliente, para comprobar que son relevantes y elegir un fragmento breve. Guardamos el texto dos días como mucho; nuestro índice guarda sólo el enlace, el titular, la bajada y la fecha.
  • El buscador de tu sitio. Cuando un cliente hace una búsqueda en vivo en tu sitio, TypesearchBot puede usar tu buscador, como lo haría un lector, y leer la página de resultados si tu robots.txt lo permite.

Descarga páginas, feeds y sitemaps. Cuando una página sólo funciona con JavaScript, la abre en un navegador sin interfaz que no carga imágenes, videos, tipografías ni hojas de estilo. No inicia sesión y no envía ningún formulario salvo tu buscador público.

Cómo se identifica

La mayoría de los pedidos son pedidos HTTP simples, con este user-agent:

Mozilla/5.0 (compatible; TypesearchBot/1.0; +https://typesearch.ai/bot)

Cuando una página necesita un navegador, usa Chrome sin interfaz, que mantiene el user-agent habitual de Chrome y agrega nuestro nombre al final:

Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/<version> Safari/537.36 TypesearchBot/1.0 (+https://typesearch.ai/bot)

Para reconocer los dos, busca TypesearchBot. Todavía no publicamos una lista de direcciones IP. Si algo dice ser TypesearchBot y no respeta tu robots.txt, avísanos.

robots.txt

TypesearchBot lee tu robots.txt y lo consulta antes de descargar cualquier página o feed de tu sitio: feeds, sitemaps, portadas, secciones, notas y la página de resultados a la que lleva tu buscador. Si una página redirige a una dirección prohibida, no lee el destino.

  • Un grupo para User-agent: TypesearchBot tiene prioridad sobre el grupo *. Si no hay uno, sigue el de *.
  • Las reglas se aplican como indica el RFC 9309: gana la regla más larga que coincide y, a igual largo, gana Allow. Los comodines * y $ funcionan.
  • Guarda una copia de tu robots.txt hasta una hora, así que los cambios se aplican dentro de la hora.
  • Si tu robots.txt responde con un error 4xx, como 404, trata tu sitio como si no tuviera reglas.
  • Si tu robots.txt responde con un error 5xx o 429, o tu servidor no responde, trata todo tu sitio como prohibido y no descarga nada de él. Lo vuelve a intentar unos 10 minutos después.

Para bloquearlo en todo tu sitio:

User-agent: TypesearchBot
Disallow: /

Para dejarlo fuera de una parte de tu sitio y permitir el resto:

User-agent: TypesearchBot
Disallow: /premium/
Disallow: /archivo/

La carga sobre tus servidores

  • Pocas conexiones. TypesearchBot pide como mucho tres páginas o feeds a la vez al mismo sitio, contando juntos todos sus subdominios y todos nuestros servicios de rastreo, sin importar cuántos clientes estén buscando. Cien búsquedas sobre la misma noticia llegan a tus servidores como unos pocos pedidos.
  • Más despacio, si lo pides. Podemos fijar una pausa mínima entre pedidos a tu sitio, menos conexiones a la vez, o las dos cosas. El límite vale para tu dominio y sus subdominios, y para todos nuestros servicios desde el pedido siguiente.
  • Trabajo compartido. Las notas ya leídas se reutilizan durante un día, y las búsquedas idénticas dentro de los 10 minutos se responden desde nuestra caché, sin tocar tu sitio.
  • Pausas. Si los feeds de un sitio fallan o nos bloquean una y otra vez, lo pausamos: una hora la primera vez, y el doble cada vez, hasta seis horas.
  • Sin resolver desafíos. Si tu sitio muestra una verificación antibots (como «Just a moment…»), TypesearchBot se detiene ahí. No intenta resolverla.

TypesearchBot no lee Crawl-delay. Si nuestras visitas son demasiado frecuentes para tus servidores, escribe a bot@typesearch.ai con tu dominio y el ritmo que pueden soportar, por ejemplo un pedido cada 10 segundos o una sola conexión, y vamos más despacio. Para frenarlo del todo, usa robots.txt.

Contacto

¿Preguntas, un problema con nuestro rastreador o un pedido para que rastree menos? Escribe a bot@typesearch.ai e incluye tu dominio. En general respondemos dentro de un día hábil.