En resumen
- Cada resultado enlaza a tu nota y lleva el nombre o el dominio de tu medio. Nunca devolvemos el texto completo.
- Los clientes ven tu titular, tu propia descripción y, como mucho, un fragmento de hasta 25 palabras (dos en el modo profundo).
- Respetamos robots.txt y las señales de exclusión de IA. Un bloqueo se aplica dentro de la hora, y borramos lo que guardamos dentro de las 72 horas.
- No entrenamos modelos de IA, y no vendemos tu contenido ni conjuntos de datos armados con él.
- ¿Quieres irte, o quieres más? Usa el formulario de pedidos. Nunca preguntamos por qué.
Quiénes somos y cómo te llevamos lectores
typesearch es una API de búsqueda. Los desarrolladores la usan para que sus agentes de IA, como asistentes de investigación, herramientas para redacciones o aplicaciones de monitoreo, encuentren noticias recientes. Cuando un agente busca, recibe una lista de notas, cada una con su titular, el nombre de tu medio, la fecha y un enlace a tu página.
Cada resultado enlaza a tu nota, y quien quiere leerla completa tiene que abrirla en tu sitio. Somos un buscador, no un republicador: no reescribimos tus notas y nunca pasamos su texto completo.
Qué tomamos y qué mostramos
Para armar el índice, nuestro rastreador lee tus feeds, tus sitemaps de noticias, tu portada y tus secciones. Para responder la búsqueda de un cliente, lee las pocas notas que pueden coincidir, para comprobar que sean relevantes.
De cada nota, nuestros clientes reciben:
- tu titular (hasta 240 caracteres), la descripción que publicas en tu feed o en los metadatos de la página (hasta 300 caracteres), la fecha, el nombre de tu medio y un enlace a tu nota;
- como mucho un fragmento de hasta 25 palabras (dos en el modo profundo), que nunca sale del primer párrafo. Las notas de menos de 1.200 caracteres de texto no tienen ningún fragmento;
- y cada cliente recibe como mucho tres fragmentos distintos de la misma nota por día, para que las búsquedas repetidas no terminen reconstruyendo tu nota.
Nunca reciben el texto completo de tu nota ni un resumen escrito por IA. Un modelo de lenguaje lee el texto sólo para puntuar qué tan relevante es para la búsqueda y para etiquetarlo, por ejemplo por su tono; nunca escribe sobre él.
Nuestros clientes también se comprometen. Según nuestros Términos del servicio, cuando muestran resultados a personas tienen que mostrar el nombre de tu medio y enlazar a tu nota, y no pueden reconstruir ni republicar tus notas a partir de fragmentos, guardar fragmentos o descripciones más de 30 días, ni usar los resultados para entrenar modelos de IA.
Qué guardamos y por cuánto tiempo
- El índice guarda el enlace, el titular, la descripción, la fecha y la sección de cada nota, hasta 12 meses.
- El texto de las notas se guarda 2 días como mucho, sólo para no descargar dos veces la misma nota. Nunca entra en nuestras copias de respaldo.
- Los juicios de relevancia, con hasta dos fragmentos por nota, se guardan 8 días, para que la misma búsqueda no necesite otra vez al modelo.
- El modelo de lenguaje recibe el texto de las notas sólo para juzgarlo frente a la búsqueda de un cliente. No entrenamos modelos con él, y no lo vendemos, ni vendemos conjuntos de datos armados con él.
Lo que nunca hacemos
- Devolver el texto completo de tus notas.
- Escribir resúmenes de tus notas con IA.
- Entrenar modelos de IA con tu contenido, ni venderlo, ni vender conjuntos de datos armados con él.
- Usar el texto de páginas de pago o que exigen iniciar sesión.
- Esquivar un bloqueo. Después de un 401 o un 403 paramos, y nunca reintentamos con otra herramienta: ni con un navegador ni desde otra dirección. Una verificación antibots («Just a moment…») nos detiene ahí mismo. Después de un 429 o un 503 esperamos, respetando
Retry-After, y reintentamos más tarde con la misma identidad. - Ocultar quiénes somos. Cada pedido nombra a nuestro rastreador y enlaza a su página.
Lo que controlas tú
No hace falta que nos escribas para decidir qué hacemos. Respetamos todo esto:
- robots.txt. Tenemos dos user-agents:
TypesearchBotarma el índice a partir de feeds, sitemaps, portadas y secciones;Typesearch-Userlee notas y usa el buscador de tu sitio cuando lo necesita la búsqueda de un cliente. Un grupoUser-agent: TypesearchBotvale para los dos; un grupoUser-agent: Typesearch-Uservale sólo para leer notas y usar el buscador. También respetamosCrawl-delay. Los detalles están en la página de nuestro rastreador. - Bloqueos a buscadores de IA. Si tu robots.txt bloquea a OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-SearchBot, Claude-User o Google-Extended, lo tomamos como un bloqueo también para nosotros, en las mismas rutas, salvo que nombres a TypesearchBot (o a Typesearch-User) en un grupo propio. Los bloqueos dirigidos sólo a rastreadores de entrenamiento de IA, como GPTBot, ClaudeBot o CCBot, no se aplican a nosotros, porque no entrenamos modelos de IA.
- Content Signals de Cloudflare en robots.txt: con
search=nooai-input=no, no rastreamos ni usamos tu sitio.ai-train=nono nos afecta: no entrenamos modelos. - Preferencias de IA del IETF (
Content-Usage): consearch=noai-use=nen robots.txt, no rastreamos ni usamos tu sitio; como encabezado HTTP de una página (Content-UsageoContent-Signal), no usamos esa página. - Reserva de minería de textos y datos (TDMRep): con
/.well-known/tdmrep.json, el encabezadotdm-reservation: 1o la metaetiqueta, no leemos ni usamos el contenido. - Metaetiquetas robots y
X-Robots-Tag, paratypesearchbot,typesearch-usero todos los robots:noindexdeja la página fuera de nuestro índice y de los resultados;nosnippetsignifica sólo titular y enlace;max-snippet:[n]limita los fragmentos a n caracteres; el texto marcado condata-nosnippetnunca se cita;noarchivesignifica que no guardamos el texto después del pedido;noaionoimageaisignifica que no usamos la página. - Contenido de pago o para suscriptores: no tomamos el texto de las páginas marcadas como de pago (
isAccessibleForFree: false) ni de las que están detrás de un inicio de sesión. Mostramos sólo el titular y la descripción que publicas en tu feed. - Un aviso de reserva de derechos como «Prohibida su reproducción», en sitios de México o Colombia: sin fragmentos, sólo el titular, tu propia descripción y el enlace.
Qué pasa cuando te excluyes
- Dentro de la hora de un cambio en tu robots.txt, en tus Content Signals o en tu tdmrep.json, dejamos de descargar lo que cierran, y las notas de ahí dejan de aparecer en los resultados. Las etiquetas de una página (meta robots,
X-Robots-Tag,Content-Usage) valen desde la próxima vez que la leamos; para sacar páginas antes, usa robots.txt o el formulario. - Dentro de las 72 horas borramos los datos que guardamos de tu sitio, en general en minutos. Las copias de respaldo rotan dentro de los 7 días.
- Guardamos un registro de tu decisión (tu dominio, la fecha y el motivo) para seguir respetándola y, como prueba de que lo hicimos, un registro de nuestros pedidos a tu sitio y de las versiones de tu robots.txt, nunca el contenido de tus notas, hasta dos años. Los datos de contacto de quien hizo el pedido se tratan como dice nuestra Política de privacidad.
- Nuestros Términos además obligan a nuestros clientes a dejar de usar los resultados guardados de un medio que se fue dentro de los 30 días de nuestro aviso.
Cuéntanos qué necesitas
Usa este formulario para cualquier cosa sobre tu sitio: irte, mostrar sólo titulares y enlaces, quitar páginas, que nuestro rastreador vaya más despacio o hablar de algo más. Nunca preguntamos por qué, y no discutimos.
- Recibes enseguida un acuse de recibo por email, con un número de caso.
- Las exclusiones se aplican en minutos; nos comprometemos a menos de 24 horas.
- Los datos guardados se borran dentro de las 72 horas.
- Recibes una confirmación por escrito cuando está hecho.
- Si el email que usas es de tu dominio, puedes confirmar tu pedido con un clic. Si no lo es, lo aplicamos igual; si son más de tres sitios, revisamos primero el resto, dentro de las 24 horas.
¿Te mencionan en las noticias? Elige «Quitar resultados sobre mí». Esos pedidos los revisamos caso por caso, como exige la ley de privacidad: mira Personas en las noticias en nuestra Política de privacidad.
¿Prefieres el email? Escribe a publishers@typesearch.ai.
Cómo verificar a nuestro rastreador
Cada pedido dice quién es y enlaza a la página de nuestro rastreador. Sin navegador, los user-agents son:
Mozilla/5.0 (compatible; TypesearchBot/1.0; +https://typesearch.ai/bot)
Mozilla/5.0 (compatible; Typesearch-User/1.0; +https://typesearch.ai/bot)Los pedidos de nuestro rastreador salen de las direcciones publicadas en https://typesearch.ai/bot/ips.json: hoy, una sola dirección IPv4, 178.128.144.188. Además, cada uno va firmado con Web Bot Auth, y nuestras claves públicas están en https://api.typesearch.ai/.well-known/http-message-signatures-directory. La verificación por DNS inverso todavía no está disponible. Si algo usa nuestro nombre desde otra dirección, o sin nuestra firma, no somos nosotros: avísanos a bot@typesearch.ai.
Licencias y alianzas
Si quieres más —tu contenido premium con licencia, fragmentos más largos, una alianza—, hablemos. Elige «Licencias o alianzas» en el formulario, o escribe a publishers@typesearch.ai.
Contactos
- Medios: publishers@typesearch.ai
- Periodistas: press@typesearch.ai
- Avisos legales y de derechos de autor: copyright@typesearch.ai. Mira cómo enviar un aviso de derechos de autor.
- Personas mencionadas en las noticias: privacy@typesearch.ai
- Preguntas técnicas sobre nuestro rastreador: bot@typesearch.ai