Em resumo
- Cada resultado tem um link para a sua matéria e o nome ou o domínio do seu veículo. Nunca devolvemos o texto completo.
- Os clientes veem o seu título, a sua própria descrição e, no máximo, um trecho de até 25 palavras (dois no modo profundo).
- Respeitamos o robots.txt e os sinais de exclusão de IA. Um bloqueio vale em até uma hora, e apagamos o que guardamos em até 72 horas.
- Não treinamos modelos de IA e não vendemos o seu conteúdo nem conjuntos de dados feitos com ele.
- Quer sair ou quer mais? Use o formulário de pedidos. Nunca perguntamos o motivo.
Quem somos e como levamos leitores até você
O typesearch é uma API de busca. Desenvolvedores a usam para que os seus agentes de IA, como assistentes de pesquisa, ferramentas para redações e aplicativos de monitoramento, encontrem notícias recentes. Quando um agente faz uma busca, recebe uma lista de matérias, cada uma com o título, o nome do seu veículo, a data e um link para a sua página.
Cada resultado tem um link para a sua matéria, e quem quiser a história completa precisa abri-la no seu site. Somos um buscador, não um republicador: não reescrevemos as suas matérias e nunca repassamos o texto completo delas.
O que coletamos e o que mostramos
Para montar o índice, o nosso rastreador lê os seus feeds, os seus sitemaps de notícias, a sua página inicial e as suas editorias. Para responder à busca de um cliente, ele lê as poucas matérias que podem corresponder, para verificar se são relevantes.
De cada matéria, os nossos clientes recebem:
- o seu título (até 240 caracteres), a descrição que você publica no feed ou nos metadados da página (até 300 caracteres), a data, o nome do seu veículo e um link para a sua matéria;
- no máximo um trecho de até 25 palavras (dois no modo profundo), nunca tirado do primeiro parágrafo. Matérias com menos de 1.200 caracteres de texto não têm nenhum trecho;
- e cada cliente recebe no máximo três trechos diferentes da mesma matéria por dia, para que buscas repetidas não acabem reconstruindo a sua matéria.
Eles nunca recebem o texto completo da sua matéria nem um resumo escrito por IA. Um modelo de linguagem lê o texto apenas para avaliar o quanto ele é relevante para a busca e para classificá-lo, por exemplo pelo tom; ele nunca escreve sobre o texto.
Os nossos clientes também têm obrigações. Pelos nossos Termos de Serviço (em inglês), quando mostram resultados a pessoas, eles precisam mostrar o nome do seu veículo e o link para a sua matéria, e não podem reconstruir nem republicar as suas matérias a partir de trechos, guardar trechos ou descrições por mais de 30 dias, nem usar os resultados para treinar modelos de IA.
O que guardamos e por quanto tempo
- O índice guarda o link, o título, a descrição, a data e a editoria de cada matéria, por até 12 meses.
- O texto das matérias fica guardado no máximo 2 dias, só para não baixarmos a mesma matéria duas vezes. Ele nunca entra nos nossos backups.
- As avaliações de relevância, com até dois trechos por matéria, ficam guardadas 8 dias, para que a mesma busca não precise do modelo outra vez.
- O modelo de linguagem recebe o texto das matérias apenas para avaliá-lo diante da busca de um cliente. Não treinamos modelos com ele e não o vendemos, nem vendemos conjuntos de dados feitos com ele.
O que nunca fazemos
- Devolver o texto completo das suas matérias.
- Escrever resumos das suas matérias com IA.
- Treinar modelos de IA com o seu conteúdo, nem vendê-lo, nem vender conjuntos de dados feitos com ele.
- Usar o texto de páginas pagas ou que exigem login.
- Contornar um bloqueio. Depois de um 401 ou 403 paramos, e nunca tentamos de novo com outra ferramenta: nem com navegador, nem de outro endereço. Uma verificação antirrobôs (“Just a moment…”) nos para ali mesmo. Depois de um 429 ou 503 esperamos, respeitando o
Retry-After, e tentamos de novo mais tarde com a mesma identidade. - Esconder quem somos. Cada requisição identifica o nosso rastreador e tem um link para a página dele (em inglês).
O que você controla
Você não precisa nos escrever para decidir o que fazemos. Respeitamos tudo isto:
- robots.txt. Temos dois user agents: o
TypesearchBotmonta o índice a partir de feeds, sitemaps, páginas iniciais e editorias; oTypesearch-Userlê matérias e usa a busca do seu site quando a busca de um cliente precisa disso. Um grupoUser-agent: TypesearchBotvale para os dois; um grupoUser-agent: Typesearch-Uservale só para a leitura de matérias e a busca no site. Também respeitamos oCrawl-delay. Os detalhes estão na página do nosso rastreador (em inglês). - Bloqueios a buscadores de IA. Se o seu robots.txt bloqueia OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-SearchBot, Claude-User ou Google-Extended, tratamos isso como um bloqueio também para nós, nos mesmos caminhos, a menos que você cite o TypesearchBot (ou o Typesearch-User) em um grupo próprio. Bloqueios voltados só a rastreadores de treinamento de IA, como GPTBot, ClaudeBot ou CCBot, não se aplicam a nós, porque não treinamos modelos de IA.
- Content Signals da Cloudflare no robots.txt: com
search=noouai-input=no, não rastreamos nem usamos o seu site.ai-train=nonão nos afeta: não treinamos modelos. - Preferências de IA do IETF (
Content-Usage): comsearch=nouai-use=nno robots.txt, não rastreamos nem usamos o seu site; como cabeçalho HTTP de uma página (Content-UsageouContent-Signal), não usamos essa página. - Reserva de mineração de textos e dados (TDMRep): com
/.well-known/tdmrep.json, o cabeçalhotdm-reservation: 1ou a meta tag, não lemos nem usamos o conteúdo. - Meta tags robots e
X-Robots-Tag, paratypesearchbot,typesearch-userou todos os robôs:noindexdeixa a página fora do nosso índice e dos resultados;nosnippetsignifica só título e link;max-snippet:[n]limita os trechos a n caracteres; o texto marcado comdata-nosnippetnunca vira trecho;noarchivesignifica que não guardamos o texto depois da requisição;noaiounoimageaisignifica que não usamos a página. - Conteúdo pago ou que exige login: não pegamos o texto de páginas marcadas como pagas (
isAccessibleForFree: false) ou atrás de login. Mostramos só o título e a descrição que você publica no feed. - Um aviso de reserva de direitos como “Prohibida su reproducción”, em sites do México ou da Colômbia: sem trechos, só o título, a sua própria descrição e o link.
O que acontece quando você sai
- Em até uma hora depois de uma mudança no seu robots.txt, nos seus Content Signals ou no seu tdmrep.json, paramos de baixar o que eles fecham, e as matérias dali deixam de aparecer nos resultados. As tags de uma página (meta robots,
X-Robots-Tag,Content-Usage) valem a partir da próxima vez que a lermos; para tirar páginas antes disso, use o robots.txt ou o formulário. - Em até 72 horas apagamos os dados que guardamos do seu site, em geral em minutos. Os backups antigos são substituídos em até 7 dias.
- Guardamos um registro da sua decisão (o seu domínio, a data e o motivo) para continuar respeitando-a e, como prova de que o fizemos, um registro das nossas requisições ao seu site e das versões do seu robots.txt, nunca o conteúdo das suas matérias, por até dois anos. Os dados de contato de quem fez o pedido são tratados como diz a nossa Política de Privacidade (em inglês).
- Os nossos Termos (em inglês) também obrigam os nossos clientes a deixar de usar os resultados guardados de um veículo que saiu em até 30 dias depois do nosso aviso.
Conte o que você precisa
Use este formulário para qualquer assunto sobre o seu site: sair, mostrar só títulos e links, remover páginas, fazer o nosso rastreador ir mais devagar ou conversar sobre algo mais. Nunca perguntamos o motivo e não discutimos.
- Você recebe na hora uma confirmação por e-mail, com um número de protocolo.
- As exclusões são aplicadas em minutos; nos comprometemos a fazer isso em menos de 24 horas.
- Os dados guardados são apagados em até 72 horas.
- Você recebe uma confirmação por escrito quando estiver feito.
- Se o e-mail que você usar for do seu domínio, você pode confirmar o pedido com um clique. Se não for, aplicamos o pedido do mesmo jeito; se forem mais de três sites, verificamos o resto primeiro, em até 24 horas.
O seu nome aparece nas notícias? Escolha “Remover resultados sobre mim”. Analisamos esses pedidos caso a caso, como exige a lei de proteção de dados: veja People in the news, na nossa Política de Privacidade (em inglês).
Prefere e-mail? Escreva para publishers@typesearch.ai.
Como verificar o nosso rastreador
Cada requisição diz quem é e tem um link para a página do nosso rastreador (em inglês). Sem navegador, os user agents são:
Mozilla/5.0 (compatible; TypesearchBot/1.0; +https://typesearch.ai/bot)
Mozilla/5.0 (compatible; Typesearch-User/1.0; +https://typesearch.ai/bot)As requisições do nosso rastreador saem dos endereços publicados em https://typesearch.ai/bot/ips.json: hoje, um único endereço IPv4, 178.128.144.188. Além disso, cada uma vai assinada com Web Bot Auth, e as nossas chaves públicas estão em https://api.typesearch.ai/.well-known/http-message-signatures-directory. A verificação por DNS reverso ainda não está disponível. Se algo usar o nosso nome a partir de outro endereço, ou sem a nossa assinatura, não somos nós: avise-nos em bot@typesearch.ai.
Licenciamento e parcerias
Se você quer mais — o seu conteúdo premium sob licença, trechos mais longos, uma parceria —, vamos conversar. Escolha “Licenciamento ou parceria” no formulário ou escreva para publishers@typesearch.ai.
Contatos
- Veículos de imprensa: publishers@typesearch.ai
- Jornalistas: press@typesearch.ai
- Avisos legais e de direitos autorais: copyright@typesearch.ai. Veja como enviar um aviso de direitos autorais.
- Pessoas mencionadas nas notícias: privacy@typesearch.ai
- Dúvidas técnicas sobre o nosso rastreador: bot@typesearch.ai