Costos y caché

Topes por pedido, y todo lo que abarata las búsquedas repetidas.

Topes

Pon max_tokens en un pedido (mínimo 2000) y nunca gastará más. El presupuesto se reserva antes de cada llamada al modelo; cuando la siguiente no entra, la búsqueda se detiene y devuelve todo lo juzgado hasta ahí con incomplete: true.

const res = await ts.search('el dólar', { mode: 'deep', max_tokens: 15_000 });

if (res.incomplete) {
  console.log(`Se detuvo en ${res.budget?.used} de ${res.budget?.max_tokens} tokens`);
}

Si el tope no alcanza ni para juzgar los titulares, el pedido falla con 402 budget_too_small antes de gastar nada.

Lo que no pagas dos veces

  • Caché de resultados. Un pedido idéntico dentro de los 10 minutos sale de la caché: cached_at dice cuándo se calculó, usage.tokens es 0 y no se cobra. Pon fresh: true para saltarla.
  • Memoria de juicios. Lo que el modelo dijo de un titular para una consulta se recuerda durante una semana, y el tono de cada nota también. Una búsqueda repetida sólo paga los titulares nuevos.
  • Primero los filtros. Dominios, secciones y fechas se aplican antes de juzgar nada.
  • Varias consultas juntas. Hasta cinco consultas en un pedido comparten las mismas llamadas al modelo.

Cuánto gastas

Cada respuesta de búsqueda trae un objeto usage con los tokens del modelo, las llamadas y el tiempo de ese pedido. GET /v1/usage devuelve tus totales de hoy y de los últimos 30 días, y tus límites.

En esta página