Costos y caché
Topes por pedido, y todo lo que abarata las búsquedas repetidas.
Topes
Pon max_tokens en un pedido (mínimo 2000) y nunca gastará más. El presupuesto se reserva antes de cada
llamada al modelo; cuando la siguiente no entra, la búsqueda se detiene y devuelve todo lo juzgado hasta
ahí con incomplete: true.
const res = await ts.search('el dólar', { mode: 'deep', max_tokens: 15_000 });
if (res.incomplete) {
console.log(`Se detuvo en ${res.budget?.used} de ${res.budget?.max_tokens} tokens`);
}Si el tope no alcanza ni para juzgar los titulares, el pedido falla con 402 budget_too_small antes de
gastar nada.
Lo que no pagas dos veces
- Caché de resultados. Un pedido idéntico dentro de los 10 minutos sale de la caché:
cached_atdice cuándo se calculó,usage.tokenses0y no se cobra. Ponfresh: truepara saltarla. - Memoria de juicios. Lo que el modelo dijo de un titular para una consulta se recuerda durante una semana, y el tono de cada nota también. Una búsqueda repetida sólo paga los titulares nuevos.
- Primero los filtros. Dominios, secciones y fechas se aplican antes de juzgar nada.
- Varias consultas juntas. Hasta cinco consultas en un pedido comparten las mismas llamadas al modelo.
Cuánto gastas
Cada respuesta de búsqueda trae un objeto usage con los tokens del modelo, las llamadas y el tiempo de
ese pedido. GET /v1/usage devuelve tus totales de hoy y de los últimos 30
días, y tus límites.