Pay as you gain · riesgo cero

La misma IA.
Los mismos modelos.
Pagando mucho menos.

TokenomiCo se conecta entre tu app y la API que ya usas y comprime lo que se repite en cada llamada — historial, herramientas e instrucciones. En una sesión agéntica real de 20 turnos medimos 28% menos costo de input (y en un prompt único y corto somos honestos: no hay ahorro). Solo pagas el 40% de lo que ahorres: sin ahorro, factura cero. Sin mensualidad, sin contrato, sin cambiar una línea de código.

en vivo · un prompt real encogiéndose
tokens 31 misma respuesta, menor costo
AnthropicOpenAIGeminiGrokPerplexity DeepSeekMistralGroqKimiTogetherOpenRouter

el modelo

Pay as you gain: solo pagas cuando ganas.

No vendemos suscripciones, vendemos resultados. Medimos cada token que dejaste de gastar y repartimos la ganancia — la mayor parte queda contigo. Si un mes no hay ahorro, la factura es cero. No puedes salir perdiendo.

$0de mensualidad, cuota o mínimo. Crear la cuenta es gratis — para siempre.
$0de factura en meses sin ahorro. Nuestro incentivo es literalmente el tuyo.
0 atadurastu clave sigue siendo tuya (BYOK). Cancelar es revertir una base URL — sin multa.

cómo funciona

Ahorrando en 3 pasos

Sin migración, sin reescribir nada, sin cambiar de modelo. Si ya tienes una app con IA, conectas hoy.

1 — conecta en minutos

Cambia una URL, nada más

Apunta el SDK que ya usas al endpoint de TokenomiCo. Misma API, mismos modelos, mismo código. Tu clave del proveedor queda cifrada y bajo tu control.

2 — ahorra en automático

Cada petición sale más barata

Nuestra tecnología recorta tus prompts en tiempo real, preservando el sentido. Y si en alguna petición no hay ganancia, pasa intacta — nunca quedas peor.

3 — verifica y paga solo lo acordado

Transparencia total

Cada respuesta muestra cuánto ahorraste. A fin de mes, un comprobante detalla el ahorro — la factura es el 40% y el otro 60% se queda en tu caja.

benchmarks · medido, no estimado

Números de código ejecutándose, no de diapositivas.

Todos los números de compresión de abajo salieron del compilador ejecutándose de verdad (LuaJIT 2.1), deterministas y reproducibles. Y somos explícitos sobre qué es medición directa, qué es modelo calibrado y qué aún no medimos.

−43,1%de tokens por turno, promedio de 6 dominios reales
medición directa
−30,5% a −35,7%revalidado con un tokenizer BPE conservador — es el piso, no el techo
cross-check
−28,3%de costo de input en una sesión agéntica REAL de 20 turnos (Gemini en la nube, compresión + caché)
medición directa
1,66 mspor compilación (~600/s single-thread) — invisible frente a la red
medición directa

Compresión por dominio (medición directa)

dominiotokensreducción
Operaciones / incidentes106 → 56
−47,2%
Refactorización de código98 → 54
−44,9%
Auditoría jurídica (LGPD)117 → 66
−43,6%
Análisis de datos98 → 56
−42,9%
Pipeline CI/CD104 → 62
−40,4%
Recon de seguridad119 → 71
−40,3%
TOTAL642 → 365
−43,1%

Rango estrecho (40–47%) = robustez: ningún dominio "afortunado" inflando el promedio.

Loop agéntico: ¿y si γ es peor?

El factor de compresión del historial (γ) es el parámetro con más incertidumbre — por eso publicamos el rango completo, no solo el mejor caso:

γ (historial)ahorro @10 pasos@30 pasos
0,10 · agresivo 94,8%93,8%
0,20 91,2%88,0%
0,30 · base 87,7%82,1%
0,40 · conservador 84,1%76,3%

Incluso en el peor caso (γ=0,40), el ahorro en el loop queda por encima del 76%. @ $3/MTok, 30 pasos: $0,98 → $0,18.

Honestidad sobre el gap: el modelo del 82% asume compresión de historial con γ=0,30, que la versión actual del motor aún no alcanza en prosa densa — en la nube, contra Gemini real, medimos −28,3% de costo de input en 20 turnos (compresión + prefix cache; metodología y serie completa en el doc de benchmark). En un prompt único y corto no hay ahorro — y la factura es cero. Aún no medimos: el efecto de la compresión en la calidad de la respuesta por dominio.

haz las cuentas

¿Cuánto estás dejando sobre la mesa?

Mueve los controles con tus números y el recibo muestra, al instante, cuánto volvería a tu caja cada mes.

$2,000
30%

En nuestras pruebas, los prompts en lenguaje natural se reducen hasta un 30–40%. Sé conservador si quieres — incluso en el peor caso (0%) no pagas nada.

para desarrolladores

¿Se integra en una tarde? En un café.

Drop-in de verdad: una URL y un header. Controlas la compresión por petición y ves el ahorro en cada respuesta.

curl https://tokenomico.com/v1/anthropic/proxy \
  -H "authorization: Bearer tk_live_..." \
  -H "x-toke-compress: on"         # on|off por petición \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":300,
       "messages":[{"role":"user","content":"..."}]}'

# la respuesta incluye:
x-toke-compressed: true
x-toke-tokens-saved-est: 1284

Streaming medido

Las respuestas stream:true pasan byte a byte, con usage real capturado del SSE para el billing.

Solo APIs/REST

Proxy para endpoints de API de los proveedores. Nada de suscripciones ni apps de chat de terceros.

Comprobante auditable

PoC mensual con peticiones, tokens originales vs. enviados y el ahorro en dólares.

sin letra pequeña

Preguntas directas, respuestas directas

¿La compresión puede cambiar el resultado del modelo?

En tareas muy sensibles a la forma exacta del texto, puede. Por eso es opcional por petición (header x-toke-compress): actívala en cargas tolerantes (clasificación, RAG, contexto largo) y desactívala en extracción/JSON y en las críticas. Los prompts cortos y el contenido estructurado pasan sin comprimir automáticamente. Y cuando no hay ganancia real, se envía el texto original — nunca quedas peor que antes.

¿Y si un mes no ahorro nada?

Factura cero. El modelo es el 40% del ahorro medido, no de tu uso.

¿Ven mis prompts?

El proxy procesa el texto en tránsito para comprimirlo (TLS de entrada y salida) y no almacena prompts ni respuestas — solo métricas de tokens. Un matiz, por transparencia: la reescritura comprimida de pasajes recurrentes (nunca el original) puede retenerse hasta 7 días para acelerar los turnos siguientes. Tu clave BYOK queda cifrada en reposo (AES-256-GCM).

¿Cómo es el cobro?

Mensual: la factura cierra el día 15 y llega por e-mail con el comprobante (PoC) y el link de pago (Stripe). Tolerancia hasta el día 18; después el proxy se suspende (HTTP 402) hasta regularizar — pagas y vuelves al instante. Las cuentas nuevas tienen carencia: la primera factura llega solo en el ciclo del mes siguiente al registro. Tus datos y claves siguen siendo tuyos.

¿Qué proveedores?

Anthropic, OpenAI, Gemini, Grok (xAI), Perplexity, DeepSeek, Mistral, Groq, Kimi (Moonshot), Together AI y OpenRouter — la misma clave TokenomiCo para todos.

empieza ahora — sin tarjeta

Si no ahorras, no pagas.
Así de simple.

Crea tu cuenta gratis, conecta tu clave y mira tu primer comprobante de ahorro hoy mismo. El único escenario en el que pagas es aquel en el que ya ganaste más.