Pay as you gain · risco zero

A mesma IA.
Os mesmos modelos.
Pagando bem menos.

O TokenomiCo se conecta entre o seu app e a API que você já usa e comprime o que se repete a cada chamada — histórico, ferramentas e instruções. Em sessão agêntica real de 20 turnos, medimos 28% menos custo de input (e em prompt único e curto somos honestos: não há economia). Você só paga 40% do que economizar: sem economia, fatura zero. Sem mensalidade, sem contrato, sem trocar uma linha de código.

ao vivo · um prompt real encolhendo
tokens 33 mesma resposta, menos custo
AnthropicOpenAIGeminiGrokPerplexity DeepSeekMistralGroqKimiTogetherOpenRouter

o modelo

Pay as you gain: você só paga quando ganha.

Não vendemos assinatura, vendemos resultado. Medimos cada token que você deixou de gastar e dividimos o ganho — a maior parte fica com você. Se num mês não houver economia, a fatura é zero. Não dá para sair perdendo.

$0de mensalidade, franquia ou mínimo. Criar conta é grátis — para sempre.
$0de fatura em mês sem economia. Nosso incentivo é literalmente o seu.
0 amarrassua chave continua sua (BYOK). Cancelar é voltar a base URL — sem multa.

como funciona

Economizando em 3 passos

Sem migração, sem reescrever nada, sem trocar de modelo. Quem já tem um app com IA conecta hoje.

1 — conecte em minutos

Troque uma URL, mais nada

Aponte o SDK que você já usa para o endpoint do TokenomiCo. Mesma API, mesmos modelos, mesmo código. Sua chave do provedor fica cifrada e sob seu controle.

2 — economize no automático

Cada requisição sai mais barata

Nossa tecnologia enxuga seus prompts em tempo real, preservando o sentido. E se em alguma requisição não houver ganho, ela passa intacta — você nunca fica pior.

3 — confira e pague só o combinado

Transparência total

Cada resposta mostra quanto você poupou. No fim do mês, um comprovante detalha a economia — a fatura é 40% dela, e os outros 60% ficam no seu caixa.

benchmarks · medido, não estimado

Números de código rodando, não de slide.

Todos os números de compressão abaixo saíram do compilador executando de verdade (LuaJIT 2.1), determinísticos e reproduzíveis. E somos explícitos sobre o que é medição direta, o que é modelo calibrado e o que ainda não medimos.

−43,1%de tokens por turno, média de 6 domínios reais
medição direta
−30,5% a −35,7%revalidado com tokenizer BPE conservador — é o piso, não o teto
cross-check
−28,3%de custo de input em sessão agêntica REAL de 20 turnos (Gemini na nuvem, compressão + cache)
medição direta
1,66 mspor compilação (~600/s em single-thread) — invisível frente à rede
medição direta

Compressão por domínio (medição direta)

domíniotokensredução
Operação / incidente106 → 56
−47,2%
Refatoração de código98 → 54
−44,9%
Auditoria jurídica (LGPD)117 → 66
−43,6%
Análise de dados98 → 56
−42,9%
Pipeline CI/CD104 → 62
−40,4%
Recon de segurança119 → 71
−40,3%
TOTAL642 → 365
−43,1%

Faixa estreita (40–47%) = robustez: nenhum domínio "sortudo" puxando a média.

Loop agêntico: e se o γ for pior?

O fator de compressão de histórico (γ) é o parâmetro com mais incerteza — então publicamos a faixa inteira, não só o melhor caso:

γ (histórico)economia @10 passos@30 passos
0,10 · agressivo 94,8%93,8%
0,20 91,2%88,0%
0,30 · base 87,7%82,1%
0,40 · conservador 84,1%76,3%

Mesmo no pior cenário (γ=0,40), a economia no loop fica acima de 76%. @ $3/MTok, 30 passos: $0,98 → $0,18.

Honestidade sobre o gap: o modelo de 82% pressupõe compressão de histórico com γ=0,30, que a versão atual do motor ainda não atinge em prosa densa — na nuvem, contra o Gemini real, medimos −28,3% de custo de input em 20 turnos (compressão + prefix-cache, metodologia e série completa no doc de benchmark). Em prompt único e curto não há economia — e a fatura é zero. O que ainda não medimos: o efeito da compressão na qualidade da resposta por domínio.

faça as contas

Quanto você está deixando na mesa?

Arraste os controles com os seus números e o recibo mostra, na hora, quanto voltaria para o seu caixa todo mês.

$2,000
30%

Nos nossos testes, prompts em linguagem natural reduzem até 30–40%. Seja conservador se quiser — até no pior cenário (0%) você não paga nada.

para desenvolvedores

Integra em uma tarde? Integra em um café.

Drop-in de verdade: uma URL e um header. Você controla a compressão por requisição e vê a economia em cada resposta.

curl https://tokenomico.com/v1/anthropic/proxy \
  -H "authorization: Bearer tk_live_..." \
  -H "x-toke-compress: on"         # on|off por requisição \
  -H "content-type: application/json" \
  -d '{"model":"claude-sonnet-5","max_tokens":300,
       "messages":[{"role":"user","content":"..."}]}'

# resposta inclui:
x-toke-compressed: true
x-toke-tokens-saved-est: 1284

Streaming medido

Respostas stream:true passam byte a byte, com usage real capturado do SSE para o billing.

Só APIs/REST

Proxy para endpoints de API dos provedores. Nada de assinaturas ou apps de chat de terceiros.

Comprovante auditável

PoC mensal com requisições, tokens originais vs. enviados e a economia em dólar.

sem letra miúda

Perguntas diretas, respostas diretas

A compressão pode mudar o resultado do modelo?

Em tarefas muito sensíveis à forma exata do texto, pode. Por isso ela é opcional por requisição (header x-toke-compress): ligue nas cargas tolerantes (classificação, RAG, contexto longo) e desligue em extração/JSON e nas críticas. Prompts curtos e conteúdo estruturado passam sem compressão automaticamente. E quando não há ganho real, o texto original é enviado — você nunca fica pior do que estava.

E se um mês eu não economizar nada?

Fatura zero. O modelo é 40% da economia medida, não do seu uso.

Vocês veem meus prompts?

O proxy processa o texto em trânsito para comprimir (TLS na entrada e na saída) e não armazena os prompts nem as respostas — só métricas de tokens. Única nuance, por transparência: a reescrita comprimida de trechos recorrentes (nunca o original) pode ficar retida por até 7 dias para acelerar os turnos seguintes. Sua chave BYOK fica cifrada em repouso (AES-256-GCM).

Como é a cobrança?

Mensal: a fatura fecha todo dia 15 e chega por e-mail com o comprovante (PoC) e o link de pagamento (Stripe). Tolerância até o dia 18; depois o proxy é suspenso (HTTP 402) até quitar — pagou, religou na hora. Contas novas têm carência: a primeira fatura vem só no ciclo do mês seguinte ao cadastro. Seus dados e chaves continuam seus.

Quais provedores?

Anthropic, OpenAI, Gemini, Grok (xAI), Perplexity, DeepSeek, Mistral, Groq, Kimi (Moonshot), Together AI e OpenRouter — mesma chave TokenomiCo para todos.

comece agora — sem cartão

Se não economizar, não paga.
Simples assim.

Crie sua conta grátis, conecte sua chave e veja o primeiro comprovante de economia ainda hoje. O único cenário em que você paga é aquele em que já ganhou mais.