apisesdks
CONFIRMADO: OpenRouter lança Batch API e corta pela metade o preço de mais de 70 modelos
CONFIRMADO: a OpenRouter lançou em 22 de setembro sua Batch API, com desconto de 50% no preço por token de entrada e saída em mais de 70 modelos, para tarefas que não precisam de resposta imediata e são entregues em até 24 horas.

[{"h":"CONFIRMADO: processar em lote agora custa metade do preco na OpenRouter","p":"A OpenRouter, plataforma que agrega acesso a dezenas de modelos de IA por uma unica API e hoje controlada pela Stripe, lancou oficialmente em 22 de setembro sua Batch API. O recurso corta pela metade o preco por token, tanto de entrada quanto de saida, em mais de 70 modelos suportados, para tarefas que nao exigem resposta em tempo real."},{"h":"Como funciona o desconto","p":"A logica e simples: em vez de pagar o preco cheio para receber uma resposta imediata, o desenvolvedor envia um lote de requisicoes que sao processadas de forma assincrona, com garantia de entrega de todos os resultados em ate 24 horas. Em troca dessa espera, o preco por token cai pela metade tanto para o texto enviado quanto para o texto gerado pelo modelo."},{"h":"Os numeros do periodo de teste","p":"Durante duas semanas de teste antes do lancamento oficial, a plataforma processou mais de 230 mil tarefas em lote, com tempo mediano de conclusao de sete minutos e 90% das tarefas finalizadas em ate uma hora, bem abaixo do teto de 24 horas prometido. Isso indica que, na pratica, a maioria das tarefas volta rapido, e o prazo de um dia funciona mais como garantia de piso do que como tempo tipico de espera."},{"h":"Para que tipo de tarefa isso serve","p":"Processamento em lote e a escolha certa para trabalho que pode esperar minutos ou algumas horas: classificar uma base grande de mensagens de atendimento, gerar descricoes de produto em massa, resumir um volume grande de documentos ou rodar analise de sentimento sobre historico de conversas. Nao serve para chatbot respondendo cliente em tempo real, onde o usuario espera resposta imediata."},{"h":"Por que isso importa para quem opera com orcamento apertado","p":"Para uma pequena ou media empresa que usa IA em tarefas de bastidor, como organizar planilha, gerar conteudo em lote ou processar formularios, um corte de 50% no custo por token muda a conta de forma direta: o mesmo orcamento mensal passa a cobrir o dobro de volume, desde que a tarefa aceite nao ser instantanea. E um lembrete pratico de que otimizar custo de IA muitas vezes e menos sobre trocar de modelo e mais sobre escolher o modo de processamento certo para cada tarefa."},{"h":"A leitura do MaxAssistant","p":"O lancamento reforca uma tendencia que ja aparecia em outros provedores de IA: separar preco por urgencia, nao so por modelo. Vale mapear, dentro da propria operacao, quais tarefas de IA realmente precisam de resposta instantanea e quais poderiam rodar em lote durante a madrugada por metade do custo."},{"h":"Fontes","p":"OpenRouter, OpenRouter Batch API, half-price inference by bundling requests: https://openrouter.ai/blog/announcements/batch-api/ | PANews, AI model aggregation platform OpenRouter launches Batch API, token prices halved for most models: https://panews.io/articles/01a0cc16-5bb5-74e7-8803-5263c7a4fc27 | Phemex News, OpenRouter Batch API Launch, 50% Off Tokens for 70+ AI Models: https://phemex.com/news/article/openrouter-launches-batch-api-with-50-token-price-reduction-across-70-models-97535"}]