Costos reales

Cuánto cuesta de verdad correr un setter de IA.

Nadie publica este número, así que lo medimos nosotros. Escribimos la misma conversación a mano contra seis modelos, contamos cada token, y después dejamos el ganador doce días en producción para comprobar que el número aguantaba. Todo lo que sigue sale de esas dos mediciones, no de la lista de precios de nadie.

Movés los dos números que dependen de tu negocio.

Cuántos leads te entran por mes, y cuántos mensajes dura una conversación promedio. El resto es aritmética sobre el precio por mensaje que medimos.

3.000conversaciones nuevas

La cuenta de Lautaro recibe alrededor de 5.100 por mes. La de Noelia, 1.200.

3,6promedio del total

Promedio real de producción: 3,6. La mayoría se cae temprano. Las que llegan a agendar duran entre 8 y 10.

3,0por ciento

Sirve para leer la última columna. Lautaro corre a 5,2% en agosto.

ModeloPor leadPor mesLatencia

Cómo se midió, para que puedas discutirlo.

27 y 28 de julio de 2026. Un clon de pruebas del setter de Noelia Paz, la misma persona escribiendo el mismo caso contra los seis modelos, y las seis conversaciones cerradas en el link de Calendly. 56 mensajes en total, USD 1,4918 de gasto real. El costo por turno salió del usage.cost que devuelve cada llamada, no de una estimación.

Por qué la brecha no es de 10x

Por OpenRouter no hay descuento de caché de prompt: se paga el system prompt de 38 a 41 mil tokens a precio pleno en cada turno. Claude, en cambio, cacheó el 91,6%. Esa asimetría comprime la diferencia real a un rango de 1,05x a 5,7x, y es la razón por la que qwen3-max termina saliendo más caro por mensaje que Sonnet.

El ahorro está subestimado, no inflado

La medición se hizo tipeando seguido, con el caché de Claude caliente. En producción el lead contesta a las horas, y el caché de Anthropic expira a los cinco minutos: cada turno vuelve a pagar el system prompt a precio de escritura de caché, que es más caro que el input fresco. El costo real de Claude en producción es mayor al que figura acá.

Barato no compró peor conversión

Contra 30 conversaciones adversariales, con cinco perfiles distintos de lead difícil, ningún modelo superó 0,35 sobre 1,00. Sonnet incluido. Como el techo es el mismo para los seis, el cuello de botella no es el modelo: es el guion del prompt. Migrar para ahorrar no degrada lo que la cuenta ya convierte.

Lo que descartamos y por qué

DeepSeek es el más barato de los seis y aun así no está en producción: en una de las pruebas afirmó haber mandado un audio que nunca mandó. GLM 4.7 quedó afuera por latencia, con un turno que tardó 815 segundos porque razonó 38.913 tokens para escribir 3.591 caracteres. En un DM eso no existe.

Y después, doce días en producción.

Del 4 al 15 de agosto de 2026, MiniMax M2 corriendo el setter real de Noelia Paz. Fuente única: su propia base de Supabase, cruzada contra las facturas de OpenRouter. Consumido USD 52,17 contra USD 55,00 comprados.

52,17 Dólares de gasto total en el período, sobre 4.393 llamadas al modelo
0,0119 Dólares por llamada. La prueba de julio había estimado 0,0114: se desvió un 4%
2,37 Dólares por agenda de Calendly, sobre 1.214 conversaciones y 22 agendas
91 Dólares por mes de run-rate según la última semana medida

Reporte interno del 15 de agosto de 2026 · Supabase dedicado de Noelia, tablas llm_usage y conversation · reconciliado contra siete facturas de OpenRouter del 3 al 13 de agosto

Este número no es el que te cobramos.

Es lo que cuesta la parte de mensajes. Arriba de eso van la implementación y el fee mensual, que no dependen de tu volumen ni suben cuando vendés más. Si querés el número completo para tu caso, lo armamos en la llamada.

Agendar demo