Cuánto cuesta un agente de IA para una PYME (texto y voz)
El consumo de un agente de IA cuesta céntimos: los modelos se pagan por tokens (desde unos 0,05 $ por millón en los ligeros) y, si el agente atiende llamadas, la suma de telefonía, transcripción y voz sintética ronda los 0,05–0,15 $ por minuto. La inversión real es la implantación: de unos cientos de euros por un agente sencillo a varios miles por un sistema completo.
Un agente de IA no es un producto de estantería con un precio en la etiqueta: es un sistema que se monta sobre tu negocio. Aun así, sus costes se pueden desglosar con precisión, porque casi todos son precios públicos por uso. En este artículo los recojo verificados a fecha de julio de 2026, con su fuente, separando el agente de texto del de voz —que añade una capa propia por minuto de llamada— y terminando con lo que de verdad decide el presupuesto: qué encarece y qué abarata un proyecto.
¿De qué depende el precio de un agente de IA?
Cuatro variables explican casi toda la diferencia entre un proyecto de cientos de euros y uno de varios miles:
- El canal. Texto (WhatsApp, web) es más barato que voz, porque la voz añade telefonía, transcripción y síntesis por minuto.
- Las integraciones. Responder FAQ es una cosa; consultar tu CRM, agendar en tu calendario y crear pedidos en tu ERP es otra.
- El conocimiento. Un agente útil responde con tus datos (catálogo, tarifas, procedimientos). Prepararlos y conectarlos con técnicas como RAG es parte del trabajo.
- El volumen. Los costes por uso (tokens, minutos) escalan con las conversaciones. Para una PYME suelen ser decenas de euros al mes, no cientos.
¿Cuánto cuesta un agente de texto (WhatsApp o web)?
El agente de texto tiene tres costes de consumo, todos pequeños. A fecha de julio de 2026, según las páginas oficiales de precios de cada proveedor:
- El modelo de IA. Los modelos ligeros de OpenAI parten de 0,05–0,20 $ por millón de tokens de entrada; Claude Haiku 4.5 de Anthropic cuesta 1 $/5 $ por millón (entrada/salida) y Claude Sonnet 3 $/15 $. Una conversación típica cuesta una fracción de céntimo.
- El canal. En WhatsApp, el acceso a la API oficial de Meta es gratuito y responder dentro de la ventana de 24 horas no cuesta nada; solo se pagan plantillas salientes. En web, el widget de chat no tiene coste por mensaje.
- La plataforma. n8n: de 0 € (self-hosted) a 20–50 €/mes en la nube según plan, de acuerdo con su página oficial de precios.
Tienes el desglose completo del canal WhatsApp —categorías de mensaje, ventanas gratuitas, BSPs— en cuánto cuesta un chatbot de WhatsApp en España, y el panorama general de herramienta e implantación en cuánto cuesta automatizar una PYME.
¿Cuánto cuesta la capa de voz?
Un agente de voz encadena cuatro servicios en tiempo real: la llamada entra por telefonía, se transcribe a texto (STT), el modelo decide la respuesta y una voz sintética (TTS) la pronuncia. Cada pieza tiene precio público por minuto o por volumen. A fecha de julio de 2026:
- Telefonía (Twilio, tarifas para España). Llamadas salientes a fijo desde 0,0178 $/min y a móvil desde 0,0486 $/min; recepción por SIP o navegador desde 0,004 $/min, y número virtual desde 1,15 $/mes, según su página oficial de precios para España.
- Transcripción — STT (OpenAI). gpt-4o-transcribe cuesta 0,006 $/min y su versión mini 0,003 $/min, según la página oficial de precios de la API de OpenAI.
- Voz sintética — TTS. OpenAI cobra 15 $ por millón de caracteres (unos 0,013 $ por minuto hablado); ElevenLabs, referencia en naturalidad y voces en español, funciona por suscripción: desde 6 $/mes el plan Starter y 22 $/mes el Creator, según su página de precios.
- El modelo de IA. Igual que en texto: céntimos por conversación con modelos ligeros.
Sumando las piezas, el coste de consumo de un minuto de llamada atendida por IA se mueve en torno a 0,05–0,15 $ según proveedores y calidad de voz elegida. Puesto en contexto: una llamada de tres minutos cuesta menos que enviar una carta ordinaria, y el agente contesta al primer tono, a las 22:00 y en agosto. La comparación con una centralita tradicional la desarrollo en agente de voz con IA vs centralita (IVR).
¿Qué encarece un agente de IA?
- Integraciones con sistemas antiguos o sin API: conectar un ERP de hace 15 años cuesta más que el agente entero.
- Información desordenada: si tus tarifas viven en la cabeza del gerente y en tres Excels contradictorios, primero hay que ordenarlas.
- Casos sensibles: pagos, reclamaciones o temas legales exigen más controles, supervisión y pruebas.
- Voz premium multiidioma: voces clonadas o de máxima naturalidad en varios idiomas elevan el coste por minuto.
- Volumen alto con modelos tope de gama: si cada conversación requiere el modelo más potente, el consumo mensual se nota.
Hay un sobrecoste que sí recomiendo pagar siempre: la fiabilidad. En mis agentes en producción, la salida del LLM pasa por un parser de salida estructurada con esquema estricto —o devuelve un JSON válido con los campos exactos, o no pasa— y detrás hay un modelo de fallback que entra automáticamente si el principal falla o se satura. Y antes de que el mensaje llegue siquiera al modelo, validaciones deterministas en código descartan spam, normalizan teléfonos y filtran lo que no toca procesar. Es más trabajo de implantación, pero es la diferencia entre una demo bonita y un sistema que lleva meses funcionando solo.
¿Qué lo abarata?
- Empezar por un solo caso de uso bien elegido (el proceso que más tiempo os roba) y ampliar por fases.
- Tener la información ordenada: FAQ escritas, tarifas claras, procedimientos documentados.
- n8n self-hosted y herramientas open source como Chatwoot: 0 € de licencias.
- Usar modelos ligeros para lo simple y reservar los potentes para los pasos que de verdad razonan.
- Reutilizar la infraestructura: el segundo agente sobre el mismo n8n cuesta mucho menos que el primero.
¿Cuánto cuesta implantarlo y mantenerlo?
La implantación es donde va la inversión, y depende del alcance. Como horquilla honesta de mercado: un agente de texto sencillo con base de conocimiento se mueve en unos cientos de euros; un agente con varias integraciones (CRM, calendario, catálogo) o con capa de voz, entre unos cientos y pocos miles; y un sistema multi-agente completo, varios miles construidos por fases. No los cifro más porque sería mentirte: el presupuesto serio sale de analizar tu caso, y eso es exactamente lo que hago en la consultoría gratuita de 30 minutos.
El mantenimiento —ajustar el agente con conversaciones reales, actualizar tu información, vigilar integraciones— se pacta como cuota mensual pequeña respecto a la implantación o como bolsa de horas. Y los consumos ya los conoces: decenas de euros al mes en la mayoría de PYMES.
¿Qué devuelve la inversión? Casos reales
- SEAG. Un ecosistema de 26 workflows con agentes de chat web y WhatsApp: respuesta de 24–48 horas a menos de 2 minutos, unas 30 horas semanales liberadas y procesamiento de documentos un 90% más rápido.
- Alzicasa. Agente que captura leads de portales inmobiliarios, los cualifica conversando por WhatsApp y los entrega al comercial: más de 500 leads cualificados en la primera semana, respondidos en menos de un minuto.
- Barcino Imprenta. Agente que configura productos de imprenta a medida, da precio y pasa el pedido al taller: toma de pedidos 24/7 sin intervención manual en el alta.
La cuenta es sencilla: multiplica las horas que tu equipo dedica a tareas repetitivas por lo que cuesta esa hora, y compáralo con una inversión que en consumo se mide en céntimos. Si tu canal es WhatsApp, empieza por la página de agentes de IA para WhatsApp; si son llamadas, por la de agentes de voz; y si quieres el mapa completo de procesos, por automatización con n8n.
¿Quieres un presupuesto a medida, sin humo?
Cuéntame qué quieres que haga el agente —texto, voz o ambos— y en 30 minutos te digo qué costaría en tu caso, por fases y con los consumos claros. Sin compromiso.