Un proyecto de integración de IA se plantea al revés de como se suele empezar: primero el caso de uso con dueño y medida, luego la arquitectura que decide por dónde viajan tus datos, y solo entonces el modelo. Lo acompañamos desde los servicios de integración de Codezone.
Lo que cuesta hoy no es el modelo, es el piloto que nadie usa: semanas de trabajo, una demo que gusta en comité y ningún proceso cambiado porque nadie respondía de los errores.
Al terminar sabrás qué elegir en cada capa y qué entra en el coste, sobre la recuperación de documentos internos y los agentes que ejecutan contra el ERP y el CRM.
Qué es un proyecto de integración de IA
Es conectar un modelo con los datos y los sistemas de la empresa para una tarea concreta, con tres decisiones: dónde se ejecuta la inferencia, qué datos salen de tu red y quién responde cuando la salida es incorrecta.
Por dónde empezar y qué caso elegir primero
El primer caso cumple cuatro condiciones: se repite muchas veces al mes, la respuesta se puede comprobar, alguien lo hace hoy y puede validar, y un error no llega al cliente sin pasar por una persona. Responder consultas internas de procedimiento cumple las cuatro; redactar ofertas que salen firmadas falla la última.
Escribe el proceso tal como funciona hoy, con el detalle de el mapeo del proceso antes de elegir herramienta. Si no cabe en una página, el problema no es de IA.
Las tres arquitecturas y qué implica cada una para tus datos
- API de proveedor: llamas a un modelo gestionado. Arranque rápido y coste por uso, pero cada consulta sale de tu red: mira región de proceso y retención en el contrato.
- Modelo alojado: lo despliegas en tu infraestructura. Los datos no salen del perímetro y controlas versiones, a cambio de operación propia y GPU que alguien mantenga.
- Mixta: la recuperación y el almacén se quedan dentro, y al proveedor solo viaja el fragmento recortado. Encaja en la mayoría de empresas.
La decisión se parece a la elección entre monolito modular y microservicios: lo que parece técnico fija el coste de operación años.
Dónde viajan los datos, qué pide el RGPD y qué hay que proteger
Si envías datos personales a un proveedor de modelos, ese proveedor es encargado del tratamiento y hace falta contrato. El RGPD es explícito: el encargado tratará los datos personales únicamente siguiendo instrucciones documentadas del responsable, según el artículo 28 del Reglamento General de Protección de Datos. Revisa subencargados, región y conservación. Su artículo 32 nombra la seudonimización y el cifrado: si la consulta no necesita el nombre del cliente, no lo mandes.
El inventario de riesgos técnicos es distinto al de una web. En su edición 2025, el top 10 de OWASP para aplicaciones con LLM encabeza la inyección de prompt y recoge la divulgación de información sensible, la agencia excesiva y las debilidades de vectores y embeddings. Los controles que más rinden: filtrar por permisos al recuperar, limitar lo que las herramientas escriben y poner cuota por usuario.
La estructura de coste y cómo se calcula el retorno
Cuatro partidas:
- Tokens: se factura por millón de tokens, con tarifa separada de entrada y de salida y distinta en cada modelo. La salida sale más cara, así que una respuesta larga pesa más de lo que parece.
- Almacenamiento vectorial: crece con el corpus y la dimensión del modelo, y se duplica si reindexas sin borrar.
- Infraestructura: aplicación, cola, almacén y observabilidad, más las GPU si el modelo es propio.
- Mantenimiento: el proveedor retira versiones y cambia comportamientos, así que hay revisión periódica, igual que en el coste de mantener un software a medida.
El retorno se mide contra el proceso actual: veces al mes, tiempo por vez y qué parte queda automatizada. Esa cuenta se sostiene con los rangos de cuánto cuesta automatizar con IA en Madrid.
CodeZone Pro Tip: estima el coste mensual en tokens antes de aprobar el caso, partiendo del volumen de consultas, el tamaño medio del contexto recuperado y la tarifa publicada del proveedor.
from dataclasses import dataclass
@dataclass
class Caso:
consultas_mes: int
tokens_pregunta: int # enunciado del usuario
tokens_contexto: int # fragmentos recuperados, la partida gorda
tokens_respuesta: int
precio_entrada: float # dolares por millon de tokens de entrada
precio_salida: float # dolares por millon de tokens de salida
reintentos: float = 1.15 # fallos y reformulaciones del usuario
def coste_mensual(c: Caso) -> dict:
entrada = (c.tokens_pregunta + c.tokens_contexto) * c.consultas_mes
salida = c.tokens_respuesta * c.consultas_mes
# El multiplicador evita la estimacion optimista: en produccion
# siempre hay consultas repetidas y respuestas descartadas.
coste_in = entrada / 1_000_000 * c.precio_entrada * c.reintentos
coste_out = salida / 1_000_000 * c.precio_salida * c.reintentos
# El contexto solo se factura como entrada, pero se compara contra
# el gasto total: la salida cuesta varias veces mas por token.
coste_contexto = (c.tokens_contexto * c.consultas_mes / 1_000_000
* c.precio_entrada * c.reintentos)
total = coste_in + coste_out
return {
"entrada_usd": round(coste_in, 2),
"salida_usd": round(coste_out, 2),
"total_usd": round(total, 2),
# Fraccion del gasto total que se va en fragmentos recuperados.
# Si pasa del 80%, recortar fragmentos rinde mas que cambiar modelo.
"peso_contexto": round(coste_contexto / total, 2),
}Esa función convierte la discusión sobre modelos en una cuenta. El dato que importa es `peso_contexto`: la parte del gasto total, entrada y salida incluidas, que se va en fragmentos recuperados. Cuando pasa del 80%, el ahorro está en recuperar menos; cuando se queda por debajo, mirar la tarifa del modelo o acortar la respuesta rinde más.
Lo que Decide si el Proyecto Sigue Vivo en Seis Meses
No es la calidad del modelo, es si alguien revisa las respuestas. Los que sobreviven tienen quien mira una muestra cada semana y un sitio donde se apuntan los fallos. Los demás se quedan sin dueño.
El segundo es el acoplamiento: si la aplicación llama al proveedor desde veinte sitios, cambiar de modelo es un proyecto; con una capa propia, un día. Plantéalo con el criterio de conectar los sistemas sin levantar nuevos silos y de una capa intermedia sobre los sistemas que ya tienes.
Elige un caso, ponle dueño y mide el proceso de hoy antes de tocar nada. Esa hoja decide arquitectura y presupuesto.
Si tienes un caso y no sabes qué arquitectura le toca, lo revisamos y te decimos qué montar.