Cerebro de IA holográfico en un centro de datos con vistas al skyline de Madrid y las Cuatro Torres
IA & FuturoSoftware / APIs

Integración de IA en Madrid: Guía de Proyecto

Codezone
Codezone Empresa de Desarrollo Web y Software a Medida

Un proyecto de integración de IA se plantea al revés de como se suele empezar: primero el caso de uso con dueño y medida, luego la arquitectura que decide por dónde viajan tus datos, y solo entonces el modelo. Lo acompañamos desde los servicios de integración de Codezone.

Lo que cuesta hoy no es el modelo, es el piloto que nadie usa: semanas de trabajo, una demo que gusta en comité y ningún proceso cambiado porque nadie respondía de los errores.

Al terminar sabrás qué elegir en cada capa y qué entra en el coste, sobre la recuperación de documentos internos y los agentes que ejecutan contra el ERP y el CRM.

Qué es un proyecto de integración de IA

Es conectar un modelo con los datos y los sistemas de la empresa para una tarea concreta, con tres decisiones: dónde se ejecuta la inferencia, qué datos salen de tu red y quién responde cuando la salida es incorrecta.

Por dónde empezar y qué caso elegir primero

El primer caso cumple cuatro condiciones: se repite muchas veces al mes, la respuesta se puede comprobar, alguien lo hace hoy y puede validar, y un error no llega al cliente sin pasar por una persona. Responder consultas internas de procedimiento cumple las cuatro; redactar ofertas que salen firmadas falla la última.

Escribe el proceso tal como funciona hoy, con el detalle de el mapeo del proceso antes de elegir herramienta. Si no cabe en una página, el problema no es de IA.

Tres puertas holográficas en una sala oscura con la central iluminada y marcada como objetivo
El primer caso se elige por comprobable, no por vistoso.

Las tres arquitecturas y qué implica cada una para tus datos

  • API de proveedor: llamas a un modelo gestionado. Arranque rápido y coste por uso, pero cada consulta sale de tu red: mira región de proceso y retención en el contrato.
  • Modelo alojado: lo despliegas en tu infraestructura. Los datos no salen del perímetro y controlas versiones, a cambio de operación propia y GPU que alguien mantenga.
  • Mixta: la recuperación y el almacén se quedan dentro, y al proveedor solo viaja el fragmento recortado. Encaja en la mayoría de empresas.

La decisión se parece a la elección entre monolito modular y microservicios: lo que parece técnico fija el coste de operación años.

Dónde viajan los datos, qué pide el RGPD y qué hay que proteger

Si envías datos personales a un proveedor de modelos, ese proveedor es encargado del tratamiento y hace falta contrato. El RGPD es explícito: el encargado tratará los datos personales únicamente siguiendo instrucciones documentadas del responsable, según el artículo 28 del Reglamento General de Protección de Datos. Revisa subencargados, región y conservación. Su artículo 32 nombra la seudonimización y el cifrado: si la consulta no necesita el nombre del cliente, no lo mandes.

El inventario de riesgos técnicos es distinto al de una web. En su edición 2025, el top 10 de OWASP para aplicaciones con LLM encabeza la inyección de prompt y recoge la divulgación de información sensible, la agencia excesiva y las debilidades de vectores y embeddings. Los controles que más rinden: filtrar por permisos al recuperar, limitar lo que las herramientas escriben y poner cuota por usuario.

Núcleo de IA holográfico dentro de una cúpula protectora donde chocan y se rompen partículas rojas maliciosas
Los riesgos de estas aplicaciones no son los de una web.

La estructura de coste y cómo se calcula el retorno

Cuatro partidas:

  • Tokens: se factura por millón de tokens, con tarifa separada de entrada y de salida y distinta en cada modelo. La salida sale más cara, así que una respuesta larga pesa más de lo que parece.
  • Almacenamiento vectorial: crece con el corpus y la dimensión del modelo, y se duplica si reindexas sin borrar.
  • Infraestructura: aplicación, cola, almacén y observabilidad, más las GPU si el modelo es propio.
  • Mantenimiento: el proveedor retira versiones y cambia comportamientos, así que hay revisión periódica, igual que en el coste de mantener un software a medida.

El retorno se mide contra el proceso actual: veces al mes, tiempo por vez y qué parte queda automatizada. Esa cuenta se sostiene con los rangos de cuánto cuesta automatizar con IA en Madrid.

CodeZone Pro Tip: estima el coste mensual en tokens antes de aprobar el caso, partiendo del volumen de consultas, el tamaño medio del contexto recuperado y la tarifa publicada del proveedor.
from dataclasses import dataclass

@dataclass
class Caso:
    consultas_mes: int
    tokens_pregunta: int        # enunciado del usuario
    tokens_contexto: int        # fragmentos recuperados, la partida gorda
    tokens_respuesta: int
    precio_entrada: float       # dolares por millon de tokens de entrada
    precio_salida: float        # dolares por millon de tokens de salida
    reintentos: float = 1.15    # fallos y reformulaciones del usuario

def coste_mensual(c: Caso) -> dict:
    entrada = (c.tokens_pregunta + c.tokens_contexto) * c.consultas_mes
    salida = c.tokens_respuesta * c.consultas_mes
    # El multiplicador evita la estimacion optimista: en produccion
    # siempre hay consultas repetidas y respuestas descartadas.
    coste_in = entrada / 1_000_000 * c.precio_entrada * c.reintentos
    coste_out = salida / 1_000_000 * c.precio_salida * c.reintentos
    # El contexto solo se factura como entrada, pero se compara contra
    # el gasto total: la salida cuesta varias veces mas por token.
    coste_contexto = (c.tokens_contexto * c.consultas_mes / 1_000_000
                      * c.precio_entrada * c.reintentos)
    total = coste_in + coste_out
    return {
        "entrada_usd": round(coste_in, 2),
        "salida_usd": round(coste_out, 2),
        "total_usd": round(total, 2),
        # Fraccion del gasto total que se va en fragmentos recuperados.
        # Si pasa del 80%, recortar fragmentos rinde mas que cambiar modelo.
        "peso_contexto": round(coste_contexto / total, 2),
    }

Esa función convierte la discusión sobre modelos en una cuenta. El dato que importa es `peso_contexto`: la parte del gasto total, entrada y salida incluidas, que se va en fragmentos recuperados. Cuando pasa del 80%, el ahorro está en recuperar menos; cuando se queda por debajo, mirar la tarifa del modelo o acortar la respuesta rinde más.

Río de monedas y cubos luminosos que fluye hacia un núcleo de IA rodeado de pilas de distinta altura
El contexto recuperado suele pesar más que el modelo.

Lo que Decide si el Proyecto Sigue Vivo en Seis Meses

No es la calidad del modelo, es si alguien revisa las respuestas. Los que sobreviven tienen quien mira una muestra cada semana y un sitio donde se apuntan los fallos. Los demás se quedan sin dueño.

El segundo es el acoplamiento: si la aplicación llama al proveedor desde veinte sitios, cambiar de modelo es un proyecto; con una capa propia, un día. Plantéalo con el criterio de conectar los sistemas sin levantar nuevos silos y de una capa intermedia sobre los sistemas que ya tienes.

Lupa holográfica sobre una cuadrícula de tarjetas de respuesta con una resaltada en dorado
Sin alguien que revise la muestra, el proyecto se apaga.

Elige un caso, ponle dueño y mide el proceso de hoy antes de tocar nada. Esa hoja decide arquitectura y presupuesto.

Si tienes un caso y no sabes qué arquitectura le toca, lo revisamos y te decimos qué montar.