Caso real · Utilities · 2024–2025

Utility Norte. 46 agentes en planta. Y una factura de LLM que crecía cada mes.

Cómo un registro de agentes + automatizaciones + copilot MLOps redujeron un 41% el gasto en LLM y convirtieron las alertas de operaciones en tickets accionables.

MLOpsRegistro de agentesAutomatización

17 plantas

Operación distribuida

generación + distribución

46

Agentes / APIs / MCP en producción

sin inventario común

€ ??

Coste mensual de LLM

creciente, sin desglose por planta

Lo que dijo el CTO

"La factura de OpenAI ha crecido un 60% en 4 meses. Necesito entender por qué."

"Cada planta había desplegado 'su' agente. Nadie tenía la vista completa. Y las alertas de operación se perdían en emails."

El equipo de operaciones había desplegado agentes de mantenimiento predictivo, chatbots de planta, MCP servers para SCADA y APIs internas. Cada uno con su modelo, su prompt y su presupuesto — sin gobernanza común. El coste subía y las alertas críticas no llegaban a tiempo.

Lo que encontramos en varios lugares

3 incoherencias que revelaban el problema real

#1

El mismo tipo de agente desplegado 4 veces con 4 modelos distintos.

Reconstruimos el uso real de LLM por caso. Encontramos duplicidades caras.

agent_registry · reconstrucción a mano
Caso de usoPlantaModeloCoste €/1k callsDueño
Predictive maintNorte-1GPT-4o€8,20Ing. planta
Predictive maintNorte-2GPT-4o€8,20IT industrial
Predictive maintSur-3GPT-4-turbo€5,10OT Sur
Predictive maintLevante-1Gemini 1.5 Flash€0,40Innovación

4 plantas · mismo caso de uso · x20 de diferencia de coste sin diferencia de calidad medida.

#2

Las alertas críticas viven en emails.

Simulamos un drift en un modelo de predicción de fallo. Seguimos el rastro real de la alerta.

alert_flow · drift en predictive maint
  • 1 · Modelo dispara alertaLog interno de la planta
  • 2 · Email al ingeniero de guardiaA las 03:14 · sin ack
  • 3 · Copia al buzón compartidoNadie lo ve hasta las 09:00
  • 4 · EscaladoManual · si el ingeniero lo recuerda
  • 5 · Ticket ServiceNowAbierto 6h después
  • 6 · ResoluciónSin recomendación técnica · investigación desde cero

Alerta → email → ticket: 6 horas de latencia · 0 recomendación adjunta.

#3

Los MCP servers acceden a SCADA sin auditoría.

Los agentes IA leen y escriben en sistemas OT vía MCP. Pedimos el log de acciones. No existía.

mcp_actions · sistemas OT · abril 2024
MCP serverAcciones/díaAuditoríaAutorizaciónOwner
scada-read12.400NoCert. mutuoOT Norte
scada-write180NoAPI key compartida
mes-inventory4.200ParcialOAuthIT industrial
ml-features9.800NoAPI keyData platform

180 acciones de escritura/día en SCADA · 0 log · 0 aprobador · alto riesgo bajo DORA/NIS2.

El giro

"No es que gasteis mucho en LLM. Es que no sabéis qué agentes tenéis ni qué están tocando en la planta."

Propuesta: registro único de agentes/APIs/MCP, automatizaciones alerta→ticket, y 4 copilots que sostienen el gobierno operacional.

Estrategia + diseño (Var Group Industry Practice) + Aura Sentinel + copilots MLOps y Risk conectados a operaciones — con auditoría de acciones OT lista para DORA y NIS2.

Estrategia Var GroupDiseño de la soluciónPlataforma Aura Sentinel4 copilots operativos

Los 4 copilots que resuelven el problema

Un equipo multi-agente, un solo Audit Center

Compliance Copilot

Gemini 2.5 Pro · RAG AI Act + DORA + NIS2

Clasifica los agentes que tocan sistemas industriales críticos y exige controles.

Resuelve · Hallazgo #3

MCP servers escribiendo en SCADA sin auditoría ni aprobador.

Etiqueta cada agente por criticidad OT/IT. Los que tocan sistemas esenciales quedan como 'alto riesgo · esencial' y requieren auditoría de acciones, aprobador nombrado y plan de continuidad.

  1. 01
    Clasificación críticaEsencial / importante / auxiliar · según sistema tocado.
  2. 02
    Controles obligatoriosAuditoría, aprobador, rate limit y kill-switch.
  3. 03
    Evidencia NIS2/DORALigada al inventario · lista para revisión.
  4. 04
    Ticket de gapCada control ausente abre ticket asignado al owner.

Risk Copilot

Claude Sonnet 4 · reglas OT + LLM

Convierte alertas de drift, latencia y coste en incidentes accionables con contexto operativo.

Resuelve · Hallazgo #2

Alertas críticas perdidas en emails con 6h de latencia.

Correlaciona la alerta con el histórico de la planta, el mantenimiento previo y el impacto estimado. Abre ticket con severidad, recomendación y escalado si no hay ack en X minutos.

  1. 01
    Alerta enriquecidaCon planta, activo, histórico y contexto operativo.
  2. 02
    Ticket auto ServiceNowSeveridad + recomendación + rutina sugerida.
  3. 03
    Escalado por tiempoSi no hay ack en 15min pasa al siguiente.
  4. 04
    Post-mortem asistidoTimeline + recomendación de cambio permanente.

MLOps Sentinel

GPT-4o · Isolation Forest + optimizador

Consolida modelos duplicados, propone alternativas más baratas y vigila SLA por planta.

Resuelve · Hallazgo #1

4 plantas usando GPT-4o para el mismo caso con x20 de coste.

Detecta agentes redundantes, ejecuta benchmark A/B contra modelos alternativos y propone consolidación con impacto estimado en calidad y coste. Las decisiones quedan firmadas.

  1. 01
    Detector de duplicidadesMismos prompts + mismo dataset → candidato a consolidar.
  2. 02
    Bench A/B3 modelos alternativos con métricas de calidad y coste.
  3. 03
    Recomendación firmada'Cambiar GPT-4o → Gemini Flash · -95% coste · +0.2pp F1'.
  4. 04
    SLA por agenteLatencia p95 y disponibilidad por planta.

Audit Orchestrator

Gemini 2.5 Flash · plantillas DORA/NIS2

Prepara el registro auditable de acciones OT y el reporte a la autoridad competente.

Resuelve · Hallazgo #3

0 log de acciones de escritura en SCADA.

Recoge cada acción de MCP hacia OT, su autorización, el agente que la ejecutó y el aprobador. Compone el reporte periódico requerido por DORA y NIS2.

  1. 01
    Registro MCP → OTFirma cada acción con hash, agente y aprobador.
  2. 02
    Kill-switch trazableUn botón para congelar toda escritura + evidencia.
  3. 03
    Reporte NIS2/DORAPeriódico y on demand · listo para autoridad.
  4. 04
    Simulacro anualEjercicio de continuidad con evidencias firmadas.

Impacto medido

Lo que cambió, con nombres y apellidos

-41%

Coste mensual de LLMs

en 90 días

46

Agentes/APIs/MCPs bajo gobierno

6h → 8min

Latencia alerta → ticket con contexto

100%

Acciones OT auditadas y firmadas

"El día que vi por primera vez todos los agentes de las 17 plantas en la misma pantalla, entendí por qué la factura no paraba de crecer."

CTO · Utility Norte