Caso real · Banca · 2024–2025

Banco Meridian. 14 modelos en producción. Y cero trazabilidad ante el supervisor.

Cómo un requerimiento del supervisor para 'listar los sistemas de IA de alto riesgo' terminó ordenando credit scoring, antifraude y la relación con el regulador.

Alto riesgoArt. 9-15Sesgo & fairness

€38B

Activos bajo gestión

Retail + PyME + Consumo

14

Modelos de IA en producción

scoring, fraude, churn, KYC

3

Versiones del mismo credit scoring

corriendo en paralelo por canal

Lo que dijo el Director de Riesgos

"Necesitamos un Excel con los modelos de IA para la próxima visita del supervisor. En una semana."

"Pensábamos que era un ejercicio de inventario. Hasta que pedimos el inventario y no había dos versiones que coincidieran."

El supervisor había pedido identificar sistemas de alto riesgo, sus responsables y las evidencias de validación. La respuesta interna era un Excel con 14 modelos, tres versiones distintas del mismo scoring, y ningún log firmado. En realidad, no había un problema de reporting — había un problema de gobierno.

Lo que encontramos en varios lugares

3 incoherencias que revelaban el problema real

#1

El mismo credit scoring, tres versiones distintas en producción.

Pedimos a Riesgos, Comercial y TI cuál era el modelo de scoring vigente. Cada uno nos dio uno distinto — todos vivos, todos tomando decisiones sobre clientes reales.

credit_scoring · huella real en producción
CanalVersión declaradaOwnerÚltima validaciónFairness log
Sucursalscoring_v6.2RiesgosQ1 2024No
App móvilscoring_v6.4Producto DigitalNo
Consumo onlinescoring_v5.9-liteConsumo2022-11No
Backoffice PyMEscoring_v6.2 + reglasRiesgos PyMEQ4 2023Parcial

4 canales · 3 versiones distintas · 0 con log de fairness firmado.

#2

El antifraude decide, pero nadie firma sus decisiones.

El modelo antifraude bloquea 1.400 operaciones al mes. Reconstruimos qué evidencia queda de cada bloqueo — y quién responde ante una reclamación del cliente.

linaje real · decisión de bloqueo antifraude
  • 1 · Feature storeSnowflake — sin snapshot al momento del scoring
  • 2 · Modelo aplicado'fraud_v9' — sin registro de la versión en el log
  • 3 · Umbral de bloqueoAjustado en enero por un data scientist, sin ticket
  • 4 · Log de decisiónSolo score, sin features ni explicación
  • 5 · Aprobador de la política'CRO — verbal en comité, sin firma'
  • 6 · Base para reclamacionesNinguna — respuesta manual por Atención al Cliente

1.400 bloqueos/mes · 0 con explicación reconstruible · alto riesgo bajo Art. 14.

#3

El registro de datasets para el AI Act… no existía.

El Art. 10 exige demostrar la calidad, el sesgo controlado y la base legal de los datos de entrenamiento. Pedimos el registro. Recibimos una carpeta compartida.

datasets_ia · estado a mayo 2024
ModeloDataset entrenamientoBase legalTest de sesgoOwner de datos
credit_scoring_v6.4extract_2023.csv
fraud_v9training_full_2022_23.parquetInterés legítimo (verbal)Data Science
churn_v3crm_dump_marzo.csv
kyc_ocr_v2vendor dataset (proveedor)Contrato proveedorCompliance

0/4 modelos con test de sesgo documentado · 1/4 con base legal firmada · Art. 10 sin evidencia.

El giro

"No es un problema de reporting. Es que tres áreas están tomando decisiones distintas sobre el mismo cliente."

Propuesta: consolidar el inventario, unificar el credit scoring, activar Aura Sentinel y desplegar 4 copilots que sostengan la gobernanza sin volver al Excel.

Estrategia + diseño de la solución (Var Group AI Practice) + plataforma Aura Sentinel + 4 agentes que hacen el trabajo diario. El comité de dirección aprueba en 2 semanas.

Estrategia Var GroupDiseño de la soluciónPlataforma Aura Sentinel4 copilots operativos

Los 4 copilots que resuelven el problema

Un equipo multi-agente, un solo Audit Center

Compliance Copilot

Gemini 2.5 Pro · RAG sobre AI Act + guidelines EBA

Clasifica cada sistema, mapea a los artículos del AI Act y detecta gaps de evidencia.

Resuelve · Hallazgo #1

3 versiones del scoring sin clasificar como alto riesgo bajo Anexo III.

Resuelve · Hallazgo #3

0 datasets con base legal y test de sesgo documentados (Art. 10).

Lee inventario, dataset registry, políticas y documentos legales. Propone la clasificación AI Act (prohibido / alto riesgo / limitado / mínimo), enlaza requisitos aplicables por artículo, y abre un ticket de evidencia por cada gap.

  1. 01
    Ingesta de contextoMLflow + Snowflake + Confluence + carpeta legal.
  2. 02
    Clasificación AI Act7 de 14 sistemas marcados alto riesgo (Anexo III · crédito, empleo, servicios esenciales).
  3. 03
    Mapeo Art. 9-15Requisitos por artículo con enlace a la evidencia existente o al gap abierto.
  4. 04
    Ticket de evidenciaJIRA autoasignado al owner con la evidencia concreta que falta.

Risk Copilot

Claude Sonnet 4 · reglas + LLM sobre logs

Correlaciona drift, disparate impact y contexto de negocio. Reclasifica el riesgo y notifica al comité IA.

Resuelve · Hallazgo #1

Sin monitorización de fairness los 3 scorings estaban tomando decisiones sesgadas por canal.

Resuelve · Hallazgo #2

1.400 bloqueos/mes de antifraude sin trazabilidad ni umbral aprobado.

Ingiere logs de inferencia, calcula disparate impact por atributos protegidos y PSI de drift. Reclasifica el riesgo del modelo cuando cruza umbrales y notifica al comité IA con contexto.

  1. 01
    Monitor fairnessDisparate impact por edad, sexo, código postal, canal.
  2. 02
    Drift PSI + KSVentana móvil 7d/30d/90d con umbrales configurables por sistema.
  3. 03
    Recalificación de riesgoSi supera umbral, el sistema pasa a 'alto riesgo · revisión'.
  4. 04
    Notificación comité IAResumen ejecutivo + acción recomendada + evidencia adjunta.

MLOps Sentinel

GPT-4o · Isolation Forest sobre métricas

Unifica versiones, vigila latencia, coste y calidad por canal. Convierte la alerta en un ticket accionable.

Resuelve · Hallazgo #1

3 versiones del scoring en 4 canales sin ownership operativo.

Resuelve · Hallazgo #2

El umbral del antifraude se movía en producción sin registro.

Detecta versiones divergentes en producción, congela cambios de umbral no aprobados y propone consolidación. Cada alerta se convierte en ticket ServiceNow con la acción sugerida.

  1. 01
    Registro único de versiónModelo, canal, versión, umbral y aprobador — todo firmado.
  2. 02
    Congelación de umbralesLos cambios pasan por 4 ojos y quedan versionados.
  3. 03
    Ticket con recomendación'Consolidar v5.9-lite → v6.4 · impacto estimado -0.4pp AUC · +2.1pp cobertura'.
  4. 04
    SLA por canalLatencia p95 y coste €/1k inferencias monitorizados por canal.

Audit Orchestrator

Gemini 2.5 Flash · plantillas firmadas

Agrega evidencias, firma el reporte PDF y prepara la carpeta lista para el supervisor.

Resuelve · Hallazgo #3

Ningún dataset con evidencia de calidad, sesgo y base legal para Art. 10.

Resuelve · Requerimiento supervisor

Sin PDF ejecutivo listo, cada visita se preparaba en 2-3 semanas.

Recoge validaciones, evidencias, aprobadores y firmas del hub. Compone el informe AI Act con artículos, evidencias por sistema, calendario regulatorio y hallazgos por nivel de riesgo. Firma inmutable en el Audit Center.

  1. 01
    Recolección firmadaCada evidencia con hash, autor y fecha.
  2. 02
    Reporte por sistemaClasificación, requisitos, evidencias, gaps abiertos.
  3. 03
    Calendario regulatorioHitos AI Act 2025-2030 aplicables a la entidad.
  4. 04
    Firma en Audit CenterPDF inmutable + carpeta compartida con auditor externo.

Impacto medido

Lo que cambió, con nombres y apellidos

3 → 1

Versiones del credit scoring

consolidadas en 8 semanas, sin pérdida de AUC

14/14

Sistemas con RACI + evidencias firmadas

-83%

Horas/mes en reporting regulatorio

< 5 min

PDF de auditoría AI Act on demand

"Antes la visita del supervisor era una crisis de 3 semanas. Ahora abrimos el hub, generamos el PDF y en la reunión hablamos de riesgo, no de dónde está el Excel."

Director de Riesgos · Banco Meridian