Caso real · Sector público · 2025

Organismo Delta. 3 LLMs corporativos. Y 17 usos en la sombra descubiertos por RRHH.

Cómo pusimos bajo control el ChatGPT corporativo, los copilotos de código y una decena de usos en la sombra que nadie había validado.

Sombra IALLMOpsValidaciones

6.400

Empleados públicos

8 unidades y 12 direcciones

3

LLMs corporativos aprobados

ChatGPT · Copilot · Traductor

17

LLMs en sombra detectados

algunos con documentos sensibles dentro

Lo que dijo el Comité de Ética + RRHH

"Los empleados usan IA que no hemos aprobado. Jurídico quiere parar todo. Dirección quiere ordenar sin frenar."

"Al principio pensamos que era un problema de política. Después vimos que era un problema de proceso: sin catálogo, cualquier uso es sombra."

Encuestas internas + análisis de red revelaron 17 LLMs distintos en uso, muchos sin política, sin evaluación de riesgo y con documentos con datos sensibles dentro. El comité pidió ordenar sin frenar la productividad.

Lo que encontramos en varios lugares

3 incoherencias que revelaban el problema real

#1

Documentos con datos sensibles siendo pegados en LLMs externos.

Analizamos el tráfico saliente durante 2 semanas. Reconstruimos qué se estaba subiendo, a dónde y por quién.

shadow_ai · muestra 2 semanas
LLM externoUso principalContenido observadoBase legalRiesgo
ChatGPT freeRedacciónInformes con nombresAlto
Claude webAnálisis normativoExpedientes anonimizadosMedio
Traductor DeepL ProTraducciónActas de reuniónContratoBajo
PerplexityBúsqueda técnicaConsultas con contextoMedio
Gemini freeResúmenesDocumentos internosAlto

5 herramientas · 3 con documentos sensibles · 1 con base legal firmada.

#2

Sin métricas de calidad, la IA se usaba como oráculo.

Recogimos ejemplos reales de decisiones administrativas asistidas por LLM. Medimos alucinación y toxicidad.

quality_audit · 200 salidas revisadas
Caso de usoEjemplosAlucinación detectadaToxicidadUso público
Redacción de resoluciones6012%0%
Respuesta a ciudadanos408%1%
Análisis normativo5022%0%Interno
Traducción503%0%Mixto

12-22% de alucinación en usos que iban a ciudadanos · sin métrica previa · sin política.

#3

Ni un solo caso de uso con validación AI Act firmada.

Pedimos las validaciones de los 3 LLMs corporativos. Encontramos documentos aislados sin owner ni fecha.

validaciones · estado a febrero 2025
  • ChatGPT corporativoNota jurídica de 2023 · sin renovar
  • Copilot de códigoContrato firmado · sin análisis de riesgo IA
  • Traductor corporativoDPA firmado · sin revisión anual
  • Casos de uso documentados0
  • Reviewer y fecha por caso
  • Registro para transparencia (Art. 50)No existe

3 herramientas corporativas · 0 casos de uso validados · Art. 50 sin cumplir.

El giro

"No es un problema de políticas. Es que sin catálogo, cualquier uso es sombra."

Propuesta: catálogo vivo de LLMs por caso de uso, con política aplicada, métricas de calidad y validación AI Act firmada. 4 copilots sostienen el proceso.

Estrategia + diseño (Var Group Public Sector Practice) + Aura Sentinel + copilots que aprueban, miden y auditan cada nuevo caso de uso sin ahogar a los empleados.

Estrategia Var GroupDiseño de la soluciónPlataforma Aura Sentinel4 copilots operativos

Los 4 copilots que resuelven el problema

Un equipo multi-agente, un solo Audit Center

Compliance Copilot

Gemini 2.5 Pro · RAG AI Act + guías nacionales

Aprueba nuevos casos de uso con clasificación de riesgo y política aplicada.

Resuelve · Hallazgo #1

Documentos sensibles pegados en LLMs externos sin base legal.

Resuelve · Hallazgo #3

0 casos de uso con validación AI Act firmada.

El empleado propone un caso de uso desde el portal. El copilot clasifica riesgo, propone LLM del catálogo, aplica política de datos y prepara borrador de validación AI Act para el reviewer.

  1. 01
    Portal de casos de usoCualquier empleado propone en 2 minutos.
  2. 02
    Clasificación de riesgoProhibido / alto / limitado / mínimo con base.
  3. 03
    Política aplicadaRetención, PII, geografía · según caso.
  4. 04
    Borrador de validaciónListo para reviewer con evidencias mínimas.

Risk Copilot

Claude Sonnet 4 · toxicidad + alucinación

Evalúa calidad y sesgo de cada LLM por caso de uso, en continuo.

Resuelve · Hallazgo #2

12-22% de alucinación en usos que iban a ciudadanos.

Golden set por caso de uso público. Mide alucinación, toxicidad y sesgo político/regional. Bloquea el uso si supera umbral.

  1. 01
    Golden set públicoCurado con juristas y comunicación.
  2. 02
    Bench continuoAlucinación, toxicidad, sesgo político.
  3. 03
    Gate por umbralUso bloqueado si supera el límite acordado.
  4. 04
    Alerta al comité éticaCon el caso concreto y la evidencia.

MLOps Sentinel

GPT-4o · detección de sombra

Descubre uso de LLM en sombra desde tráfico y encuestas, y propone alta en el catálogo.

Resuelve · Hallazgo #1

17 LLMs en sombra sin política ni control.

Cruza tráfico corporativo, encuestas y patrones de uso. Detecta nuevos LLMs, los mide y propone alta con política sugerida.

  1. 01
    Detección sombraTráfico + encuestas + heurísticas.
  2. 02
    Ranking de impactoPor volumen y sensibilidad del contenido.
  3. 03
    Propuesta de altaEn el catálogo con política sugerida.
  4. 04
    Comunicación al empleadoAlternativa aprobada + cómo migrar.

Audit Orchestrator

Gemini 2.5 Flash · Art. 50 + transparencia

Publica el registro de sistemas IA en uso (Art. 50) y prepara el reporte al comité mensualmente.

Resuelve · Hallazgo #3

Registro de transparencia (Art. 50) inexistente.

Compone el registro público de sistemas IA (Art. 50 AI Act), con caso de uso, base legal, LLM aplicado y reviewer. Publica el resumen mensual al comité y a la ciudadanía cuando aplica.

  1. 01
    Registro Art. 50Caso, LLM, base legal, reviewer, fecha.
  2. 02
    Publicación transparentePortal interno + portal ciudadano donde aplica.
  3. 03
    Informe mensualAl comité: sombra residual, calidad, coste, casos aprobados.
  4. 04
    Firma inmutableTodo en el Audit Center · listo para inspección.

Impacto medido

Lo que cambió, con nombres y apellidos

17 → 0

LLMs en sombra sin política

en 8 semanas

100%

Nuevos casos con validación AI Act

×3

Velocidad de aprobación de casos de uso

12% → 2%

Alucinación media en usos a ciudadanos

"Los empleados no querían saltarse las reglas. No había reglas claras. Cuando abrimos el catálogo, en 3 semanas la sombra bajó a cero."

Directora de Ética y Cumplimiento · Organismo Delta