Saltar al contenido principal
Volver al blog
DespliegueGobernanza de IA

Checklist de pruebas de aceptación para modelos de IA en la administración pública

15 de agosto de 20265 min de lecturaOptimTech
Compartir:

Por qué una prueba de aceptación específica para IA

Los modelos de IA no son solo código: son sistemas que combinan datos, modelos y procesos operativos. Una prueba de aceptación (UAT/Acceptance Testing) tradicional suele validar funcionalidad; en IA debe añadirse verificación de robustez, explicabilidad, privacidad y controles regulatorios (ENS RD 311/2022, RGPD, EU AI Act). Sin pruebas claras, un despliegue en un ayuntamiento puede generar riesgos legales, operativos y reputacionales.

A continuación tienes una checklist operativa y reproducible para decidir si un modelo de IA está listo para producción en una entidad pública.

Actores y entregables mínimos antes de empezar pruebas

  • Equipo responsable: propietario del servicio (funcionario), responsable técnico, responsable de seguridad (ENS), delegado de protección de datos (DPO), representante legal.
  • Entregables previos: documento de requisitos funcionales y no funcionales, model card y data sheet, plan de pruebas, matriz de riesgo y plan de mitigación, contrato/SLA con proveedor si aplica.
  • Registro de decisiones: acta de inicio de UAT con criterios de aceptación cuantificados.

Checklist de pruebas (mínimo obligatorio)

1. Funcionalidad y comportamiento esperado

  • Casos de uso clave: ejecutar todas las rutas críticas (p. ej. evaluación de ofertas, clasificación de expedientes) con datos representativos.
  • Criterios medibles: precisión, recall, F1, tasas de error tolerables definidas por el servicio.
  • Pruebas de regresión: validar que nuevos modelos no degradan procesos existentes.

2. Robustez y rendimiento

  • Pruebas de carga y latencia: SLOs/SLA definidos (p. ej. 95% respuestas < X ms).
  • Resiliencia a entradas adversas: entradas incompletas, formatos inesperados, texto malicioso.
  • Comportamiento fuera-de-distribución (OOD): medir desempeño con datos diferentes al conjunto de entrenamiento y documentar mitigaciones.

3. Sesgos y equidad

  • Conjunto de pruebas por subgrupos relevantes (edad, sexo, barrio, etc.) para detectar disparidades.
  • Criterios de rechazo: umbrales de diferencia admitida entre grupos y medidas correctoras (reentrenamiento, reglas de negocio).
  • Registro de métricas de equidad en la aceptación.

4. Explicabilidad y documentación

  • Salidas explicables: el sistema debe proporcionar justificaciones comprensibles para decisiones automatizadas o asistidas.
  • Materiales entregables: model card actualizada, documentación de variables influyentes, ejemplos de explicaciones para personal no técnico.
  • Procedimiento para solicitudes de información por parte del ciudadano (derechos RGPD).

5. Privacidad y protección de datos (RGPD)

  • Revisión DPO: análisis de tratamiento de datos personales, bases jurídicas y minimización.
  • Pruebas de anonimización/sintetización si se usan datos en entornos de pruebas.
  • Verificación de mecanismos para atender derechos de acceso, rectificación, supresión y limitación.

6. Seguridad y cumplimiento ENS

  • Pruebas de seguridad: control de accesos, cifrado en tránsito y reposo, pruebas de pentesting en interfaz y APIs.
  • Clasificación ENS: comprobar que la infraestructura y el servicio están alineados con RD 311/2022 según el nivel de protección requerido.
  • Controles de segregación entre entornos (dev/test/prod) y gestión de credenciales.

7. Cumplimiento del EU AI Act (si aplica)

  • Determinación de clasificación de riesgo del sistema (bajo, alto, prohibido).
  • Para sistemas de alto riesgo: documentación técnica, registro de logs, procedimiento de evaluación y prueba de mitigaciones.
  • Verificación de requisitos de transparencia y avisos al ciudadano cuando corresponda.

8. Monitorización, trazabilidad y gobernanza

  • Pruebas de logging: trazabilidad de entradas, salidas, versiones de modelo y decisión humana.
  • Alarmas y dashboards: umbrales de degradación y procedimiento de escalado.
  • Plan de mantenimiento y revisión periódica (retraining, recalibración).

9. Pruebas de integración y operaciones

  • End-to-end en entorno que reproduzca producción: orquestación, colas, integraciones con sistemas heredados.
  • Plan de rollback documentado y probado (ejecutar un rollback simulado).
  • Validación de SLAs y cláusulas contractuales con proveedores.

10. Formación operativa y manuales

  • Pruebas de usabilidad para personal: guías operativas, flujos de intervención humana y criterios para anular/sobrescribir salidas automáticas.
  • Simulacro de incidentes: cómo responder ante decisiones incorrectas o incidentes de seguridad.

Criterio de aceptación y entrega final

  • Documento de aceptación firmado por propietario del servicio, DPO y responsable de seguridad.
  • Informe técnico que incluya: resultados de todas las pruebas, métricas, incidencias abiertas con plan de mitigación, versión del modelo aprobada, y plan de monitorización post-despliegue.
  • Checklist de puesta en marcha con fecha y responsables para 30, 90 y 180 días de revisión.

Ejemplo rápido de veredicto

  • Si más del 80% de las pruebas críticas pasan y las incidencias abiertas no son de alto riesgo legal/seguridad, autorizar despliegue controlado con monitorización intensiva 30 días. En caso contrario, bloqueo de producción hasta mitigación.

Takeaway / Acción recomendada

Antes de desplegar un modelo de IA en producción, ejecuta esta checklist adaptada a tu contexto, produce un informe de aceptación firmado por DPO y responsable de seguridad, y programa revisiones periódicas. En OptimTech aconsejamos convertir la checklist en un formulario obligatorio dentro del procedimiento de gobernanza de IA del ayuntamiento para garantizar trazabilidad y cumplimiento.