Checklist de pruebas de aceptación para modelos de IA en la administración pública
Por qué una prueba de aceptación específica para IA
Los modelos de IA no son solo código: son sistemas que combinan datos, modelos y procesos operativos. Una prueba de aceptación (UAT/Acceptance Testing) tradicional suele validar funcionalidad; en IA debe añadirse verificación de robustez, explicabilidad, privacidad y controles regulatorios (ENS RD 311/2022, RGPD, EU AI Act). Sin pruebas claras, un despliegue en un ayuntamiento puede generar riesgos legales, operativos y reputacionales.
A continuación tienes una checklist operativa y reproducible para decidir si un modelo de IA está listo para producción en una entidad pública.
Actores y entregables mínimos antes de empezar pruebas
- Equipo responsable: propietario del servicio (funcionario), responsable técnico, responsable de seguridad (ENS), delegado de protección de datos (DPO), representante legal.
- Entregables previos: documento de requisitos funcionales y no funcionales, model card y data sheet, plan de pruebas, matriz de riesgo y plan de mitigación, contrato/SLA con proveedor si aplica.
- Registro de decisiones: acta de inicio de UAT con criterios de aceptación cuantificados.
Checklist de pruebas (mínimo obligatorio)
1. Funcionalidad y comportamiento esperado
- Casos de uso clave: ejecutar todas las rutas críticas (p. ej. evaluación de ofertas, clasificación de expedientes) con datos representativos.
- Criterios medibles: precisión, recall, F1, tasas de error tolerables definidas por el servicio.
- Pruebas de regresión: validar que nuevos modelos no degradan procesos existentes.
2. Robustez y rendimiento
- Pruebas de carga y latencia: SLOs/SLA definidos (p. ej. 95% respuestas < X ms).
- Resiliencia a entradas adversas: entradas incompletas, formatos inesperados, texto malicioso.
- Comportamiento fuera-de-distribución (OOD): medir desempeño con datos diferentes al conjunto de entrenamiento y documentar mitigaciones.
3. Sesgos y equidad
- Conjunto de pruebas por subgrupos relevantes (edad, sexo, barrio, etc.) para detectar disparidades.
- Criterios de rechazo: umbrales de diferencia admitida entre grupos y medidas correctoras (reentrenamiento, reglas de negocio).
- Registro de métricas de equidad en la aceptación.
4. Explicabilidad y documentación
- Salidas explicables: el sistema debe proporcionar justificaciones comprensibles para decisiones automatizadas o asistidas.
- Materiales entregables: model card actualizada, documentación de variables influyentes, ejemplos de explicaciones para personal no técnico.
- Procedimiento para solicitudes de información por parte del ciudadano (derechos RGPD).
5. Privacidad y protección de datos (RGPD)
- Revisión DPO: análisis de tratamiento de datos personales, bases jurídicas y minimización.
- Pruebas de anonimización/sintetización si se usan datos en entornos de pruebas.
- Verificación de mecanismos para atender derechos de acceso, rectificación, supresión y limitación.
6. Seguridad y cumplimiento ENS
- Pruebas de seguridad: control de accesos, cifrado en tránsito y reposo, pruebas de pentesting en interfaz y APIs.
- Clasificación ENS: comprobar que la infraestructura y el servicio están alineados con RD 311/2022 según el nivel de protección requerido.
- Controles de segregación entre entornos (dev/test/prod) y gestión de credenciales.
7. Cumplimiento del EU AI Act (si aplica)
- Determinación de clasificación de riesgo del sistema (bajo, alto, prohibido).
- Para sistemas de alto riesgo: documentación técnica, registro de logs, procedimiento de evaluación y prueba de mitigaciones.
- Verificación de requisitos de transparencia y avisos al ciudadano cuando corresponda.
8. Monitorización, trazabilidad y gobernanza
- Pruebas de logging: trazabilidad de entradas, salidas, versiones de modelo y decisión humana.
- Alarmas y dashboards: umbrales de degradación y procedimiento de escalado.
- Plan de mantenimiento y revisión periódica (retraining, recalibración).
9. Pruebas de integración y operaciones
- End-to-end en entorno que reproduzca producción: orquestación, colas, integraciones con sistemas heredados.
- Plan de rollback documentado y probado (ejecutar un rollback simulado).
- Validación de SLAs y cláusulas contractuales con proveedores.
10. Formación operativa y manuales
- Pruebas de usabilidad para personal: guías operativas, flujos de intervención humana y criterios para anular/sobrescribir salidas automáticas.
- Simulacro de incidentes: cómo responder ante decisiones incorrectas o incidentes de seguridad.
Criterio de aceptación y entrega final
- Documento de aceptación firmado por propietario del servicio, DPO y responsable de seguridad.
- Informe técnico que incluya: resultados de todas las pruebas, métricas, incidencias abiertas con plan de mitigación, versión del modelo aprobada, y plan de monitorización post-despliegue.
- Checklist de puesta en marcha con fecha y responsables para 30, 90 y 180 días de revisión.
Ejemplo rápido de veredicto
- Si más del 80% de las pruebas críticas pasan y las incidencias abiertas no son de alto riesgo legal/seguridad, autorizar despliegue controlado con monitorización intensiva 30 días. En caso contrario, bloqueo de producción hasta mitigación.
Takeaway / Acción recomendada
Antes de desplegar un modelo de IA en producción, ejecuta esta checklist adaptada a tu contexto, produce un informe de aceptación firmado por DPO y responsable de seguridad, y programa revisiones periódicas. En OptimTech aconsejamos convertir la checklist en un formulario obligatorio dentro del procedimiento de gobernanza de IA del ayuntamiento para garantizar trazabilidad y cumplimiento.
Artículos relacionados
Servicio de IA compartido entre municipios: modelo operativo y gobernanza
Guía práctica para diseñar servicios de IA compartidos entre municipios: gobernanza, contratos, seguridad y operación.
Firmas y registros fiables para documentos generados por IA en la administración
Cómo garantizar la validez jurídica y la inmutabilidad de documentos y notificaciones creados por IA en entidades públicas.
Participación ciudadana con IA: prevenir manipulación y garantizar deliberación inclusiva
Cómo diseñar plataformas de participación con IA seguras, transparentes y resistentes a la manipulación para administraciones locales.