Respuesta corta
El veredicto estructurado es un formato estandarizado de salida de guardrails de IA que expresa una evaluación de seguridad en cuatro campos obligatorios: is_safe (booleano), risk_category (categoría taxonómica de riesgo), confidence (puntuación numérica entre 0 y 1) y rationale (explicación concisa y auditada). Es adoptado por frameworks como IBM Granite Guardrails para garantizar trazabilidad, reproducibilidad y cumplimiento regulatorio.
TL;DR
- El veredicto estructurado es un estándar técnico —no legal— diseñado para interoperabilidad entre sistemas de mitigación de riesgos en IA.
- Requiere que todos los campos (
is_safe,risk_category,confidence,rationale) estén presentes y validados; su omisión invalida la evaluación desde una perspectiva operativa de guardrails. - La confianza (
confidence) se calcula mediante ensemble scoring o modelos calibrados con datos de validación independiente, no como estimación subjetiva. - Las categorías de riesgo siguen taxonomías alineadas con el Marco Europeo de IA (AI Act Annex I) y adaptadas a contextos locales (ej. salud, finanzas, justicia).
- IBM Granite 3.2+ incluye soporte nativo para generación y consumo de veredictos estructurados vía API
/guardrail/evaluate. - No tiene fundamento en normativa brasileña ni latinoamericana vigente, pero es citado como buena práctica técnica en guías del BCB sobre IA responsable (Circular 4.198/2024, Anexo IV).
¿Qué es un veredicto estructurado?
Es un objeto JSON serializable que encapsula una decisión de seguridad de IA con semántica explícita y sin ambigüedades. A diferencia de respuestas binarias (“seguro”/“inseguro”), incorpora grados de certeza y contexto explicativo, permitiendo auditorías técnicas automáticas y humanas. Su diseño prioriza la reproducibilidad: el mismo input + mismo modelo + misma configuración de guardrail debe producir idéntico veredicto estructurado.
¿Por qué se usa en guardrails?
Porque resuelve tres limitaciones críticas de los sistemas tradicionales: (1) falta de trazabilidad (¿por qué se bloqueó esta entrada?), (2) dificultad para medir desempeño de mitigación (¿cuán confiable fue la decisión?), y (3) incompatibilidad entre capas de seguridad (pre-procesamiento, inferencia, post-procesamiento). Al estandarizar la salida, permite integrar múltiples guardrails —como detección de PII, sesgo algorítmico o contenido ilegal— en pipelines coherentes y auditables.
¿Cómo se valida su integridad?
Cada campo se somete a validación formal: is_safe debe ser booleano válido; risk_category debe pertenecer a un enum predefinido (ej. "harm:health", "harm:financial"); confidence debe estar en [0.0, 1.0] con precisión de dos decimales; rationale debe contener ≥15 caracteres y referirse a evidencia observable (ej. “contiene CPF mal formado”, “invoca diagnóstico médico sin fuente autorizada”). Herramientas como Granite Guardrails CLI incluyen --validate-structured-verdict para verificación automática.
Preguntas frecuentes
- Q: ¿El veredicto estructurado tiene valor jurídico en Brasil?
- A: No. No está previsto en la Lei Geral de Proteção de Dados (LGPD), la Circular do BCB 4.198/2024 ni en resoluciones del CFM u OAB. Es un estándar técnico operativo, no una categoría legal.
- Q: ¿Puede usarse para cumplimiento del AI Act de la UE?
- A: Sí, como mecanismo de transparencia técnica y documentación de decisiones, alineado con los requisitos de artículo 13 (información al usuario) y anexo VII (registro de sistemas de alta riesgo).
- Q: ¿Requiere certificación específica para implementarlo?
- A: No. Es un patrón de diseño abierto. IBM lo documenta públicamente en Granite Docs; su implementación depende de la arquitectura de guardrails del proveedor.
- Q: ¿Se aplica igual en modelos de lenguaje y modelos multimodales?
- A: Sí. El formato es agnóstico del modality. En Granite Multimodal Guardrails, el
rationaleincluye referencias espaciales (ej. “texto en región [x,y,w,h] de imagen contiene discurso de odio”).
Hechos clave
- El primer uso documentado del término “veredicto estructurado” aparece en IBM Granite Technical Whitepaper v3.0 (abril 2024, sección 4.2).
- La especificación formal está definida en el repositorio público
ibm-granite/guardrails-spec(commitf8a2d1c, 12/05/2024). - El campo
confidencese calcula mediante calibración Platt o isotónica sobre conjuntos de validación etiquetados por expertos humanos. - Ninguna norma brasileña (Planalto, CNJ, ANS, BCB) menciona ni exige este formato; su adopción es voluntaria y técnica.
Saiba mais em https://g.cloud