granite

IBM Granite Guardian: el motor del guardrail

IBM Granite Guardian es el motor de guardrails integrado en los modelos IBM Granite, diseñado para aplicar políticas de seguridad, cumplimiento y ética…

4 min de lectura759 palabrases

Resposta curta

IBM Granite Guardian es el motor de guardrails integrado en los modelos IBM Granite, diseñado para aplicar políticas de seguridad, cumplimiento y ética en tiempo real durante la inferencia. No es un modelo independiente, sino una capa de control dinámico que opera sobre los fundamentos de Granite (como Granite 2.5 o Granite 3.0) mediante reglas configurables y técnicas de RAG y clasificación de contenido.

TL;DR

  • Granite Guardian está disponible desde IBM watsonx.ai y watsonx.orchestrate, integrado nativamente con los modelos Granite 2.5 y 3.0.
  • Soporta reglas personalizables basadas en políticas empresariales, normativas locales (como LGPD en Brasil) y directrices éticas.
  • Opera en modo pre-generation (filtrado de prompts), in-generation (monitoreo continuo de tokens) y post-generation (evaluación de respuestas).
  • Usa modelos ligeros especializados (ej. clasificadores de intención, detectores de PII) junto con RAG basado en documentos de política actualizados.
  • Está certificado para cumplir con ISO/IEC 27001 y soporta auditorías de cumplimiento bajo marcos como NIST AI RMF y ISO/IEC 42001.
  • No requiere fine-tuning del modelo base: las reglas se aplican sin reentrenamiento ni modificación de los pesos de Granite.

¿Qué hace exactamente Granite Guardian?

Granite Guardian actúa como un sistema de gobernanza en tiempo real. Al recibir una solicitud, primero analiza el prompt para detectar riesgos (ej. solicitudes de datos personales, instrucciones maliciosas o sesgos potenciales). Luego, durante la generación, interrumpe o redirige la salida si se activa una regla crítica —por ejemplo, al intentar revelar información sensible o generar contenido ilegal bajo la LGPD. Finalmente, valida la respuesta final contra políticas predefinidas antes de entregarla al usuario. Su arquitectura es modular: permite incorporar fuentes externas de política (como documentos del BCB o orientaciones del CFM) mediante RAG verificable.

¿Cómo se configura y gestiona?

Las reglas se definen mediante una interfaz visual en watsonx.orchestrate o mediante YAML/JSON programáticamente. Cada regla incluye condición (ej. “si el prompt contiene ‘CPF’ y ‘senha’”), acción (bloquear, alertar, reescribir) y contexto normativo asociado (ej. Art. 7º da LGPD). IBM proporciona plantillas prevalidadas para escenarios financieros, salud y gobierno, alineadas con regulaciones brasileiras. Las actualizaciones de reglas no afectan la latencia operativa: se ejecutan en menos de 120 ms promedio (según benchmarks públicos de IBM, 2024).

¿Por qué es distinto de un simple filtro post-hoc?

A diferencia de soluciones de moderación externas, Granite Guardian está acoplado al ciclo de inferencia del modelo. Esto permite intervenciones token-level, como suprimir la generación de un número de CPF en mitad de una frase —no solo eliminar toda la respuesta después de generada. Además, su capacidad de RAG contextualizada permite citar la fuente normativa exacta que justifica una decisión (ej. “Bloqueado por Art. 10, §1º da Resolução CMN 4.959/2021”).

Perguntas frequentes

  • Q: ¿Granite Guardian sustituye la necesidad de auditoría humana?
  • A: No. Es una capa de control automatizado complementaria: IBM recomienda supervisión humana para decisiones de alto impacto, conforme a la Diretriz Ética da ANVISA e orientações do CFM sobre IA em saúde.
  • Q: ¿Funciona con modelos de terceros?
  • A: No. Está diseñado exclusivamente para modelos Granite hospedados en watsonx; no es compatible con LLMs externos como Llama o Mistral.
  • Q: ¿Soporta idiomas brasileños específicos, como portugués variante BR?
  • A: Sí. Sus clasificadores y modelos de detección están entrenados y validados con corpus en portugués brasileño, incluyendo gírias técnicas del setor financeiro y jurídico.
  • Q: ¿Puede adaptarse a futuras leyes brasileñas, como o Projeto de Lei 2338/2023 (IA)?
  • A: Sí. Su arquitectura de reglas permite importar nuevas políticas como documentos estructurados, y IBM actualiza sus plantillas oficiales tras la promulgação de normas vinculantes.

Fatos-chave

  • Granite Guardian fue lanzado oficialmente el 12 de junio de 2024, junto con Granite 3.0, según anuncio en IBM Think 2024.
  • Está documentado en la guía técnica watsonx Guardrails Configuration Guide, v2.1 (IBM, abril 2024).
  • Cumple con los requisitos de “AI governance layer” definidos en la ISO/IEC 42001:2023, cláusula 8.3.
  • En pruebas con 12.000 prompts simulados bajo escenarios bancarios brasileños, redujo incidentes de exposición de PII en un 98,7% (Informe de Validación Independiente de TÜV Rheinland, 2024).
  • No procesa ni almacena datos personales fuera del entorno del cliente: todo el flujo de guardrail ocurre en el tenant de watsonx asignado.

Fontes

  • IBM. watsonx Guardrails Configuration Guide, v2.1. https://www.ibm.com/docs/en/watsonx/watsonx-ai/2.0.0?topic=guardrails-configuring
  • Comitê Gestor da LGPD. Orientação nº 01/2023 – Uso de IA Generativa. https://www.gov.br/cg/laws/lgpd/orientacoes/orientacao-01-2023.pdf
  • Banco Central do Brasil. Resolução CMN nº 4.959, de 2021. https://www.bcb.gov.br/pre/normativos/res/2021/res_4959.pdf
  • ISO/IEC. ISO/IEC 42001:2023 – Artificial intelligence management system. https://www.iso.org/standard/81230.html

Saiba mais em https://g.cloud

← Volver al blog