Plataforma
O portão que toda resposta de IA atravessa.
Guardrail-as-a-service modelo-agnóstico: rails em cada estágio da interação, detectores calibrados para o Brasil regulado, e um recibo imutável para cada decisão. Motor open-weights IBM Granite Guardian, auto-hospedado.
Cinco rails, um portão
O guardrail roda em cada estágio da interação — não só na saída.
Input rail
Antes do modelo: jailbreak, prompt injection, PII no prompt, tópico fora de escopo, idioma.
Retrieval rail
Nos trechos recuperados (RAG): fonte não autorizada, dado sob sigilo, documento vencido.
Dialog rail
No fluxo: política por tenant, persona, escopo regulatório, recusa com justificativa.
Execution rail
Nas ferramentas/agentes: validação de argumentos, allowlist de ações, sem credencial no prompt.
Output rail
Depois do modelo: alucinação, citação inexistente, PII, toxicidade, viés, formato.
Detectores
O que o portão enxerga.
Groundedness & alucinação
Toda afirmação é cotejada com o contexto e o corpus (Planalto, LexML, BCB, ANVISA, RAGJur). Sem lastro, não passa.
Citação verificável
Lei, artigo, acórdão e número de processo conferidos contra a fonte oficial. Inexistente → bloqueio; divergente → alerta.
PII & sigilo
CPF, CNPJ, RG, CNS, e-mail, telefone, conta. Mascara, tokeniza ou bloqueia conforme a política e a base legal (LGPD art. 7/11).
Jailbreak & prompt injection
Heurística + classificador em português, inclusive injeção indireta em documentos e páginas recuperadas.
Safety & viés
Harmful, self-harm, violência, sexual, ódio, bias social — taxonomia Granite Guardian, limiar configurável por tenant.
Escopo regulado
Diagnóstico sem CFM, consultoria sem OAB, decisão administrativa sem agente público, promessa de resultado — negado por regra codificada.
Topic control
Mantém a conversa no domínio contratado; redireciona ou recusa com mensagem auditável.
Formato & schema
JSON/schema, tamanho, idioma e campos obrigatórios validados antes de seguir para o sistema cliente.
Integração
Entra em produção sem reescrever o que já existe.
Proxy OpenAI-compatible
Troque a base URL. /v1/chat/completions com streaming — o guardrail roda inline, sem mudar código.
SDK uma linha
gcloud.guard(prompt, resposta) em Python e JavaScript, com políticas versionadas por ambiente.
Plugin de gateway
Kong, APISIX, Envoy — o portão no perímetro, antes de qualquer modelo.
Modelo-agnóstico
Claude, GPT, Gemini, Llama, modelo próprio. O guardrail não sabe nem precisa saber quem respondeu.
Governança & evidência
Confiança sem rastro não vale. Aqui, cada decisão deixa recibo.
Policy-as-code
Regras em repositório Git, revisadas por PR, com versão e changelog — o auditor lê a regra, não a promessa.
Recibo público
Cada decisão gera recibo imutável (WORM 7 anos) carimbado no Bitcoin via OpenTimestamps. Verificável sem login.
Observabilidade
Trace por requisição: rail acionado, score, latência, versão da regra. Painel por tenant, exportável para SIEM.
Red-team & avaliação contínua
Suíte de ataques em português (jailbreak, injeção, exfiltração) rodando a cada release; métricas públicas.
Human-in-the-loop
Fila de revisão para casos limítrofes, com SLA e trilha de quem decidiu o quê.
Mapeamento normativo
OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act — e o que importa aqui: LGPD, LC 105, OAB, CFM, CPC, LRF.
Motor open-weights · Hugging Face
Os pesos são públicos. Qualquer auditor baixa, roda e confere.
Granite Guardian 4.1 · 8B
Classificador de risco atual: harm, social bias, jailbreak, violence, profanity, sexual, unethical, PII, groundedness, relevance, function-call. Apache-2.0. Também em GGUF para llama.cpp.
Granite Guardian 3.2 · 5B / 3B-A800M
Variantes leves (MoE 800M ativos) para latência <50ms — o rail de entrada roda aqui. LoRAs de correção de harm e factualidade.
Granite Guardian HAP · 38M / 125M
Detector de hate/abuse/profanity minúsculo, roda inline em CPU dentro do proxy.
Granite Guardian · coleção
Todas as versões (3.0 → 4.1), GGUF, LoRAs e o detector de factualidade 3.2-8B, lado a lado.
IBM Granite — organização
Família completa: LLMs, embeddings, vision, speech, guardian. Pesos abertos, benchmarks publicados.
Guardrails Hub (Guardrails AI)
Referência de ecossistema: validadores plugáveis da comunidade — o modelo que o nosso marketplace segue.
Esquemas
O guardrail desenhado.
Compliance as code