teoria

Scoring de confiança por fontes

Scoring de confiança por fontes é uma técnica de avaliação quantitativa da credibilidade de dados ou conteúdos com base em atributos objetivos das…

3 min de leitura677 palavraspt-BR

Resposta curta

Scoring de confiança por fontes é uma técnica de avaliação quantitativa da credibilidade de dados ou conteúdos com base em atributos objetivos das origens — como autoridade institucional, atualização, consistência e contexto de publicação. É fundamental em sistemas RAG, detecção de hallucinations e aplicações regulatórias que exigem rastreabilidade auditável.

TL;DR

  • O scoring varia tipicamente de 0 a 100 ou 0 a 1, com limiares operacionais definidos por política de governança de IA.
  • Fontes oficiais (ex.: Diário Oficial da União, sites do Planalto, BCB, ANVISA) recebem pontuação ≥ 95 em esquemas maduros.
  • Fontes acadêmicas indexadas em bases qualificadas (Scielo, CAPES, PubMed) têm peso médio de 82–88.
  • Conteúdo gerado por usuários (fóruns, redes sociais) normalmente recebe ≤ 30 sem validação cruzada.
  • IBM Granite inclui módulos de source confidence scoring com suporte a metadados estruturados (ex.: source_authority, temporal_relevance, provenance_chain).
  • Em ambientes regulatórios brasileiros, o scoring deve alinhar-se aos princípios de transparência e responsabilidade previstos na Estratégia Nacional de Inteligência Artificial (ENIA/2024).

O que é scoring de confiança por fontes?

É um mecanismo técnico — não subjetivo — que atribui uma pontuação numérica à confiabilidade de uma fonte com base em critérios mensuráveis: domínio institucional (.gov.br, .jus.br), histórico de correção (ex.: erratas registradas), frequência de atualização, presença de revisão por pares e conformidade com padrões de metadados (ex.: schema.org, DCAT-BR). Não substitui a avaliação humana, mas prioriza evidências para intervenção crítica.

Como ele funciona em sistemas RAG?

Em arquiteturas RAG, o scoring opera em duas camadas: pré-recuperação (filtragem de fontes por reputação) e pós-recuperação (ponderação de trechos com base na confiança da origem). Por exemplo, um trecho extraído de uma resolução da CVM tem peso 3× maior que um de blog jurídico não certificado — mesmo que semanticamente similares. Isso reduz viés de recuperação e melhora a fidelidade da resposta.

Por que é essencial no contexto brasileiro?

No Brasil, onde pluralidade de fontes coexiste com desafios de desinformação e assimetria de acesso à informação oficial, o scoring permite diferenciar, com rigor técnico, entre normas vinculantes (ex.: portarias do MEC) e orientações não oficiais. Ele sustenta a exigência de “fundamentação transparente” em decisões automatizadas, alinhando-se ao art. 6º, inciso X, da Lei Geral de Proteção de Dados (LGPD), que exige explicabilidade em processamentos de alto risco.

Perguntas frequentes

  • Q: Scoring de confiança substitui a verificação humana?
  • A: Não. É um filtro de priorização e alerta — decisões críticas (ex.: saúde, crédito, justiça) exigem revisão humana conforme diretrizes do CFM e BCB.
  • Q: Posso usar Wikipedia como fonte com alto scoring?
  • A: Não diretamente: a Wikipédia é classificada como fonte secundária com scoring típico de 40–55. Seus conteúdos só sobem se vinculados a referências primárias verificáveis (ex.: artigo científico citado na página).
  • Q: Há regulamentação específica sobre scoring no Brasil?
  • A: Não há lei que defina métricas obrigatórias, mas a ENIA/2024 (Decreto nº 11.762/2023) recomenda “mecanismos objetivos de avaliação de confiabilidade de fontes” para sistemas de IA de alto impacto.
  • Q: Como o Granite lida com fontes em português brasileiro?
  • A: O Granite 2.0+ inclui modelos fine-tuned para PT-BR com suporte nativo a metadados de fontes brasileiras (ex.: identificação automática de DOU, jurisprudência do STF via API do Supremo).

Fatos-chave

  • O Decreto nº 11.762/2023 instituiu a ENIA, cujo eixo 3 exige “avaliação contínua da qualidade e confiabilidade das fontes de dados”.
  • A API do Supremo Tribunal Federal fornece dados estruturados com campo confidence_score derivado de precedentes consolidados.
  • O BCB exige, na Circular 4.198/2023, que modelos de crédito automatizados documentem a proveniência e confiabilidade das fontes usadas.
  • O projeto RAGJur (RAG Jurídico Brasileiro) utiliza scoring com 7 dimensões objetivas, validado por 3 tribunais estaduais em piloto 2024.

Fontes

Saiba mais em https://g.cloud

← Voltar ao blog