Pular para conteúdo

Data Warehouse

Um banco transacional serve para operar o negócio no dia a dia. Quando o objetivo é analisar (relatórios, tendências, indicadores), usa-se outra arquitetura: o data warehouse. Teoria de modelagem relacional em Modelagem de Dados; engenharia de dados para IA em I.A. e Machine Learning.

OLTP x OLAP

OLTP (processamento transacional) OLAP (processamento analítico)
Objetivo Registrar transações do dia a dia: pedido, pagamento, cadastro, atualização Analisar grandes volumes para relatórios, tendências e decisões
Perfil Muitas operações curtas, dados atuais, alta consistência Consultas complexas, histórico amplo, agregações
Exemplo Loja registra uma compra no caixa em poucos segundos Gestor compara vendas por região e mês nos últimos três anos

Definição: OLTP e OLAP

OLTP (Online Transaction Processing): sistemas que processam transações operacionais. OLAP (Online Analytical Processing): sistemas otimizados para consultas analíticas sobre dados históricos. Misturar os dois no mesmo banco costuma prejudicar ambos — por isso se separa a análise em outra base.

Data Warehouse

Definição: Data Warehouse (DW)

Repositório central que reúne dados históricos de várias fontes (vendas, clientes, estoque, marketing) em um só lugar, com foco em análise, não em transações do dia a dia.

  • Dados integrados: unifica fontes diferentes.
  • Histórico: guarda dados ao longo do tempo para comparar meses, anos e tendências.
  • Estrutura: fatos registram eventos; dimensões descrevem o contexto (produto, data, cliente).
  • Exemplo: um dashboard mostra faturamento por região, produto e período a partir de dados consolidados.

ETL e ELT: preparando os dados

flowchart LR
    A["Fontes<br/>APIs, planilhas, bancos, arquivos"] -->|Extract| B["Transformar<br/>limpar, padronizar, validar"]
    B -->|Load| C[("Data Warehouse")]
Etapa O que faz
E — Extract Extrai dados de APIs, planilhas, sistemas, bancos e arquivos
T — Transform Limpa, padroniza, valida e combina os dados para torná-los confiáveis
L — Load Carrega os dados prontos no destino, como o Data Warehouse
  • ETL: transforma antes de carregar. Bom quando o destino recebe dados já tratados.
  • ELT: carrega primeiro e transforma no destino. Comum em plataformas modernas de nuvem, que têm poder de processamento no próprio destino.
  • Boa prática: registre erros, automatize as execuções e valide a qualidade em cada etapa.

Data Lake

Definição: Data Lake

Repositório que guarda grandes volumes de dados no formato original — tabelas, textos, imagens, vídeos, logs, JSON. A estrutura é aplicada na leitura (schema on read), quando alguém vai analisar o dado, e não antes.

Data Lake Data Warehouse
Dado Bruto e variado Organizado para análise
Estrutura Aplicada na leitura Definida antes (schema on write)
Vantagem Flexibilidade para ciência de dados, ML e novas perguntas Consultas rápidas e confiáveis para BI

Cuidado: sem organização e governança, um lake vira um data swamp ("pântano de dados"): difícil de usar e de confiar.

Modelagem dimensional

Estrutura os dados analíticos para relatórios rápidos e fáceis de entender.

Elemento Papel
Tabela fato Guarda métricas e eventos: quantidade vendida, valor, desconto, data
Dimensões Dão contexto aos fatos: cliente, produto, loja, vendedor, calendário
Grão Nível de detalhe de cada linha da fato: por venda, item do pedido ou dia

Exemplo: a fato Vendas ligada às dimensões Data, Produto, Cliente e Região. Vantagem: simplifica consultas, dashboards e agregações para quem analisa o negócio.

Esquema estrela x floco de neve

flowchart TD
    D1["Dim Data"] --- F(("Fato<br/>Vendas"))
    D2["Dim Produto"] --- F
    D3["Dim Cliente"] --- F
    D4["Dim Loja"] --- F
  • Esquema estrela (star schema): uma tabela fato central ligada diretamente às dimensões — o desenho lembra uma estrela. Consultas mais simples e rápidas, ótimo para relatórios e ferramentas de BI.
  • Esquema floco de neve (snowflake): variação em que as dimensões são normalizadas em tabelas menores (Produto → Categoria → Departamento). Reduz repetição e melhora a organização, mas exige mais JOINs e pode deixar consultas de BI mais complexas. Use quando as dimensões são grandes, têm hierarquias e precisam de maior controle.

Qualidade e governança de dados

Dados ruins geram relatórios errados, decisões ruins e perda de confiança.

Dimensão de qualidade Pergunta
Exatidão O dado representa a realidade (preço, e-mail e endereço corretos)?
Completude Campos importantes estão preenchidos (cliente, data, valor)?
Consistência O mesmo dado segue o mesmo padrão em todos os sistemas?
Atualidade A informação está recente o bastante para decidir?
Validações Regras, tipos, chaves, limites e testes automáticos evitam erros

Definição: Governança de dados

Conjunto de políticas, papéis e controles para usar, proteger e manter dados de forma responsável: responsáveis (donos que cuidam da qualidade e dos acessos), catálogo (documenta o que cada tabela e coluna significa, de onde vem e como é usada), acesso (cada pessoa vê só o necessário, por perfis e permissões) e ciclo de vida (criar, usar, reter, arquivar e descartar conforme regras definidas). Benefício: mais confiança, conformidade, segurança e decisões baseadas em dados claros.

Privacidade e proteção de dados pessoais (LGPD) em Administração e Operação de Banco.