Data Warehouse¶
Um banco transacional serve para operar o negócio no dia a dia. Quando o objetivo é analisar (relatórios, tendências, indicadores), usa-se outra arquitetura: o data warehouse. Teoria de modelagem relacional em Modelagem de Dados; engenharia de dados para IA em I.A. e Machine Learning.
OLTP x OLAP¶
| OLTP (processamento transacional) | OLAP (processamento analítico) | |
|---|---|---|
| Objetivo | Registrar transações do dia a dia: pedido, pagamento, cadastro, atualização | Analisar grandes volumes para relatórios, tendências e decisões |
| Perfil | Muitas operações curtas, dados atuais, alta consistência | Consultas complexas, histórico amplo, agregações |
| Exemplo | Loja registra uma compra no caixa em poucos segundos | Gestor compara vendas por região e mês nos últimos três anos |
Definição: OLTP e OLAP
OLTP (Online Transaction Processing): sistemas que processam transações operacionais. OLAP (Online Analytical Processing): sistemas otimizados para consultas analíticas sobre dados históricos. Misturar os dois no mesmo banco costuma prejudicar ambos — por isso se separa a análise em outra base.
Data Warehouse¶
Definição: Data Warehouse (DW)
Repositório central que reúne dados históricos de várias fontes (vendas, clientes, estoque, marketing) em um só lugar, com foco em análise, não em transações do dia a dia.
- Dados integrados: unifica fontes diferentes.
- Histórico: guarda dados ao longo do tempo para comparar meses, anos e tendências.
- Estrutura: fatos registram eventos; dimensões descrevem o contexto (produto, data, cliente).
- Exemplo: um dashboard mostra faturamento por região, produto e período a partir de dados consolidados.
ETL e ELT: preparando os dados¶
flowchart LR
A["Fontes<br/>APIs, planilhas, bancos, arquivos"] -->|Extract| B["Transformar<br/>limpar, padronizar, validar"]
B -->|Load| C[("Data Warehouse")]
| Etapa | O que faz |
|---|---|
| E — Extract | Extrai dados de APIs, planilhas, sistemas, bancos e arquivos |
| T — Transform | Limpa, padroniza, valida e combina os dados para torná-los confiáveis |
| L — Load | Carrega os dados prontos no destino, como o Data Warehouse |
- ETL: transforma antes de carregar. Bom quando o destino recebe dados já tratados.
- ELT: carrega primeiro e transforma no destino. Comum em plataformas modernas de nuvem, que têm poder de processamento no próprio destino.
- Boa prática: registre erros, automatize as execuções e valide a qualidade em cada etapa.
Data Lake¶
Definição: Data Lake
Repositório que guarda grandes volumes de dados no formato original — tabelas, textos, imagens, vídeos, logs, JSON. A estrutura é aplicada na leitura (schema on read), quando alguém vai analisar o dado, e não antes.
| Data Lake | Data Warehouse | |
|---|---|---|
| Dado | Bruto e variado | Organizado para análise |
| Estrutura | Aplicada na leitura | Definida antes (schema on write) |
| Vantagem | Flexibilidade para ciência de dados, ML e novas perguntas | Consultas rápidas e confiáveis para BI |
Cuidado: sem organização e governança, um lake vira um data swamp ("pântano de dados"): difícil de usar e de confiar.
Modelagem dimensional¶
Estrutura os dados analíticos para relatórios rápidos e fáceis de entender.
| Elemento | Papel |
|---|---|
| Tabela fato | Guarda métricas e eventos: quantidade vendida, valor, desconto, data |
| Dimensões | Dão contexto aos fatos: cliente, produto, loja, vendedor, calendário |
| Grão | Nível de detalhe de cada linha da fato: por venda, item do pedido ou dia |
Exemplo: a fato Vendas ligada às dimensões Data, Produto, Cliente e Região. Vantagem:
simplifica consultas, dashboards e agregações para quem analisa o negócio.
Esquema estrela x floco de neve¶
flowchart TD
D1["Dim Data"] --- F(("Fato<br/>Vendas"))
D2["Dim Produto"] --- F
D3["Dim Cliente"] --- F
D4["Dim Loja"] --- F
- Esquema estrela (star schema): uma tabela fato central ligada diretamente às dimensões — o desenho lembra uma estrela. Consultas mais simples e rápidas, ótimo para relatórios e ferramentas de BI.
- Esquema floco de neve (snowflake): variação em que as dimensões são normalizadas
em tabelas menores (Produto → Categoria → Departamento). Reduz repetição e melhora a
organização, mas exige mais
JOINs e pode deixar consultas de BI mais complexas. Use quando as dimensões são grandes, têm hierarquias e precisam de maior controle.
Qualidade e governança de dados¶
Dados ruins geram relatórios errados, decisões ruins e perda de confiança.
| Dimensão de qualidade | Pergunta |
|---|---|
| Exatidão | O dado representa a realidade (preço, e-mail e endereço corretos)? |
| Completude | Campos importantes estão preenchidos (cliente, data, valor)? |
| Consistência | O mesmo dado segue o mesmo padrão em todos os sistemas? |
| Atualidade | A informação está recente o bastante para decidir? |
| Validações | Regras, tipos, chaves, limites e testes automáticos evitam erros |
Definição: Governança de dados
Conjunto de políticas, papéis e controles para usar, proteger e manter dados de forma responsável: responsáveis (donos que cuidam da qualidade e dos acessos), catálogo (documenta o que cada tabela e coluna significa, de onde vem e como é usada), acesso (cada pessoa vê só o necessário, por perfis e permissões) e ciclo de vida (criar, usar, reter, arquivar e descartar conforme regras definidas). Benefício: mais confiança, conformidade, segurança e decisões baseadas em dados claros.
Privacidade e proteção de dados pessoais (LGPD) em Administração e Operação de Banco.