Skip to content
View Mikhael-Groschitz's full-sized avatar

Highlights

  • Pro

Block or report Mikhael-Groschitz

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
Mikhael-Groschitz/README.md

mikhael@groschitz:~$ whoami

Mikhael Groschitz
Engenheiro de Dados
SQL Server · Azure · Python · Spark

LinkedIn Portfólio Email

Áreas de atuação: pipelines de dados, otimização de T-SQL e modelagem


cat sobre.md

Construo e mantenho estruturas de dados que precisam funcionar em produção — de modelos e pipelines até a consulta crítica que não pode atrasar a operação.

Hoje sou responsável pela estrutura de dados de um CRM jurídico em produção: modelo relacional, views, índices, constraints, otimização de consultas e automações em Python. As implantações são feitas em conjunto com o time de DBA.

Antes disso, trabalhei com dados financeiros e contábeis, processando grandes volumes com SQL e Python, construindo dashboards no Power BI e desenvolvendo análises de anomalias, fluxo de caixa e rentabilidade.

mikhael@data-engineering:~$ ./focus --list


ls -la ./projetos

01 · Pipeline ELT de preços da ANP

Azure Data Factory SQL Server T-SQL Data Warehouse

Pipeline metadata-driven para ingerir e modelar 20 anos de preços semanais da ANP: 219 arquivos CSV/ZIP processados em um Data Warehouse dimensional na Azure.

35,3 mi de linhas em estágio
32,2 mi de linhas na fato
~3 horas de carga histórica
8 checks com severidade e log

O problema interessante: a carga tinha projeção de 15 horas. Inlining de UDF escalar, índice clusterizado, correção de conversão implícita que invalidava seek e SCD2 set-based reduziram a execução para 3 horas reais.

Arquitetura: quatro pipelines no ADF, sem Mapping Data Flows; transformações em stored procedures T-SQL e autenticação 100% Azure AD.

02 · CDC para Data Warehouse

SQL Server CDC Python T-SQL pytest

Um OLTP sintético recebe alterações contínuas. O CDC nativo captura as mudanças e um pipeline Python/T-SQL as transforma incrementalmente em um Data Warehouse dimensional.

OLTP → CDC → LSN → transformação → SCD2 → fato → checks

  • Watermark avança na mesma transação do INSERT.
  • SCD2 com índice único filtrado.
  • Exclusão lógica preserva a auditoria.
  • Cinco checks, CLI e testes em pytest.
  • Mapeamento para Azure Data Factory.

03 · Lakehouse de dados públicos

Airflow PySpark Delta Lake MinIO DuckDB Docker

Lakehouse local sobre dados públicos de CNPJ da Receita Federal, organizado em bronze, silver e gold — sem depender de serviços pagos de nuvem.

~30 mi de estabelecimentos
2h40 de bronze a gold
5.631 → 103 arquivos
99,99999% dos CNPJs validados
30 cenários em pytest

Otimização: reparticionamento por UF, validação com expressões de coluna em vez de UDF e broadcast join para domínios.

Confiabilidade: ingestão idempotente, manifesto, hash e quality gate antes da camada gold.

04 · Streaming de propostas

MongoDB Kafka Spark Structured Streaming Delta Lake Docker

Change streams do MongoDB propagam propostas de crédito ao Kafka, materializadas em bronze, silver e gold por quatro jobs concorrentes.

Bug detectado pelos checks: 508 transições impossíveis expuseram a semântica do updateLookup. A sobreposição de updatedFields ao fullDocument reduziu o resultado a dois casos residuais conhecidos.

Gargalo removido: a troca de um .isin() com plano de 2,2 MiB por broadcast join tornou a execução independente do histórico.

at-least-once · resume token · watermark · MERGE · reconciliação


./stack --list

LINGUAGENS

SQL Python T-SQL

DADOS

SQL Server MongoDB Delta Lake DuckDB MinIO

PROCESSAMENTO

Pandas NumPy PySpark Spark Structured Streaming

ORQUESTRAÇÃO

Azure Data Factory Airflow Kafka

CLOUD & PLATAFORMA

Azure Docker

BI & QUALIDADE

Power BI pytest Data Quality Gates

MODELAGEM

Dimensional SCD Tipo 2 CDC OLTP Lakehouse


cat formacao.txt

2025—2026  Pós-graduação em Arquitetura de Software,
           Ciência de Dados e Cybersecurity · PUCPR

2023—2025  Tecnólogo em Análise e Desenvolvimento de Sistemas
           Anhanguera

echo $STATUS

+ aberto a conversas sobre oportunidades em Engenharia de Dados

Se algum dos problemas acima também aparece no seu ambiente, vamos conversar.

Pinned Loading

  1. anp-fuel-prices-elt-azure anp-fuel-prices-elt-azure Public

    Pipeline ELT no Azure para a série histórica de preços de combustíveis da ANP — Bicep, Data Factory, Azure SQL (modelo dimensional com SCD2) e Power BI, autenticação 100% Azure AD, ~32M linhas proc…

    TSQL

  2. sqlserver-cdc-to-dw sqlserver-cdc-to-dw Public

    Change Data Capture pipeline on SQL Server feeding a dimensional Data Warehouse — LSN-based incremental extraction, SCD Type 2, and quality checks in T-SQL and Python.

    TSQL

  3. cnpj-lakehouse-spark-airflow cnpj-lakehouse-spark-airflow Public

    Lakehouse local sobre o CNPJ da Receita Federal — Airflow orquestrando Spark (Delta Lake + MinIO) em bronze/silver/gold, consultado com DuckDB. Sem depender de nuvem paga.

    Python

  4. credit-proposals-streaming-mongodb-kafka credit-proposals-streaming-mongodb-kafka Public

    Pipeline de streaming quase em tempo real: change streams do MongoDB → Kafka → Spark Structured Streaming → Delta Lake, com exatamente-uma-vez e tratamento de dado atrasado.

    Python

  5. bcb-macro-elt-python-dbt bcb-macro-elt-python-dbt Public

    Pipeline ELT em Python e dbt sobre as APIs do Banco Central: projeções do Focus contra o realizado do SGS, com SCD Tipo 2 sobre revisões de série.

    Python

  6. data-observability-multi-backend data-observability-multi-backend Public

    Serviço de observabilidade de dados em Python: frescor, volume, schema e distribuição calculados na origem, sobre DuckDB, SQL Server e Delta.

    Python