Engenharia Analítica | Engenharia de Dados | Ciência de Dados
Profissional da área de Engenharia de Dados, com foco no desenvolvimento e manutenção de pipelines, integração e transformação de dados, modelagem e arquitetura de dados. Possui conhecimentos em Python, SQL, PostgreSQL e Snowflake, processos ETL/ELT com dbt Core e orquestração com Apache Airflow, modelagem dimensional e domínio de arquiteturas modernas de dados, além de fundamentos de infraestrutura em nuvem AWS, automação e containerização com Docker. Busca construir ambientes e pipelines escaláveis, confiáveis e eficientes, garantindo a qualidade e a disponibilidade dos dados para apoiar a tomada de decisões.
• Documentei e analisei as tabelas existentes do legado, criando um dicionário de dados como referência para times de negócio. • Projetei e implementei uma arquitetura de lakehouse, com deploy de infraestrutura própria na AWS — EC2 hospedando o orquestrador Airflow e RDS hospedando o banco PostgreSQL como data warehouse — e CI/CD configurado para automatizar validações e o próprio deploy. • Desenvolvi um pipeline ELT completo a partir de um banco legado financeiro, cobrindo todo o ciclo de vida dos dados da ingestão à entrega para áreas de negócio. • Implementei transformações com dbt e orquestração com Airflow, garantindo pipelines confiáveis, versionados e documentados (arquitetura medallion: raw → intermediate → marts). • Estabeleci monitoramento e governança do pipeline com uma camada de testes dbt (dbt tests) configurável via switch, atuando como gate de qualidade antes da entrega aos times de negócio. • Mantive um dashboard em Streamlit para consumo direto dos dados processados pelas áreas de negócio, incorporando análises de correlação, métricas estatísticas de negócio, séries temporais, churn de clientes e classificação ABC (rating A/B/C). • Atuei em squad ágil (Scrum/Kanban), entregando incrementos do pipeline de forma contínua e em sincronia com as áreas de negócio.
• Atendimento ao cliente e suporte em reservas, incluindo resolução de solicitações e problemas no check-in/check-out. • Gestão de registros e dados de hóspedes, mantendo histórico organizado para consultas e relatórios. • Apoio em rotinas administrativas (controle de agenda, planilhas e comunicação interna). • Organização de processos manuais, criando padronização para tarefas recorrentes do dia a dia da operação.
10 de ago. de 2026 — Atual
• Criei e publiquei o ddf no PyPI (pip install ddf-framework), com documentação própria disponível em (thiagolimac.github.io/ddf) - o ddf é um framework Python que extrai a estrutura completa de um banco relacional (PostgreSQL/MariaDB) e gera, a partir de uma única extração, projeto dbt rodável, documentação Markdown navegável e contexto estruturado para consumo por agentes de IA. • Projetei paralelismo em dois níveis na extração: entre tabelas (ThreadPoolExecutor, com sucesso parcial onde falha isolada em uma tabela não aborta o lote) e, dentro de uma mesma tabela acima de 500.000 linhas, particionando a leitura em faixas paralelas via connectorx (decodificação em Rust fora do GIL do Python), validando ganho de 2.7–4x em benchmark contra Postgres e MariaDB reais. • Implementei curadoria humana persistente via overrides YAML com descrições e regras de negócio sobrevivem a reextrações, com detecção de mudança estrutural por hash e alerta explícito ao usuário. • Gerei testes de qualidade de dados sugeridos deterministicamente a partir de métricas reais da amostra (not_null, unique, relationships, accepted_values com limiar de cobertura) no projeto dbt produzido dado que mesma métrica sempre produz a mesma sugestão, sem heurística estatística imprevisível. • Implementei geração automática de documentação por tabela (Markdown navegável, com estrutura, restrições, amostragem e métricas de qualidade), eliminando o trabalho manual de manter um dicionário de dados atualizado. • Desenvolvi um gerador de contexto estruturado para agentes de IA (JSON), com grafo de relacionamentos bidirecional a partir de chaves estrangeiras reais e chunks endereçáveis por tabela, permitindo que um agente consulte a estrutura do banco sem precisar de acesso direto à fonte de dados. • Mantive CI/CD (GitHub Actions) com mypy–strict, ruff e testes de integração contra Postgres/MariaDB reais via testcontainers, cobrindo caminho feliz, erro esperado e casos de borda em todo componente novo.