Thiago de Lima Chagas, 23🇧🇷

Engenharia Analítica | Engenharia de Dados | Ciência de Dados

Profissional da área de Engenharia de Dados, com foco no desenvolvimento e manutenção de pipelines, integração e transformação de dados, modelagem e arquitetura de dados. Possui conhecimentos em Python, SQL, PostgreSQL e Snowflake, processos ETL/ELT com dbt Core e orquestração com Apache Airflow, modelagem dimensional e domínio de arquiteturas modernas de dados, além de fundamentos de infraestrutura em nuvem AWS, automação e containerização com Docker. Busca construir ambientes e pipelines escaláveis, confiáveis e eficientes, garantindo a qualidade e a disponibilidade dos dados para apoiar a tomada de decisões.

Experiência

Estagiário em BI na GF Innovation

• Documentei e analisei as tabelas existentes do legado, criando um dicionário de dados como referência para times de negócio. • Projetei e implementei uma arquitetura de lakehouse, com deploy de infraestrutura própria na AWS — EC2 hospedando o orquestrador Airflow e RDS hospedando o banco PostgreSQL como data warehouse — e CI/CD configurado para automatizar validações e o próprio deploy. • Desenvolvi um pipeline ELT completo a partir de um banco legado financeiro, cobrindo todo o ciclo de vida dos dados da ingestão à entrega para áreas de negócio. • Implementei transformações com dbt e orquestração com Airflow, garantindo pipelines confiáveis, versionados e documentados (arquitetura medallion: raw → intermediate → marts). • Estabeleci monitoramento e governança do pipeline com uma camada de testes dbt (dbt tests) configurável via switch, atuando como gate de qualidade antes da entrega aos times de negócio. • Mantive um dashboard em Streamlit para consumo direto dos dados processados pelas áreas de negócio, incorporando análises de correlação, métricas estatísticas de negócio, séries temporais, churn de clientes e classificação ABC (rating A/B/C). • Atuei em squad ágil (Scrum/Kanban), entregando incrementos do pipeline de forma contínua e em sincronia com as áreas de negócio.

Python
dbt
AWS
Airflow
Streamlit
Docker
Polars
Postgresql
Assistente Administrativo na Rancho La Florida LTDA

• Atendimento ao cliente e suporte em reservas, incluindo resolução de solicitações e problemas no check-in/check-out. • Gestão de registros e dados de hóspedes, mantendo histórico organizado para consultas e relatórios. • Apoio em rotinas administrativas (controle de agenda, planilhas e comunicação interna). • Organização de processos manuais, criando padronização para tarefas recorrentes do dia a dia da operação.

Exel
Airbnb
Booking

Formação

Técnologo em Análise e Desenvolvimento de Sistemas na Centro Universitário de Itajubá
Técnico Integrado em Informática na Instituto Federal de Ciência e Tecnologia de São Paulo
Pós-graduação em Engenharia de Dados na Data Science Academy

10 de ago. de 2026 — Atual

Projetos

Data Dictionary Framework

• Criei e publiquei o ddf no PyPI (pip install ddf-framework), com documentação própria disponível em (thiagolimac.github.io/ddf) - o ddf é um framework Python que extrai a estrutura completa de um banco relacional (PostgreSQL/MariaDB) e gera, a partir de uma única extração, projeto dbt rodável, documentação Markdown navegável e contexto estruturado para consumo por agentes de IA. • Projetei paralelismo em dois níveis na extração: entre tabelas (ThreadPoolExecutor, com sucesso parcial onde falha isolada em uma tabela não aborta o lote) e, dentro de uma mesma tabela acima de 500.000 linhas, particionando a leitura em faixas paralelas via connectorx (decodificação em Rust fora do GIL do Python), validando ganho de 2.7–4x em benchmark contra Postgres e MariaDB reais. • Implementei curadoria humana persistente via overrides YAML com descrições e regras de negócio sobrevivem a reextrações, com detecção de mudança estrutural por hash e alerta explícito ao usuário. • Gerei testes de qualidade de dados sugeridos deterministicamente a partir de métricas reais da amostra (not_null, unique, relationships, accepted_values com limiar de cobertura) no projeto dbt produzido dado que mesma métrica sempre produz a mesma sugestão, sem heurística estatística imprevisível. • Implementei geração automática de documentação por tabela (Markdown navegável, com estrutura, restrições, amostragem e métricas de qualidade), eliminando o trabalho manual de manter um dicionário de dados atualizado. • Desenvolvi um gerador de contexto estruturado para agentes de IA (JSON), com grafo de relacionamentos bidirecional a partir de chaves estrangeiras reais e chunks endereçáveis por tabela, permitindo que um agente consulte a estrutura do banco sem precisar de acesso direto à fonte de dados. • Mantive CI/CD (GitHub Actions) com mypy–strict, ruff e testes de integração contra Postgres/MariaDB reais via testcontainers, cobrindo caminho feliz, erro esperado e casos de borda em todo componente novo.

Python
PostgreSQL
MariaDB
dbt-core
Pydantic
Polars
CI/CD

Habilidades

Engenharia de Dados e Infraestrutura
SQL
Postgresql
Snowflake
dbt
Airflow
ETL/ELT Pipelines
AWS
Dockers
Ciência e Análise de Dados
Python
Pandas
Polars
Plotly
Sckit-learn
Streamlit
Desenvolvimento
Java
Spring Boot
C#
ASP.NET

Idiomas

Inglês — Básico