{"id":51653239,"url":"https://github.com/juliasouz/ecommerce-pipeline","last_synced_at":"2026-07-14T06:01:30.238Z","repository":{"id":369953416,"uuid":"1289522765","full_name":"juliasouz/ecommerce-pipeline","owner":"juliasouz","description":"Pipeline completo para E-commerce. Inclui modelagem relacional (OLTP), Data Warehouse (Camada Raw), Mock API (FastAPI) simulando transações em tempo real, rotinas de ingestão com idempotência (Upsert), geração de dados sintéticos (Faker) e Dashboard interativo para Analytics.","archived":false,"fork":false,"pushed_at":"2026-07-07T14:54:54.000Z","size":492,"stargazers_count":0,"open_issues_count":0,"forks_count":0,"subscribers_count":0,"default_branch":"main","last_synced_at":"2026-07-07T16:21:34.123Z","etag":null,"topics":["data-analytics","data-engineering","data-pipeline","data-warehouse","ecommerce","etl","fastapi","matplotlib","pandas","postgresql","pytest","python","seaborn","sql"],"latest_commit_sha":null,"homepage":"","language":"Python","has_issues":true,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":"mit","status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/juliasouz.png","metadata":{"files":{"readme":"README.md","changelog":null,"contributing":null,"funding":null,"license":"LICENSE","code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null,"zenodo":null,"notice":null,"maintainers":null,"copyright":null,"agents":null,"dco":null,"cla":null}},"created_at":"2026-07-04T21:31:26.000Z","updated_at":"2026-07-07T14:56:29.000Z","dependencies_parsed_at":null,"dependency_job_id":null,"html_url":"https://github.com/juliasouz/ecommerce-pipeline","commit_stats":null,"previous_names":["juliasouz/ecommerce-pipeline"],"tags_count":null,"template":false,"template_full_name":null,"purl":"pkg:github/juliasouz/ecommerce-pipeline","repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/juliasouz%2Fecommerce-pipeline","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/juliasouz%2Fecommerce-pipeline/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/juliasouz%2Fecommerce-pipeline/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/juliasouz%2Fecommerce-pipeline/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/juliasouz","download_url":"https://codeload.github.com/juliasouz/ecommerce-pipeline/tar.gz/refs/heads/main","sbom_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/juliasouz%2Fecommerce-pipeline/sbom","scorecard":null,"host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":286080680,"owners_count":35448565,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2026-05-26T15:22:16.424Z","status":"online","status_checked_at":"2026-07-14T02:00:06.603Z","response_time":114,"last_error":null,"robots_txt_status":"success","robots_txt_updated_at":"2025-07-24T06:49:26.215Z","robots_txt_url":"https://github.com/robots.txt","online":true,"can_crawl_api":true,"host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["data-analytics","data-engineering","data-pipeline","data-warehouse","ecommerce","etl","fastapi","matplotlib","pandas","postgresql","pytest","python","seaborn","sql"],"created_at":"2026-07-14T06:01:29.502Z","updated_at":"2026-07-14T06:01:30.231Z","avatar_url":"https://github.com/juliasouz.png","language":"Python","funding_links":[],"categories":[],"sub_categories":[],"readme":"# E-commerce Data Pipeline e Analytics\n\nO objetivo deste projeto não é apenas hospedar código, mas sim servir como um **Guia Didático** completo sobre como os dados saem de uma transação web e se transformam em decisões de negócio em um Data Warehouse de nível de produção.\n\n---\n\n## A Arquitetura e as Fases do Projeto\n\nO projeto simula um E-commerce e foi dividido em 5 grandes pilares. Vamos passar por cada um deles para entender o *porquê* das decisões técnicas tomadas.\n\n### 1. Modelagem Relacional (OLTP)\nFoi estruturada uma base de dados transacional (**PostgreSQL**) focada em alta disponibilidade.\nFoi criada, então, a modelagem relacional aplicando conceitos de **Chaves Primárias (PK)** e **Chaves Estrangeiras (FK)** para garantir a *Integridade Referencial*. Isso significa que o banco impede anomalias, como um pedido ser pago com um cartão inexistente.\n\n![Modelo de Entidade Relacionamento](docs/er-modelo.png)\n\n### 2. Geração de Dados Sintéticos e Faker\nPara simular a realidade respeitando a LGPD, utilizou-se a biblioteca `Faker` no script `gen_seed.py`. \nAssim, foi gerado instantaneamente **50.000 pedidos** vinculados a milhares de clientes, cartões de crédito e produtos fictícios.\n\n\u003e **Utilizando o Seed:** Foi utilizado `Faker.seed(42)` no código. Ao fixar essa semente matemática, se garante a **reprodutibilidade**. Qualquer pessoa que clonar este repositório vai gerar exatamente os mesmos clientes e CPFs, mantendo o ambiente de testes padronizado.\n\n### 3. APIs e Comunicação Moderna (Mock API)\nFoi construída uma *Mock API* usando o framework **FastAPI** para expor os dados. O FastAPI funciona como um garçom, servindo os dados de faturamento do E-commerce no formato `JSON` para os scripts ETL. Todo esse fluxo foi testado previamente usando o **Postman** e iterando no código localmente.\n\n### 4. ETL e Idempotência\nNa hora de trazer os dados da API para o Data Warehouse (na Camada RAW), foram criados scripts em python (`ingest_api.py` e `ingest_csv.py`) com um conceito chamado **Idempotência**.\nImagine que um script falhe na metade ou rode duas vezes. Ele vai duplicar a receita da empresa? Não. Utiliza-se, então, a cláusula `UPSERT` (ON CONFLICT DO UPDATE) do banco de dados (que foi gerenciada através do **pgAdmin**):\n```sql\nINSERT INTO raw_pedidos (id_pedido, valor_total...)\nVALUES (...)\nON CONFLICT (id_pedido) DO UPDATE SET valor_total = EXCLUDED.valor_total;\n```\nIsso garante que o script possa rodar mil vezes e ele apenas atualizará os registros, **nunca duplicando os dados**. Esse fluxo foi valiado automatizando testes automatizados com o **Pytest**.\n\n### 5. Extraindo valor através da análise dos dados\nCom os dados seguros no DW, a análise foi realizada utilizando:\n- **Pandas**: Usado para limpar, tratar inconsistências, formatar datas e fazer cruzamentos (JOINs) massivos em memória, tudo documentado dentro de Jupyter Notebooks.\n- **Matplotlib \u0026 Seaborn**: Usados para traduzir os números em visuais e dashboards descobrindo tendências como a *Evolução da Receita Mensal* e o *Ticket Médio por Categoria*.\n\n---\n\n## Estrutura do Projeto\n\nA organização de pastas foi desenhada seguindo as boas práticas da engenharia de software e pipelines de dados:\n\n```text\n📦 ecommerce-pipeline\n ┣ 📂 db                   \n ┃ ┣ 📂 ddl                  \n ┃ ┗ 📂 seed                \n ┣ 📂 docs                 \n ┃ ┣ 📂 analytics         \n ┃ ┣ 📜 er-modelo.md       \n ┃ ┗ 📜 er-modelo.png       \n ┣ 📂 ingestion             \n ┃ ┣ 📜 ingest_api.py       \n ┃ ┗ 📜 ingest_csv.py      \n ┣ 📂 mock_api             \n ┃ ┗ 📜 main.py           \n ┣ 📂 scripts          \n ┃ ┣ 📜 gen_seed.py        \n ┃ ┗ 📜 requirements.txt   \n ┣ 📂 tests              \n ┃ ┗ 📜 test_ingest.py    \n ┣ 📜 .env.example     \n ┣ 📜 .gitignore             \n ┗ 📜 README.md\n```\n\n---\n\n## Como Executar o Projeto Localmente\n\nSiga o passo a passo abaixo para rodar esse projeto.\n\n### 1. Preparando o Ambiente Python\nCertifique-se de usar Python 3.10 ou superior:\n```bash\npython -m venv .venv\n\n# Ative no Windows:\n.venv\\Scripts\\activate\n# Ative no Mac/Linux:\nsource .venv/bin/activate\n\npip install -r scripts/requirements.txt\n```\n\n### 2. Configurando o Banco de Dados\nO projeto não expõe senhas abertamente (Segurança acima de tudo).\n1. Crie um arquivo oculto chamado `.env` na raiz do projeto, copiando e editando os valores do arquivo de modelo `.env.example`.\n2. No seu servidor local PostgreSQL (utilizando ferramentas como o pgAdmin ou terminal), crie um banco de dados limpo executando:\n   `CREATE DATABASE ecommerce_db;`\n3. Rode os seguintes schemas:\n```bash\npsql -U postgres -d ecommerce_db -f db/ddl/001_schema_inicial.sql\npsql -U postgres -d ecommerce_db -f db/ddl/002_schema_raw.sql\n```\n\n### 3. Simulando a Geração de Dados\nExecute o comando abaixo para acionar a biblioteca Python `Faker`, gerando massas sintéticas e dados demográficos para milhares de registros simulados:\n```bash\npython scripts/gen_seed.py\n```\n\n### 4. Executando a Pipeline de Ingestão (ETL)\nVocê tem duas opções disponíveis para trazer os dados da fonte original até o Data Warehouse (Camada Raw).\n\n**Opção A: Ingestão de CSV Nativa**\nPara ingestões em bulk com os arquivos gerados:\n```bash\npython -m ingestion.ingest_csv\n```\n\n**Opção B: Ingestão via API (Simulando uma Integração de Sistemas)**\nPrimeiro, vamos acordar o garçom. Suba a Mock API disparando este comando através do terminal:\n```bash\nuvicorn mock_api.main:app --reload\n```\nEm seguida, deixe esse rodando e em *outro* terminal novinho, dispare a carga HTTP:\n```bash\npython -m ingestion.ingest_api\n```\n\n### 5. Validando a Qualidade e a Segurança\nComo prova real de qualidade do código, rode a suite automatizada e deixe o Pytest atestar se os dados se mantêm únicos e corretos:\n```bash\npytest tests/\n```\n\n---\n\n## Conclusão\nNeste projeto, transitou-se livremente entre bases como Governança, Leis de Privacidade e Modelagem, mecânica via APIs, arquitetura relacional e Upsert e Notebooks para Visualizações Analíticas. \n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fjuliasouz%2Fecommerce-pipeline","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fjuliasouz%2Fecommerce-pipeline","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fjuliasouz%2Fecommerce-pipeline/lists"}