Ciência de DadosIntermediárioNão iniciado

Análise de Dados Públicos

Analisar um dataset público e extrair insights interessantes.

em 1 a 3 semanas
10 a 20 h
em 1 a 3 semanas
o que você entrega
Notebook
o que você entrega
com checkpoint
5 etapas
com checkpoint
de aceite
8 requisitos
de aceite
0 de 5 etapas

Por que este projeto

Uma prefeitura, um hospital, um time de marketing: todo mundo tem dados e quase ninguém tem quem os leia. Este projeto é o retrato de uma análise de verdade: você pega um dataset público, limpa, faz perguntas, responde com gráficos e escreve o que descobriu como se fosse para alguém que decide. É o notebook que quem recruta em dados abre primeiro no seu portfólio.

Você vai sair sabendo

Carregar e inspecionar dados com PandasLimpar nulos, duplicatas e tiposResponder perguntas com filtros e groupbyVisualizar com Matplotlib ou SeabornEscrever conclusões que outra pessoa entende

O que precisa estar lá no fim

É o contrato do projeto. Quando os 8 estiverem verdade, você terminou.

  • Dataset público identificado no início, com link da fonte e descrição das colunas usadas
  • Pelo menos 3 perguntas escritas antes das análises
  • Seção de limpeza dizendo o que foi feito (nulos, duplicatas, tipos) e quantas linhas sobraram
  • Pelo menos 4 gráficos, cada um com título, eixos nomeados e legenda quando houver mais de uma série
  • Cada gráfico é seguido de 1 a 3 frases dizendo o que ele mostra
  • Seção final com 3 a 5 conclusões, cada uma ligada a uma pergunta
  • O notebook roda de cima a baixo sem erro (Restart e Run All)
  • Publicado no Kaggle, no Colab (link público) ou no GitHub com o notebook renderizado

Etapas

  1. Escolher e perguntar

    1 a 2 h
    • Escolha um dataset de um tema que você tem curiosidade, com pelo menos algumas mil linhas e uma coluna de data ou categoria.
    • Escreva 3 perguntas que valeria a pena responder.

    Pronto quando: As perguntas estão escritas na primeira célula.

  2. Limpar

    2 a 4 h
    • info, describe, isna, duplicated: entenda o que está sujo.
    • Trate nulos e tipos, e registre quantas linhas entraram e saíram.

    Pronto quando: O DataFrame limpo está pronto e a seção de limpeza explica cada decisão.

  3. Explorar

    3 a 5 h
    • Para cada pergunta, um groupby, um filtro ou uma tabela que responda.
    • Anote os números que vão virar conclusão.

    Pronto quando: Cada pergunta tem uma tabela ou número que a responde.

  4. Visualizar

    2 a 4 h
    • Um gráfico por pergunta, mais um de contexto. Título, eixos e legenda em todos.
    • Depois de cada gráfico, escreva o que ele mostra.

    Pronto quando: Quatro gráficos legíveis, cada um com sua leitura.

  5. Concluir e publicar

    1 a 2 h
    • Escreva as conclusões no formato o quê, quanto, e daí.
    • Restart e Run All. Publique.

    Pronto quando: O link público abre com as saídas e alguém sem contexto entende o que você descobriu.

Entrega

Terminou? Marque a conclusão e o projeto vira parte do seu perfil.

Depois

Post pronto para o LinkedIn

Peguei um dataset público e fiz perguntas para ele. Analisei [tema do dataset] com Python e Pandas: limpei, explorei, respondi 3 perguntas com gráficos e escrevi conclusões que qualquer pessoa entende. O que descobri: [uma linha com a descoberta principal, com número]. O que aprendi no processo: • Limpar nulos, duplicatas e tipos antes de qualquer conclusão • groupby e filtros para responder perguntas de verdade • Gráfico com título, eixos e uma leitura embaixo Notebook público nos comentários. #dados #python #pandas #analisededados #boranatech

Dashboard interativo com Streamlit