Um projeto de EDA profissional utilizando Pandas, Matplotlib e Seaborn para extrair insights do clássico dataset Iris.
Este repositório contém uma Análise Exploratória de Dados (EDA) realizada no famoso dataset Iris. O objetivo principal é aplicar técnicas de manipulação de dados, estatística descritiva e visualização para entender a estrutura, as distribuições e as relações entre as variáveis do conjunto de dados.
A análise parte de uma inspeção geral e aprofundando em detalhes de cada variável e suas correlações.
- Inspeção Inicial: Familiarizar-se com a estrutura do dataset (tipos de dados, dimensões, etc.).
- Validação e Limpeza: Verificar a qualidade dos dados, tratando valores nulos e duplicados.
- Análise Univariada: Entender a distribuição de cada característica individualmente.
- Análise Bivariada: Explorar a relação entre pares de variáveis para identificar padrões e correlações.
- Geração de Insights: Sumarizar as descobertas de forma clara e objetiva.
O conjunto de dados Iris é um dos mais clássicos da literatura de Machine Learning. Ele contém 150 amostras de flores de íris, divididas igualmente em 3 espécies diferentes.
Variáveis (Colunas):
sepal_length: Comprimento da sépala (em cm).sepal_width: Largura da sépala (em cm).petal_length: Comprimento da pétala (em cm).petal_width: Largura da pétala (em cm).species: A espécie da flor (variável alvo).
Espécies (Classes):
SetosaVersicolorVirginica
O projeto foi desenvolvido inteiramente em Python, utilizando as seguintes bibliotecas:
- Pandas: Para manipulação e análise dos dados.
- Matplotlib: Para a criação de gráficos base.
- Seaborn: Para visualizações estatísticas mais elaboradas e esteticamente agradáveis.
- Bokeh: Utilizada para o carregamento inicial do dataset.
- Jupyter Notebook / Google Colab: Como ambiente de desenvolvimento interativo.
A análise contida no notebook segue a seguinte estrutura:
- Configuração do Ambiente: Importação das bibliotecas e carregamento dos dados.
- Inspeção Inicial: Uso de
.head(),.info(),.shapee.describe()para um primeiro contato com os dados. - Validação dos Dados: Checagem de valores nulos e duplicados. Análise da distribuição das classes (balanceamento).
- Análise Univariada e Bivariada:
- Visualização da contagem de cada espécie com gráficos de barras.
- Análise da distribuição de cada característica numérica com boxplots.
- Cálculo de medidas de tendência central (média, mediana) e de dispersão (desvio padrão, variância) agrupadas por espécie.
- Conclusões e Insights: Sumarização dos principais achados da análise.
A análise revelou padrões claros que tornam este dataset ideal para tarefas de classificação:
- ✅ Qualidade dos Dados: O dataset é de alta qualidade, sem valores nulos e com as classes perfeitamente balanceadas (50 amostras por espécie), garantindo uma base sólida para a análise.
- 🌸 Distinção da Setosa: A espécie Setosa é linearmente separável das outras duas. Suas medidas de pétala (
petal_lengthepetal_width) são significativamente menores e possuem uma dispersão muito baixa, não se sobrepondo aos valores das outras espécies. - 📈 Correlação Positiva: Existe uma forte correlação positiva entre o comprimento da pétala (
petal_length), a largura da pétala (petal_width) e o comprimento da sépala (sepal_length). Isso indica que as características da pétala são os diferenciadores mais robustos entre as espécies. - 🔬 Sobreposição Parcial: Embora as espécies Versicolor e Virginica apresentem alguma sobreposição, principalmente nas medidas da sépala, elas ainda são distinguíveis pela média e pela distribuição das medidas da pétala.
- 🎯 Potencial para Modelagem: A clara separabilidade dos grupos, especialmente da Setosa, sugere que algoritmos de classificação como Regressão Logística, SVM ou Árvores de Decisão teriam um alto potencial de sucesso e acurácia.
Abaixo estão alguns dos gráficos gerados que ilustram os insights mencionados.
Distribuição das Espécies
O gráfico de barras mostra o perfeito balanceamento do dataset.
Análise das Características por Espécie
Os boxplots mostram a distribuição de cada medida, evidenciando a separabilidade da espécie Setosa.
[Seu Nome]
- GitHub: @Voctor-367
- LinkedIn: Victor Fonteles
Este projeto está sob a licença MIT. Veja o arquivo LICENSE para mais detalhes.