This repository contains the implementation and benchmarking of six deep learning architectures for automated classification of Normal, Diabetic Retinopathy, Cataract, and Glaucoma from retinal fundus images.
The project performs a detailed comparison of multiple CNN models under identical preprocessing, augmentation, and training pipelines to identify the most efficient and accurate architecture suitable for real-world clinical deployment.
.ipynb_checkpoints/dataset/dataset.zip# Original compressed dataset (~753 MB)
eye-diseases-classification-DenseNet201 Final.ipynbeye-diseases-classification-EffNetb3 Final.ipynbeye-diseases-classification-IncResNetV2 Final.ipynbeye-diseases-classification-MobileNetv3L Final.ipynbeye-diseases-classification-ResNet50v2 Final.ipynbeye-diseases-classification-Xception Final.ipynbREADME.md
| Notebook | Model |
|---|---|
MobileNetv3L Final.ipynb |
MobileNetV3-Large |
EffNetb3 Final.ipynb |
EfficientNetB3 |
DenseNet201 Final.ipynb |
DenseNet201 |
Xception Final.ipynb |
Xception |
ResNet50v2 Final.ipynb |
ResNet50V2 |
IncResNetV2 Final.ipynb |
InceptionResNetV2 |
Each notebook includes the full pipeline:
- Importing dataset
- Preprocessing
- Data augmentation
- Transfer learning
- Model training
- Confusion matrix & metrics
- Grad-CAM heatmaps
- Performance summary
- Total images: 4,217
- Classes:
- Normal
- Diabetic Retinopathy
- Cataract
- Glaucoma
- Format: .jpg / .png
This project benchmarks:
- MobileNetV3-Large
- EfficientNetB3
- DenseNet201
- Xception
- ResNet50V2
- InceptionResNetV2
Common configuration:
- Transfer learning (ImageNet)
- Image size: 256 × 256
- Optimizer: Adam (lr=0.0001)
- Loss: Categorical Cross-Entropy + L2 regularization
- Epochs: 50 (with Early Stopping)
- Batch size: 32
- Validation: 10%
| Model | Accuracy |
|---|---|
| MobileNetV3-Large | 0.8483 |
| EfficientNetB3 | 0.7986 |
| DenseNet201 | 0.7536 |
| Xception | 0.7109 |
| ResNet50V2 | 0.6991 |
| InceptionResNetV2 | 0.2607 |
Lightweight architectures (MobileNet) outperform heavy ones (InceptionResNetV2) in medical imaging due to reduced overfitting and better generalization.
Each model includes:
Grad-CAM Visualizations
Saliency Maps
These highlight clinically relevant regions (optic disc, hemorrhages, microaneurysms), improving transparency for medical use.
MobileNetV3-Large emerges as the most practical architecture for real-world retinal disease screening:
Highest accuracy
Lowest computational cost
Fast inference
Suitable for edge devices & low-resource clinics
This demonstrates that efficient model design > model size for medical imaging applications.
Aashman Sarkar
Abhay Rathore
Arpan Mitra
Varun Mohanta
Jayasree Chakraborty
Sanjana Biswas
Supervisor: Dr. Ranjita Kumari Dash School of Computer Engineering, KIIT University