-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathStatisticsUsingRForDataScience.Rhistory
More file actions
159 lines (159 loc) · 7.05 KB
/
Copy pathStatisticsUsingRForDataScience.Rhistory
File metadata and controls
159 lines (159 loc) · 7.05 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
#Membaca dataset dengan read.csv dan dimasukkan ke variable data_intro
data_intro <- read.csv("https://storage.googleapis.com/dqlab-dataset/data_intro.csv", sep=";")
data_intro
## carilah modus untuk kolom Produk pada variable data_intro
Mode(data_intro$Produk)
## carilah modus untuk kolom Tingkat.Kepuasan pada variable data_intro
Mode(data_intro$Tingkat.Kepuasan)
sd(data_intro$Total)
#Membaca dataset dengan read.csv dan dimasukkan ke variable data_intro
data_intro <- read.csv("https://storage.googleapis.com/dqlab-dataset/data_intro.csv", sep=";")
data_intro
#melihat tipe data
str(data_intro)
## mengubah data menjadi karakter karena tidak dilakukan analisis statistik pada variabel ID Pelanggan dan nama
data_intro$ID.Pelanggan <- as.character(data_intro$ID.Pelanggan)
data_intro$Nama <- as.character(data_intro$Nama)
## melihat apakah sudah berhasil dalam mengubah variabel tersebut
str(data_intro$ID.Pelanggan)
str(data_intro$Nama)
## Mengubah data menjadi factor untuk membedakan data kualitatif dengan menggunakan functon as.factor pada variabel Jenis.Kelamin, Produk, Tingkat.Kepuasan
data_intro$Jenis.Kelamin <- as.factor(data_intro$Jenis.Kelamin)
data_intro$Produk <- as.factor(data_intro$Produk)
data_intro$Tingkat.Kepuasan <- as.factor(data_intro$Tingkat.Kepuasan)
## Melihat apakah sudah berhasil dalam mengubah variabel tersebut dengan menggunakan function str
str(data_intro$Jenis.Kelamin)
str(data_intro$Produk)
str(data_intro$Tingkat.Kepuasan)
##ESTIMASI KARAKTERISTIK
##======================================================
####### MODUS
#library(pracma)
## carilah modus untuk kolom Produk pada variable data_intro
#Mode(data_intro$Produk)
## carilah modus untuk kolom Tingkat.Kepuasan pada variable data_intro
#Mode(data_intro$Tingkat.Kepuasan)
####### MEDIAN
## carilah median untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
median(data_intro$Pendapatan)
median(data_intro$Harga)
median(data_intro$Jumlah)
median(data_intro$Total)
####### MEAN
## carilah mean untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
mean(data_intro$Pendapatan)
mean(data_intro$Harga)
mean(data_intro$Jumlah)
mean(data_intro$Total)
##SEBARAN DATA
##======================================================
####### RANGE
## carilah range untuk kolom Pendapatan pada variable data_intro
max(data_intro$Pendapatan)-min(data_intro$Pendapatan)
###### VARIANS
## carilah varians untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
var(data_intro$Pendapatan)
var(data_intro$Harga)
var(data_intro$Jumlah)
var(data_intro$Total)
###### STANDAR DEVIASI
## carilah standar deviasi untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
sd(data_intro$Pendapatan)
sd(data_intro$Harga)
sd(data_intro$Jumlah)
sd(data_intro$Total)
chisq.test(Produk~Tingkat.Kepuasan, data=data_intro)
chisq.test(data_intro$Produk, data_intro$Tingkat.Kepuasan)
t.test(Total~Jenis.Kelamin, data=data_intro)
#Membaca dataset dengan read.csv dan dimasukkan ke variable data_intro
data_intro <- read.csv("https://storage.googleapis.com/dqlab-dataset/data_intro.csv", sep=";")
data_intro
#melihat tipe data
str(data_intro)
## mengubah data menjadi karakter karena tidak dilakukan analisis statistik pada variabel ID Pelanggan dan nama
data_intro$ID.Pelanggan <- as.character(data_intro$ID.Pelanggan)
data_intro$Nama <- as.character(data_intro$Nama)
## melihat apakah sudah berhasil dalam mengubah variabel tersebut
str(data_intro$ID.Pelanggan)
str(data_intro$Nama)
## Mengubah data menjadi factor untuk membedakan data kualitatif dengan menggunakan functon as.factor pada variabel Jenis.Kelamin, Produk, Tingkat.Kepuasan
data_intro$Jenis.Kelamin <- as.factor(data_intro$Jenis.Kelamin)
data_intro$Produk <- as.factor(data_intro$Produk)
data_intro$Tingkat.Kepuasan <- as.factor(data_intro$Tingkat.Kepuasan)
## Melihat apakah sudah berhasil dalam mengubah variabel tersebut dengan menggunakan function str
str(data_intro$Jenis.Kelamin)
str(data_intro$Produk)
str(data_intro$Tingkat.Kepuasan)
##ESTIMASI KARAKTERISTIK
##======================================================
####### MODUS
#library(pracma)
## carilah modus untuk kolom Produk pada variable data_intro
#Mode(data_intro$Produk)
## carilah modus untuk kolom Tingkat.Kepuasan pada variable data_intro
#Mode(data_intro$Tingkat.Kepuasan)
####### MEDIAN
## carilah median untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
median(data_intro$Pendapatan)
median(data_intro$Harga)
median(data_intro$Jumlah)
median(data_intro$Total)
####### MEAN
## carilah mean untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
mean(data_intro$Pendapatan)
mean(data_intro$Harga)
mean(data_intro$Jumlah)
mean(data_intro$Total)
##SEBARAN DATA
##======================================================
####### RANGE
## carilah range untuk kolom Pendapatan pada variable data_intro
max(data_intro$Pendapatan)-min(data_intro$Pendapatan)
###### VARIANS
## carilah varians untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
var(data_intro$Pendapatan)
var(data_intro$Harga)
var(data_intro$Jumlah)
var(data_intro$Total)
###### STANDAR DEVIASI
## carilah standar deviasi untuk kolom Pendapatan, Harga, Jumlah, Total dari variable data_intro
sd(data_intro$Pendapatan)
sd(data_intro$Harga)
sd(data_intro$Jumlah)
sd(data_intro$Total)
##### ANALISIS DISKRIPTIF
#menampilkan nilai min, max, q1, q2, q3 untuk data numerik
#Untuk variabel bertipe character akan menampilkan panjang datanya
#Variabel bertipe factor akan menampilkan jumlah data pada masing-masing kelas
summary(data_intro)
##### ANALISIS DISKRIPTIF MENGGUNAKAN VISUALISASI
# package "plot" digunakan untuk variabel bertipe factor (visual yang dihasilkan ada bar chart)
plot(data_intro$Jenis.Kelamin)
plot(data_intro$Produk)
# package "hist" digunakan untuk variabel bertipe numerik
hist(data_intro$Pendapatan)
hist(data_intro$Harga)
hist(data_intro$Jumlah)
hist(data_intro$Total)
# cek hubungan antara variabel menggunakan "SCATTER PLOT", misal: untuk hubungan variabel pendapatan dan total
plot(data_intro$Pendapatan, data_intro$Total)
############ UJI HIPOTESIS
#cek hubungan variabel numerik
#Hubungan Pendapatan dengan Total Belanja dengan "cor.test"
cor.test(data_intro$Pendapatan, data_intro$Total)
#cek hubungan variabel kategorik
## Carilah tabulasi silang antara kolom jenis produk (Produk) dan tingkat kepuasan (Tingkat.Kepuasan) dari variable data_intro
table(data_intro$Produk, data_intro$Tingkat.Kepuasan)
## Analisis bagaimana hubungan jenis produk dengan tingkat kepuasan mengunakan uji korelasi
chisq.test(table(data_intro$Produk, data_intro$Tingkat.Kepuasan))
#pakai code dibawah ini buat chisq.test juga bisa, hasilnya sama
#chisq.test(data_intro$Produk, data_intro$Tingkat.Kepuasan)
#cek hubungan variabel kategorik dan numerik
## carilah boxplot antara variabel jenis kelamin dengan total belanja
boxplot(Total~Jenis.Kelamin, data=data_intro)
## analisis bagaimana hubungan jenis kelamin dengan total belanja mengunakan uji statistik t-test
t.test(Total~Jenis.Kelamin, data=data_intro)
#save workspace
save.image("StatisticsUsingRForDataScience.RData")
#save history
savehistory("StatisticsUsingRForDataScience.Rhistory")