-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathtrain.py
More file actions
96 lines (78 loc) · 2.96 KB
/
Copy pathtrain.py
File metadata and controls
96 lines (78 loc) · 2.96 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
import os
import numpy as np
import pickle
from collections import Counter
from sklearn.preprocessing import LabelEncoder
from sklearn.utils.class_weight import compute_class_weight
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Embedding, Bidirectional, LSTM, Dropout, Dense
from tensorflow.keras.preprocessing.text import Tokenizer
from tensorflow.keras.preprocessing.sequence import pad_sequences
from tensorflow.keras.utils import to_categorical
# Load dataset
def load_data(path):
texts, labels = [], []
with open(path, 'r', encoding='utf-8') as f:
for line in f:
line = line.strip()
if not line:
continue
parts = line.split(';')
if len(parts) == 2:
texts.append(parts[0])
labels.append(parts[1])
return texts, labels
print("Loading data...")
train_texts, train_labels = load_data("data/train.txt")
val_texts, val_labels = load_data("data/val.txt")
print(f"Samples in training: {len(train_texts)}, validation: {len(val_texts)}")
# Tokenize text
tokenizer = Tokenizer()
tokenizer.fit_on_texts(train_texts)
X_train = tokenizer.texts_to_sequences(train_texts)
X_val = tokenizer.texts_to_sequences(val_texts)
MAX_LEN = 50
X_train = pad_sequences(X_train, maxlen=MAX_LEN, padding='post', truncating='post')
X_val = pad_sequences(X_val, maxlen=MAX_LEN, padding='post', truncating='post')
vocab_size = len(tokenizer.word_index) + 1
print("Vocabulary Size:", vocab_size)
# Encode labels
label_encoder = LabelEncoder()
y_train = label_encoder.fit_transform(train_labels)
y_val = label_encoder.transform(val_labels)
num_classes = len(label_encoder.classes_)
print("Number of Classes:", num_classes)
y_train = to_categorical(y_train, num_classes=num_classes)
y_val = to_categorical(y_val, num_classes=num_classes)
# Compute class weights
y_integers = np.argmax(y_train, axis=1)
class_weights = compute_class_weight(class_weight='balanced', classes=np.unique(y_integers), y=y_integers)
class_weights = dict(enumerate(class_weights))
# Build model
model = Sequential([
Embedding(input_dim=vocab_size, output_dim=128),
Bidirectional(LSTM(64)),
Dropout(0.4),
Dense(64, activation='relu'),
Dropout(0.2),
Dense(num_classes, activation='softmax')
])
model.compile(loss='categorical_crossentropy', optimizer='adam', metrics=['accuracy'])
model.build(input_shape=(None, MAX_LEN))
model.summary()
# Train model
history = model.fit(
X_train, y_train,
validation_data=(X_val, y_val),
epochs=10,
batch_size=32,
class_weight=class_weights
)
# Save model and supporting files
print("Saving model and encoders...")
model.save("emotion_model.h5")
with open("tokenizer.pkl", "wb") as f:
pickle.dump(tokenizer, f)
with open("label_encoder.pkl", "wb") as f:
pickle.dump(label_encoder, f)
print("✅ Training complete and files saved.")