Neural Networks
Activation Functions
ReLU: max(0, x)
Sigmoid: 1 / (1 + e^-x)
Εισάγουν μη-γραμμικότητα στο μοντέλο.
Loss Functions
MSE: Σ(y - ŷ)² / n
Cross-Entropy
Μέτρηση του σφάλματος πρόβλεψης.
Machine Learning
Linear Regression
y = wx + b
Πρόβλεψη συνεχών τιμών.
Bias-Variance Tradeoff
Η ισορροπία μεταξύ απλότητας μοντέλου (Underfitting) και υπερβολικής πολυπλοκότητας (Overfitting).
NLP Concepts
Attention Mechanism
Softmax(QKᵀ / √dₖ)V
Η βάση των Transformer μοντέλων (GPT, BERT).
Tokenization
Μετατροπή κειμένου σε αριθμητικά διανύσματα.
Optimization
Gradient Descent
w = w - η * ∇J(w)
Ελαχιστοποίηση της Loss function.
Regularization
L1 (Lasso) / L2 (Ridge)
Πρόληψη Overfitting με προσθήκη ποινής στα βάρη.