Датасет взятий з Kaggle
Це вручну позначений набір даних про токсичність, що містить 1000 коментарів, зібраних із відео YouTube про заворушення у Фергюсоні в 2014 році.
- youtoxic_english.csv
- Text: Коментар.
- IsToxic: Значення True або False.
- IsAbusive: Значення True або False.
- IsThreat: Значення True або False.
- IsProvocative: Значення True або False.
- IsObscene: Значення True або False.
- IsHatespeech: Значення True або False.
- IsRacist: Значення True або False.
- IsNationalist: Значення True або False.
- IsHomophobic: Значення True або False.
- IsReligiousHate: Значення True або False.
- IsRadicalism: Значення True або False.
Цей датасет був використаний для нашого проекту класифікатора.
Наша програма використовує натреновану модель за допомогою RandomForestClassifier приймаючи від користувача коментар та виводить токсичний це коментар чи ні. Також в нашому проеті було використано TfidfVectorizer - це інструмент для перетворення колекції текстових документів в матрицю TF-IDF (Term Frequency-Inverse Document Frequency). TF-IDF - це статистичний метод для визначення важливості кожного слова в контексті тексту та в межах всього корпусу текстів.
А також RandomOverSampler з бібліотеки imbalanced-learn використовується для вирівнювання дисбалансу класів у вибірці даних. У багатьох випадках, коли у вас є нерівномірна кількість прикладів для кожного класу (даний клас має набагато менше екземплярів, ніж інший), це може призводити до неправильної роботи моделі, яка може переважати в бік класу з більшою кількістю екземплярів.

- Confusion Matrix: [[131 30] [ 54 85]]
- Precision: 0.7391304347826086
- Recall: 0.6115107913669064
- F1-Score: 0.6692913385826771
- ROC-AUC: 0.7125876938200991