Перейти к содержанию

Заключение и выводы


1. Основные научно-практические результаты работы

В ходе реализации проекта был выполнен комплексный аналитический аудит и структурированная предобработка высокоразмерного набора данных сетевой безопасности CSE-CIC-IDS2018. Ключевые результаты проведенного исследования включают в себя следующие положения:

  • Экспертный аудит структуры данных: Проведен детальный анализ архитектуры более чем 80 признаков сетевой активности. Определены ключевые группы метрик, описывающие временные, объемные и скоростные характеристики двунаправленных сетевых потоков, а также структуру распределения целевой переменной.
  • Идентификация и локализация дефектов: Выявлены и классифицированы критические аномалии исходной выборки, способные исказить математический аппарат предиктивных моделей. Локализована природа возникновения пропущенных значений (NaN), бесконечностей (inf / -inf), а также системных ошибок типизации, вызванных замусориванием выборки строками-заголовками при слиянии файлов.
  • Математическая очистка признакового пространства: Успешно устранены все выявленные деструктивные факторы и некорректные типы данных. Итоговая матрица признаков приведена к строго числовому формату без потери содержательной целостности и репрезентативности ключевых классов сетевого трафика.
  • Статистическое профилирование и визуализация: На основе обработанных данных сформирован комплекс аналитических графиков (матрицы корреляции, гистограммы плотности распределений, диаграммы размаха). Это позволило изолировать мультиколлинеарные признаки, оценить степень дисбаланса классов и определить физический характер экстремальных статистических выбросов, отражающих аномальную природу сетевых атак.

2. Практическая значимость и применимость результатов

Сформированный в результате работы валидный массив данных обладает высокой степенью внутренней чистоты и полностью готов к интеграции в конвейеры машинного обучения (Machine Learning Pipeline).

Полное отсутствие математического шума (пропусков и бесконечностей) исключает риск расхождения градиентов и появления неопределенностей при вычислении функций потерь. Подготовленный датасет может непосредственно применяться для обучения, валидации и тестирования широкого спектра классификаторов (таких как алгоритмы на основе решающих деревьев, ансамблевые методы Gradient Boosting / Random Forest и нейронные сети), направленных на автоматическое обнаружение, классификацию и детекцию распределенных кибератак в современных системах информационной безопасности (IDS).


3. Освоенные компетенции и профессиональные навыки

Участие в проекте позволило закрепить на практике ряд ключевых инженерных, аналитических и командных компетенций:

  • Работа с высокоразмерными данными (Big Data): Приобретен практический опыт оперирования тяжелыми массивами данных, а также оптимизации типов данных для снижения нагрузки на вычислительные ресурсы (ОЗУ) при трансформации табличных структур.
  • Профессиональный контроль версий (Git / GitHub): На высоком уровне освоены механизмы фиксации истории изменений, управления ветвлением проекта, синхронизации локального и удаленного репозиториев, а также развертывания статической документации средствами CI/CD.
  • Командная разработка (Collaborative Development): Получен опыт распределения зон ответственности внутри инженерной группы (Collaborators), согласования изменений, решения конфликтов слияния и координации действий при параллельном ведении аналитической и программной частей проекта.
  • Эксплораторный анализ и визуализация (EDA): Углублены навыки применения методологий статистического анализа данных, выявления скрытых взаимосвязей, мультиколлинеарности признаков и наглядного графического представления сложных многомерных распределений.