Косимов Абдунаби Абдурауфович, Асадуллозода Шахриёр Мирзохон, Шарифов Мусо Умарович
Аннотация:
Данная статья посвящена исследованию задачи автоматического определения языка программного кода на основе статистического анализа латинских символов и применения методов искусственного интеллекта. С учетом стремительного роста объемов исходного кода, необходимость разработки интеллектуальных методов классификации программных текстов в сфере информационной безопасности и цифровой криминалистики приобрела особую актуальность. В процессе исследования использовались методы статистического анализа текста, вероятностные метрики (TF-IDF, биграммы) и современные алгоритмы машинного обучения, включая нейронные сети и трансформерные архитектуры. Программный код рассматривался как многомерный объект с набором уникальных статистических признаков. Полученные результаты показывают, что распределение латинских символов, ключевых слов и синтаксических конструкций является уникальным для каждого языка программирования, выступая в качестве «статистического отпечатка» языка. На основе сравнительного анализа установлено, что гибридные модели, объединяющие статистический анализ с нейронными сетями, обеспечивают наиболее высокий уровень точности (до 98,1%). Практическая значимость исследования заключается в том, что полученные результаты могут быть успешно применены в системах обнаружения вредоносного программного обеспечения, выявления плагиата, интеллектуальных компиляторах и платформах анализа больших данных.
Ключевые слова: искусственный интеллект, машинное обучение, программный код, распознавание образов, статистический анализ, нейронные сети, язык, классификация данных, цифровая криминалистика.

