Исследователи Veracode протестировали более 100 моделей на стандартизированных задачах, где нейросети справлялись с написанием корректного кода почти в 100% случаев. Однако проверка безопасности показала средний результат в 56%. Примечательно, что ни размер нейросети, ни её узкая специализация на программировании не дают значительного преимущества: универсальные модели показали 52% эффективности, тогда как профильные решения остановились на 51%. Единственным фактором, влияющим на результат, стали модели с функцией «рассуждений», которые справились с задачей чуть лучше конкурентов.
Разрыв в качестве кода заметен и при сравнении языков программирования. Лидером стал Python с показателем 63%, в то время как Java продемонстрировал лишь 30%. Эксперты подчеркивают, что успешная компиляция вводит разработчиков в заблуждение, скрывая уязвимые алгоритмы внутри работающей программы. В текущих условиях автоматизированная генерация требует обязательного статического анализа и ручного контроля перед внедрением в кодовую базу, так как функциональность кода не тождественна его безопасности.
Комментарии (0)
Пока нет комментариев. Будьте первым!