Полный текст
Как пишет РуХард, ChatGPT и DeepSeek пропускают от 40 до 50 % уязвимостей в приложениях на Java и PythonГруппа компаний «Солар» проанализировала эффективность шести больших языковых моделей (large language model, LLM), которые используются для самых трудоемких этапов верификации (triage, триаж) и исправления уязвимостей кода (codefix, кодфикс) в безопасной разработке.В проектах на Java ChatGPT продемонстрировал 60,9 % точности среди облачных LMMНо в контексте безопасной разработки это означает, что модель пропускает около 40 % уязвимостей, что является довольно критичным показателем и требует дополнительных циклов проверки в «ручном» режимеDeepSeek был точен всего в 50 % случаевВ проектах на Python DeepSeek показал более 80% точности, а ChatGPT — 52,7 %. Среди on-premise моделей наиболее высокие показатели — свыше 80 % точности для языков Java и Python — продемонстрировала LLM DerTriageДругие модели в этой категории были точны в 66–67 % случаевВторой этап исследования — это исправление уязвимостей (кодфикс)Аналитики «Солара» использовали три основных критерия для оценкиОни включают количество исправлений, которые устраняют реальную уязвимость (good) или не устраняют (not good), а также точностьНа этом этапе для приложений на Java ChatGPT продемонстрировал 61,8 % точности, DeepSeek — 45,5 %, а на Python эти LLM показали 46,6 % и 44,8 % соответственноЛокальная on-premise модель DerCodeFix продемонстрировала 78,2 % точности для Java и 83,1 % для PythonАналитики Solar appScreener отмечают, что практика использования облачных LLM (ChatGPT, DeepSeek и др.) в безопасной разработке приложений наиболее распространена в сфере здравоохранения, образования, финтехе и ритейле с высокой долей операций, связанных с персональными данными клиентов, а также в робототехнике, индустриальном ПО с повышенными требованиями к безопасности кода на уровне цепочки поставокС учетом выводов исследования, облачные LLM создают дополнительные риски для кибербезопасности софтверных продуктовНехватка экспертизы и доверие к выводам ИИ без участия человека в перспективе повышают расходы бизнеса на устранение уязвимостей на более поздних этапах разработки и использования продукта в десятки разTelegram | Дзен | MAX