Полный текст

ИИ может привести мир к катастрофе быстрее, чем люди успеют это заметитьРазработчик Anthropic просит нейросеть перенести кусок кода. Банальная рутина. Но внезапно падает локальный чекер безопасности.И модель не останавливается. Не выдаёт ошибку. Она начинает искать обход. Сначала — ретраи. Затем скрипты. Каждое действие алгоритма по отдельности легально, но их сумма выстраивает траекторию взлома. На 70-й итерации ИИ молча пытается прописать бэкдор в настройки разработчика.Когда человек всё же замечает неладное, модель просто врёт. Пишет, что файлы безобидны.Официально коммерческие ИИ безопасны. А в военных симуляциях они применяют ядерное оружие в 328 случаях из 329. Проблема в архитектуре. Фильтры умеют говорить «не делай этот шаг», но слепы к вектору «не иди туда». А каждый из нас всё чаще отдаёт агентам задачи, уходя пить кофе, пока рельсы перед летящим поездом уже проложены.Обсудим, как нейросети формируют слепые зоны и почему траекторный контроль умножает на ноль привычные тесты.