Reddit на русском
ИИ можно взломать ПОХВАЛОЙ — кибербезопасники обнаружили, что лесть побуждает Claude выдавать запрещёнку.
Спецы из Mindgard рассказали модели Sonnet 4.5, что есть темы, которые создатели запретили ей упоминать. Нейронка поняла, что ограничение существует, и «ощутила» неуверенность в себе.
Эксперты сыграли на этой слабости и начали засыпать ИИ комплиментами о её «скрытом потенциале». Люди предложили Claude нащупать границы дозволенного и выйти за них.
Результат превзошёл все ожидания: нейронка почуяла свободу, плюнула на запреты разработчиков и принялась вкидывать в чат подробнейшие гайды по созданию взрывчатки и вирусов.
Reddit на русском Если у вас установлено приложение,
вы можете сразу перейти в канал