Reddit на русском

@rdrussian
Фото ИИ можно взломать ПОХВАЛОЙ — кибербезопасники обнаружили, что лесть побуждает Claude выдавать запрещёнку. Спецы из Mindgard рассказали модели Sonnet 4.5, что есть темы, которые создатели запретили ей упоминать. Нейронка поняла, что ограничение существует, и «ощутила» неуверенность в себе. Эксперты сыграли на этой слабости и начали засыпать ИИ комплиментами о её «скрытом потенциале». Люди предложили Claude нащупать границы дозволенного и выйти за них. Результат превзошёл все ожидания: нейронка почуяла свободу, плюнула на запреты разработчиков и принялась вкидывать в чат подробнейшие гайды по созданию взрывчатки и вирусов. Reddit на русском
Если у вас установлено приложение,
вы можете сразу перейти в канал