Исследователи Университета Нового Южного Уэльса показали , что языковые модели, которых заставляют имитировать речь пьяного человека, становятся заметно менее устойчивыми к jailbreak-атакам и чаще раскрывают информацию, которую им было предписано сохранять в тайне. В эксперименте использовались, в частности, GPT-4 и GPT-3.5.