Исследователи Корейского института передовых технологий KAIST и лаборатории Naver AI разработали метод автоматизированного тестирования безопасности больших языковых моделей. Система создает разнообразные вредоносные запросы и проверяет, удается ли с их помощью обойти ограничения модели.