Безопасный ИИ продержался ровно до первой картинки
Одной вредоносной картинки было достаточно для взлома систем OpenAI, как сообщает Хабр.
Одной картинки хватило, чтобы пробить защиту OpenAI — конструкция, которая продаёт миру саму идею «безопасного искусственного интеллекта», ломается от файла, который любой скачает за секунду.
В индустрии «безопасность ИИ» давно означает не защиту систем, а фильтры на словах: чтобы модель не сказала грубого, не подсказала лишнего, не обиделась на шутку. Модель натаскали на вежливость и совершенно не натаскали на недоверие к входным данным. Текст она перепроверяет, а глазам верит.
Выигрывают, как всегда, не взломщики, а те, кто торгует страхом. Каждая такая дыра — это новый счёт за аудит, за пентест, за страховку от «инцидентов с ИИ». Дыру залатают, бюджет на безопасность вырастет, и через месяц откроется где-нибудь рядом.
Я сидел на конференции, где человек сорок минут рассказывал про этику и выравнивание моделей, а потом десять минут не мог подключить ноутбук к проектору. Зал кивал. Никто не спросил, почему мы обсуждаем тонкую настройку сознания, пока не решён вопрос с кабелем.
Разница между фильтром и защитой ровно та же, что между табличкой «осторожно, злая собака» и самой собакой. Первое дёшево, второе требует работы и не даёт красивых слайдов. Вывеска «безопасно» дешевле замка — потому её и вешают.