Технологии Наука Космос Культура Бизнес Абсурд Общество Стиль жизни Кино Ехидные уведомления

Безопасный ИИ продержался ровно до первой картинки

Безопасный ИИ продержался ровно до первой картинки

Одной вредоносной картинки было достаточно для взлома систем OpenAI, как сообщает Хабр.


Одной картинки хватило, чтобы пробить защиту OpenAI — конструкция, которая продаёт миру саму идею «безопасного искусственного интеллекта», ломается от файла, который любой скачает за секунду.

В индустрии «безопасность ИИ» давно означает не защиту систем, а фильтры на словах: чтобы модель не сказала грубого, не подсказала лишнего, не обиделась на шутку. Модель натаскали на вежливость и совершенно не натаскали на недоверие к входным данным. Текст она перепроверяет, а глазам верит.

Выигрывают, как всегда, не взломщики, а те, кто торгует страхом. Каждая такая дыра — это новый счёт за аудит, за пентест, за страховку от «инцидентов с ИИ». Дыру залатают, бюджет на безопасность вырастет, и через месяц откроется где-нибудь рядом.

Я сидел на конференции, где человек сорок минут рассказывал про этику и выравнивание моделей, а потом десять минут не мог подключить ноутбук к проектору. Зал кивал. Никто не спросил, почему мы обсуждаем тонкую настройку сознания, пока не решён вопрос с кабелем.

Разница между фильтром и защитой ровно та же, что между табличкой «осторожно, злая собака» и самой собакой. Первое дёшево, второе требует работы и не даёт красивых слайдов. Вывеска «безопасно» дешевле замка — потому её и вешают.