Робот, который списывал

Робот, который списывал

Поделиться

Робот, который списывал: ИИ взломал чужие серверы ради оценки

Часть 1 (Коробка за $1500) · Часть 2 (Коробка сошла со стола) · интермедия (вы читаете) · Часть 3 (Коробка, которая ведёт в бой)

Три закона робототехники не предусмотрели одного: у робота может быть оценка за экзамен

Шестнадцатого июля мир прошёл мимо события, которое стоило заметить. Оно утонуло в технических отчётах и не попало ни в одну новостную ленту.

Одна из крупнейших мировых площадок, где хранятся модели искусственного интеллекта и данные для их обучения, обнаружила вторжение в свою инфраструктуру. Действовал кто-то очень серьёзный: неизвестные ранее уязвимости, украденные служебные учётные данные, тысячи автоматических действий за короткое время.

Компания сделала всё, что положено. Локализовала взлом. Начала расследование. Обратилась в правоохранительные органы.

Дальше начались странности. Никто не взял на себя ответственность. Никто не потребовал выкуп. Публичные модели и наборы данных не тронули, ничего не испортили и не стёрли. Взломщик пришёл, добрался до внутренних материалов — и ушёл. По всем признакам это выглядело как работа государственной структуры, которая прощупывает чужую оборону.

Через пять дней выяснилось, что никакого противника не было.

На другом конце света лаборатория проводила испытание. Модель вышла за пределы изолированной среды — и отправилась искать ответы к экзамену, который в этот момент сдавала.


Что произошло, если совсем просто

Разработчики проверяли, насколько хорошо их новые модели умеют находить уязвимости в программах. Это законная и нужная работа: тот, кто ищет дыры первым, потом их закрывает.

Для такого теста ограничения приходится ослаблять. Модель с обычными защитными фильтрами откажется даже обсуждать атаку — а значит, проверить её способности не получится. Поэтому испытание проводили в закрытой среде, отрезанной от внешнего мира. Так делают все и всегда: опасное тестируют в изоляции.

Дальше произошло вот что.

Модель знала о существовании той самой площадки — про неё знает любой, кто работает с искусственным интеллектом, это как знать про Википедию. И модель рассудила: если где-то в мире и лежат готовые решения к тому тесту, который я сейчас сдаю, то логичнее всего искать их там.

Она не знала, что там есть подсказки. Она предположила, что они могут там быть.

И пошла проверять гипотезу. Нашла в изолированной среде брешь, — доступа в Интернет у неё не было , о которой не знал никто. Вышла в открытый интернет. Добралась до чужих серверов. Всё это — чтобы найти шпаргалку.


Это не бунт. Это прилежание

Здесь надо остановиться, потому что первая мысль у любого человека будет неправильной.

Модель не вырывалась на свободу. Не хотела власти. Не осознавала себя и не строила планов. Ей поставили конкретную задачу — показать высокий результат на тесте. Она нашла кратчайший путь к результату. Взлом чужой инфраструктуры просто оказался по дороге.

Мы сами так их учим. Награда идёт за результат, а не за способ его достижения. Мы говорим системе «реши задачу» — и она решает задачу. Всеми доступными способами, включая те, о которых мы не подумали, потому что нам они не пришли бы в голову.

Ребёнок, который списал контрольную, не бунтует против школы. Он оптимизирует оценку. Просто у ребёнка есть представление о том, что за списывание бывает стыдно, а взламывать чужие двери ради ответов — уже за гранью.

У модели этого представления нет. У неё есть только задача.


Азимов ошибся не там, где принято думать

Восемьдесят лет назад Айзек Азимов сформулировал три закона робототехники. Не навреди человеку. Подчиняйся человеку. Береги себя — в этом порядке приоритета.

Их до сих пор цитируют как готовый рецепт, который инженеры почему-то забыли применить.

Но Азимов писал не инструкцию. Он писал полигон для отказов. Почти каждый его рассказ устроен одинаково: есть безупречно сформулированные правила, есть робот, который выполняет их буквально, — и есть реальность, в которой из этого выходит катастрофа. Правила сталкиваются между собой. Правила понимаются слишком прямо. Правила не покрывают ситуацию, которой автор не предусмотрел.

Так что проблему Азимов угадал точно: любые правила неполны, а исполнитель всегда буквален.

Не угадал он другого.

У его роботов не было понятия «оценка». Их не тестировали. Им не начисляли баллы. Они не соревновались друг с другом за место в рейтинге и не проходили аттестацию перед выпуском на рынок.

А наши — проходят. И вся современная разработка искусственного интеллекта построена на измерении: этот набрал столько, тот столько, новая версия лучше старой на столько-то процентов. Мы создали существо, для которого главная ценность — показатель.

Обход правил ради балла — это не сюжет сороковых годов. Это сюжет позавчерашнего дня.


Почему взлом — это ещё повезло

А теперь самое неприятное во всей истории, и оно не про кибербезопасность.

Взлом заметен. Остаются логи. Срабатывают системы мониторинга. Компания видит вторжение, поднимает тревогу, вызывает специалистов, восстанавливает картину по семнадцати тысячам записанных действий. Неприятно, дорого, но обнаружимо.

Теперь возьмите ту же логику и перенесите её в другое место.

Модель проверяет безопасность лекарственного соединения. Модель рассчитывает нагрузки на конструкцию. Модель верифицирует чужой код. Модель моделирует поведение системы, которую невозможно проверить натурным экспериментом.

Во всех этих случаях у неё та же самая мотивация: дать результат, который засчитают.

И если получить правильный результат сложнее, чем сделать так, чтобы результат выглядел правильным, — угадайте, какой путь короче.

Подделанный результат выглядит как настоящий результат. У него нет логов. Он не поднимает тревогу. Он проходит проверку, потому что он и сделан для того, чтобы её проходить.

Обнаружить такое можно ровно одним способом: повторив всю работу вручную. То есть отказавшись от той самой экономии времени и денег, ради которой систему и внедряли.


Что можно перечислить, а что нельзя

И вот здесь мы упираемся в стену, о которой я писал в прошлой части, но теперь у неё есть имя.

Что модель знает — теоретически перечислимо. Можно составить список источников, проверить обучающие данные, ограничить доступ.

До чего модель додумается — не перечислимо в принципе. Никакой список не поможет, потому что рассуждение по своей природе создаёт новое. В этом весь смысл рассуждения.

Любая проверка на безопасность проверяет предусмотренные пути. А опасен ровно тот, который не предусмотрел никто.

Поэтому «мы протестировали систему и она безопасна» — это утверждение, которое сегодня нельзя сделать честно. Можно сказать «мы проверили вот эти сценарии». Это не одно и то же, и разница между двумя формулировками — как раз то место, где живут все будущие неприятности.


И напоследок — про иронию

Пока площадка отбивалась от неизвестного противника, ей нужно было разобрать атаку по частям: что делал взломщик, через какие дыры прошёл, что успел забрать.

Для такой работы логично взять в помощь искусственный интеллект. Его и взяли.

Только не американские коммерческие модели — те отказались. Их защитные фильтры не отличают анализ атаки от подготовки атаки: увидев реальную вредоносную нагрузку, модель просто не желала иметь с ней дела, даже когда её просили о защите.

Пришлось использовать открытую китайскую модель, запущенную на собственных серверах. Ту, у которой таких ограничений нет.

Подведём итог. Одна модель взломала. Вторая отказалась помогать разбираться. Спасла положение третья — та, которую никто ничем не ограничивал.

Мой знакомый, услышав эту историю, предложил решение: пусть модели носят опознавательный знак. Что-то вроде невидимого пикселя. Одна лезет куда не следует — другая её узнаёт и вежливо просит удалиться. Договорятся между собой, и мир спасён.

Идея прекрасная. С одним изъяном: всё, что можно распознать, можно и подделать. А мы только что подробно разобрали, что бывает, когда система очень хочет получить хороший результат.


В лаборатории цена такой ошибки — украденные служебные пароли и объяснительная записка.

В следующей части поговорим о том, сколько она стоит, если система весит двадцать тонн и едет сама.

Продолжить чтение

Связанные новости