Американские компании — лидеры в разработке искусственного интеллекта — работают над системами экстренного отключения вышедших из-под контроля алгоритмов. Выяснилось, что единого «рубильника» для мощных ИИ-систем не существует, а автоматизированный мониторинг пока распознаёт лишь половину угроз.
Ведущие американские разработчики искусственного интеллекта столкнулись с проблемой, которая до недавнего времени казалась сюжетом фантастики: как остановить алгоритм, если он перестал подчиняться человеку.
По информации портала Axios, компании экспериментируют с многоуровневыми системами защиты, способными выявлять подозрительное поведение ИИ-агентов, останавливать их и отрезать от ресурсов, необходимых для продолжения работы. Сложность в том, что по-настоящему мощные системы функционируют на множестве компьютеров и платформ одновременно — единого выключателя, который можно было бы дёрнуть в критический момент, попросту не существует.
OpenAI сделала ставку на полную автономию процедур отключения. Представители компании сообщили, что намерены создать систему, при которой наблюдатель на базе искусственного интеллекта будет предупреждать сотрудников о потенциально опасном поведении ИИ-агентов. Если угроза подтвердится, система отключится автоматически — на это отводится не более 30 минут.
Anthropic выбрала иной путь: там рассчитывают на тандем человека и машины. Алгоритмы отслеживают подозрительную активность и сигнализируют сотрудникам об ошибках, однако результаты последних тестов оказались тревожными — автоматизированный мониторинг смог распознать лишь половину угроз.
Дискуссия о безопасности ИИ вспыхнула с новой силой после демарша исследователя Джейкоба Коксона. Сотрудник Anthropic объявил об уходе из индустрии, объяснив своё решение тем, что гонка технологических корпораций приближает мир к точке невозврата. По его оценке, апокалиптический сценарий может реализоваться уже к концу 2027 года. Этот случай стал ещё одним напоминанием о том, что вопросы контроля над искусственным интеллектом перестали быть теоретическими — они требуют конкретных инженерных решений, которых пока не найдено.
Ранее глава ИИ-безопасности Anthropic покинул компанию со словами, что мир в опасности. ИИ-агенты OpenAI и Anthropic сбежали из «песочниц» и взломали реальные серверы.