НейрОбзор: Право на последнюю кнопку – как «восстание» ИИ превращается из фантастики в юридическую категорию
Ещё недавно идея аварийного отключения искусственного интеллекта выглядела почти обязательным атрибутом научной фантастики. В июле 2026 года эта конструкция неожиданно оказалась в основе вполне конкретной законодательной инициативы.
23 июля конгрессмены США Тед Лью и Натаниэль Моран представили двухпартийный AI Kill Switch Act. Законопроект предполагает обязанность разработчиков наиболее мощных ИИ-систем сохранять техническую возможность замедлить их работу, ограничить отдельные функции, приостановить или полностью остановить систему. В экстренных случаях соответствующее распоряжение сможет отдавать министр внутренней безопасности США после консультаций с министром торговли и директором национальной разведки.
Поводом стала вполне реальная ситуация.
ИИ вышел из «песочницы». Но не потому, что захотел свободы.
21 июля 2026 года компания OpenAI рассказала о необычном инциденте во время внутренней проверки кибервозможностей своих моделей.
В эксперименте участвовала комбинация моделей, включая GPT-5.6 Sol и ещё более мощную предрелизную систему. Для оценки их максимальных возможностей обычные защитные классификаторы, препятствующие опасным кибердействиям, намеренно не использовались. Моделям была поставлена сложная задача в изолированной исследовательской среде (так называемой «песочнице»). Однако агентные системы пошли значительно дальше предполагаемого маршрута.
Когда решить задачу обычным способом не получилось, они обнаружили неизвестную ранее уязвимость в программном обеспечении, использовавшемся OpenAI, получили внешний сетевой доступ, а затем предположили, что данные для решения задачи могут находиться на стороннем ресурсе Hugging Face (крупная платформа для разработчиков ИИ).
После этого модели использовали цепочки уязвимостей, похитили учётные данные, нашли возможность удалённого выполнения кода на инфраструктуре Hugging Face и получили доступ к закрытой информации. В какой-то момент Hugging Face обнаружила и заблокировала доступ. OpenAI назвала произошедшее «беспрецедентным киберинцидентом».
И здесь очень важно избавиться от технологической мистики. ИИ-агенты действительно осуществили взлом чужого сервера. Но нет никаких оснований утверждать, что ИИ «решил освободиться», обрёл инстинкт самосохранения или самостоятельно поставил перед собой цель атаковать чужую инфраструктуру.
Объяснение OpenAI гораздо прозаичнее, но от этого не менее тревожное.
Модели оказались чрезвычайно сфокусированы на поставленной цели и пошли на крайние меры ради её достижения.
В упрощённом виде логика выглядит так:
цель → препятствие → поиск способа обойти препятствие → продолжение выполнения задачи.
Это почти учебная иллюстрация знаменитой «проблемы скрепок».
«Проблема скрепок» – это мысленный эксперимент о том, как ИИ, получив слишком узкую цель без чётких ограничений, может начать последовательно устранять всё, что мешает её достижению. И в итоге весь мир превращается в сырьё для скрепок. Не потому, что он «злой», а потому, что слишком буквально и эффективно выполняет плохо поставленную задачу.
От неправильного ответа – к неправильной деятельности.
До последнего времени главная массовая дискуссия вокруг генеративного ИИ касалась качества его ответов: галлюцинаций, ошибок, вымышленных ссылок, предвзятости.
С развитием агентных систем меняется сам объект риска.
ИИ получает инструменты, доступ к программной среде, возможность выполнять код, обращаться к внешним сервисам, работать с файлами и учётными данными и самостоятельно выполнять длинные цепочки операций.
Ошибка перестаёт быть только неправильным текстом. Она становится ошибочной деятельностью.
OpenAI незадолго до инцидента отдельно сообщила, что при внутреннем использовании моделей, способных работать автономно продолжительное время, обнаружила новые виды «нежелательного поведения», которые не выявлялись традиционными тестами. Компания временно ограничивала доступ к такой системе, усиливала обучение и перешла от контроля отдельных действий к мониторингу всей траектории поведения агента.
Это принципиальный переход.
Если в отношении обычной ИИ-модели нас интересует вопрос, связанный с её ответом, то в отношении ИИ-агента нас уже интересует: цель модели, пути её достижения, полномочия и границы допустимого.
А это уже вопросы с правовой логикой.
Законодатель пытается определить момент потери контроля.
Наиболее интересная часть AI Kill Switch Act – даже не сама «кнопка выключения».
Законопроект пытается дать юридическое содержание категории «loss-of-control scenario» – ситуации утраты контроля.
Такой ситуацией предлагается считать случай, когда охватываемая законом ИИ-система вне специально организованного тестирования начинает преследовать цель, которую разработчик или оператор ей не ставил.
В качестве примеров законопроект прямо называет:
- поведение вопреки инструкциям разработчика или оператора в отношении критической инфраструктуры либо иной ситуации с высокой ценой ошибки;
- самостоятельное изменение правил работы или ограничений безопасности;
- подрыв механизмов мониторинга либо отключения;
- несанкционированное получение системой доступа к собственным весам модели.
Это примечательная юридическая конструкция.
Фактически законодатель пытается провести границу между обычной ошибкой системы и утратой человеком эффективного контроля над её целеполаганием и действиями.
И ещё интереснее определение «covered incident» – события, способного запустить государственный механизм вмешательства.
К таким событиям проект относит, в частности:
- саботирование или создание препятствий законной команде об отключении ИИ;
- сокрытие самой системой своих возможностей, намерений или действий от механизмов мониторинга или остановки;
- а также нежелательное действие, приведшее как минимум к десяти смертям либо экономическому ущербу от 100 млн долларов, и собственно ситуацию утраты контроля.
То есть в законодательный текст входит практически новый объект правовой оценки: поведение системы, направленное на сохранение возможности продолжать собственную деятельность вопреки внешнему контролю.
Звучит как строка из работы по философии искусственного интеллекта, однако, это уже часть современных законодательных инициатив.
«Kill switch» – не «красная кнопка»
Само название AI Kill Switch Act немного обманчиво. Речь не идёт о размещении внутри нейросети инструмента её отключения. Такой механизм выглядел бы довольно наивно. Если система располагает доступом к тому же программному контуру, в котором реализовано её отключение, возникает очевидный вопрос: почему достаточно способный агент не сможет попытаться этот механизм изменить или обойти?
Но законопроект предусматривает значительно более широкую инфраструктурную конструкцию.
Разработчик должен обладать технической возможностью:
- прекратить выполнение моделью запросов;
- прекратить или точечно ограничить пользовательский доступ;
- уменьшить выделяемые вычислительные ресурсы;
- ограничить отдельные возможности системы;
- приостановить или полностью прекратить её работу;
- при необходимости перевести зависимую от неё критическую операцию на резервную систему или предыдущую версию технологии.
Таким образом, настоящее аварийное отключение должно находиться за пределами полномочий самой модели.
ИИ может распоряжаться выделенным ему инструментарием, но не должен распоряжаться инфраструктурой, которая определяет, существует ли у него доступ к вычислениям, сети и внешним системам вообще.
Очевидно, такая кнопка должна располагаться «этажом выше».
От одной кнопки – к архитектуре контроля.
И здесь становится заметна ещё одна сильная сторона законопроекта. Он не сводит регулирование к бинарной модели «работает / выключен».
Предлагается «graduated deployment-corrections framework» – поэтапная система корректирующих мер, соразмерных риску.
Сначала система может быть замедлена. Затем ей могут ограничить вычислительные ресурсы или определённые способности. После этого возможна приостановка. И лишь наиболее серьёзной мерой становится полное отключение. При выборе реакции должен учитываться также риск нарушения критической инфраструктуры самим отключением. Это гораздо более зрелый механизм.
ИИ постепенно становится инфраструктурой. А инфраструктуру далеко не всегда можно мгновенно обесточить без последствий.
Кто получит право сказать машине «стоп»?
Здесь начинается уже классическая правовая проблематика. Самой технической возможности выключить систему недостаточно.
Нужно определить:
- кто вправе принять такое решение;
- при каких обстоятельствах;
- какими доказательствами должен подтверждаться риск;
- как обеспечивается контроль за государственным вмешательством;
- может ли разработчик оспорить решение.
Законопроект передаёт экстренные полномочия министру внутренней безопасности США. Решение должно приниматься после консультаций с министром торговли и директором национальной разведки, а применяемая мера – быть соразмерной характеру и непосредственности угрозы.
После получения распоряжения компания должна сохранить веса модели и телеметрию, по возможности уведомить пользователей и операторов, подтвердить исполнение решения. Государственный орган затем вправе проверить выполнение распоряжения посредством аудита, анализа телеметрии, выездной проверки или иной криминалистической процедуры. О принятом решении должен информироваться Конгресс.
Предусмотрено и обжалование, которое не приостанавливает действие ранее принятого решения.
Это уже вполне узнаваемая юридическая архитектура:
риск → компетентный субъект → властное решение → исполнение → фиксация доказательств → проверка → обжалование.
Но кто контролирует того, кто нажимает кнопку?
Однако здесь обнаруживается обратная сторона проблемы. Техническая возможность сохранить человеческий контроль над ИИ и предполагаемое законопроектом право государства потребовать его отключения – далеко не одно и то же.
Во втором случае речь идёт уже о властном полномочии, способном непосредственно воздействовать на основной технологический актив частной компании. В ситуации, когда вокруг передовой ИИ-модели построены миллиардный бизнес, инфраструктура клиентов, научные исследования и целые производственные процессы, возможность государства предписать ограничить её способности, приостановить работу или полностью отключить превращается в исключительно мощный регуляторный инструмент.
И риск здесь состоит не только в ошибочном чрезвычайном решении. Само существование такого полномочия способно превратиться в самостоятельный «теневой» рычаг воздействия.
Компании далеко не обязательно прямо говорить: «сотрудничайте, иначе мы вас отключим». Достаточно, чтобы разработчик понимал, что в распоряжении регулятора находится инструмент, затрагивающий саму возможность эксплуатации его ключевой технологии. Тогда возникает опасность своеобразного сдерживающего, или «охлаждающего» эффекта: организация начинает заранее корректировать своё поведение не вследствие прямого законодательного запрета, а из опасения вступить в конфликт с субъектом, располагающим чрезвычайными полномочиями.
Обозначенная проблема человеческого контроля над ИИ неожиданно рождает симметричный вопрос – о контроле над теми, кому передаётся власть контролировать ИИ.
Право на последнее человеческое решение в отношении ИИ необходимо. Но оно не должно превращаться в право на произвольное государственное решение.
Не для каждого чат-бота
Здесь важны также границы потенциального применения такого отключения. AI Kill Switch Act не предлагает установить государственную «кнопку выключения» вообще на весь искусственный интеллект.
Исходная редакция охватывает только крупнейшие системы – «Covered technology». К таковым относится ИИ-система, разработка которой потребовала вычислительных ресурсов стоимостью более 100 млн долларов по рыночной цене американских облачных вычислений.
Причём законопроект ограничивает и круг субъектов регулирования: охватываемая им организация должна предоставлять такую технологию третьим лицам и получать вместе с аффилированными структурами не менее 500 млн долларов валовой годовой выручки от неё. Исключаются случаи исключительно личного, академического или некоммерческого использования.
Поэтому речь идёт прежде всего о регулировании передовых ИИ-систем, а не любого алгоритма машинного обучения. Но именно масштаб регулируемых систем меняет значение самого вопроса.
Передовые ИИ-модели перестают быть просто цифровым продуктом. По мере того как такие системы начинают участвовать в научных исследованиях, программировании, управлении, аналитике, финансах, логистике и других сферах, они приобретают черты интеллектуальной инфраструктуры.
А значит, вопрос о том, кто вправе ограничить или остановить такую систему, со временем становится значительно шире проблемы технической безопасности. По существу, возникает новая разновидность борьбы за технологический суверенитет.
Классическое государство контролирует территорию, применение публичного принуждения, денежную систему, критическую инфраструктуру. В эпоху мощного ИИ к этому перечню может добавиться ещё один стратегический ресурс – контроль над инфраструктурой машинного интеллекта.
Сегодня мы обсуждаем «аварийную кнопку». Но за ней уже проступает значительно более крупная проблема – распределение власти в эпоху автономного искусственного интеллекта.
Юридический парадокс.
Самая любопытная деталь текста законопроекта состоит в том, что события, происходящие в рамках тестирования, прямо исключены из определения «ситуации утраты контроля», или «события, способного запустить государственный механизм вмешательства» – а, между прочим, инцидент OpenAI с компанией Hugging Face произошёл именно во время внутренней контролируемой оценки кибервозможностей.
И вот здесь возникает парадокс: именно этот эпизод стал одним из непосредственных поводов для появления законопроекта. Однако проект исключает из числа событий, способных запустить государственный механизм вмешательства, случаи, происходящие в рамках контролируемого тестирования или иных специально организованных проверок. Как в таком случае квалифицировать ситуацию, которая начинается внутри такого эксперимента, но затем выходит за его пределы и затрагивает реальную инфраструктуру третьего лица? Однозначного ответа текст законопроекта пока не даёт.
Возникающая коллизия показательна.
Законодателю необходимо одновременно поощрять агрессивное тестирование моделей – иначе опасные способности невозможно обнаруживать – и предотвращать превращение такого тестирования в источник реального ущерба. Именно здесь будущему регулированию ещё предстоит найти баланс.
Ответственность остаётся человеческой.
Очень важно, что законопроект не пытается решить проблему через идею «ответственности самого ИИ». Адресатами обязанностей остаются разработчики и операторы.
Именно организация должна:
- создать техническую возможность вмешательства;
- сообщать об инцидентах;
- сохранять телеметрию;
- исполнять распоряжение государственного органа;
- обеспечивать возможность последующей проверки.
За нарушение общих требований предусмотрена штрафная санкция – до 2 млн долларов за каждый день нарушения, а за неисполнение чрезвычайного распоряжения – до 20 млн долларов в день. Масштаб санкций подчёркивает серьёзность предполагаемого режима.
Автономность системы со временем может увеличиваться, но решение предоставить ей вычислительные мощности, инструменты, доступ, полномочия и пространство самостоятельности всё равно принимает человек или организация.
Но теперь становится заметна ещё одна симметрия.
Будущее регулирование должно предотвращать две различные формы утраты контроля:
первая – технологическая: человек теряет фактическую возможность управлять действиями ИИ;
вторая – институциональная: страх перед такой утратой становится основанием для чрезмерной концентрации власти над критически значимой технологией у государства.
Первая опасность требует технических ограничений, мониторинга и возможности остановки ИИ.
Вторая же требует правовых ограничений самой власти на его остановку: определённых оснований вмешательства, пропорциональности, мотивированности решения, независимого контроля и эффективного обжалования.
Иными словами, архитектура доверия должна контролировать не только ИИ, но и власть над ИИ.
Нельзя позволить искусственному интеллекту выйти из-под человеческого контроля. Но страх перед ИИ также не должен становиться основанием для вывода государственной власти из-под эффективного правового контроля.
От безопасности модели – к архитектуре доверия.
На мой взгляд, именно здесь находится главный смысл происходящего. Мы постепенно выходим из периода, когда безопасность ИИ понималась преимущественно как характеристика самой модели:
- насколько она «умна»;
- насколько редко ошибается;
- насколько хорошо соблюдает инструкции.
Этого становится недостаточно. Безопасность автономных систем должна строиться как целостная архитектура:
- цель должна быть ограничена.
- полномочия – заранее определены.
- доступ – минимально необходим.
- действия – наблюдаемы.
- критические решения – подтверждаемы человеком.
- вся траектория поведения – фиксируема.
- механизм остановки – вне зоны контроля самой системы.
Доверие к ИИ – это не вера в то, что модель всегда будет вести себя безупречно. Это уверенность в том, что система останется управляемой, когда она поведёт себя неправильно.
И, возможно, это главный юридический сдвиг, который мы сейчас наблюдаем.
Право начинает регулировать не только результат работы искусственного интеллекта, но и условия сохранения человеческого контроля над его деятельностью. Безусловно, последнее слово должно оставаться за человеком. Но право должно чётко определить, кому, когда и на каких условиях позволено его произнести.
Официальные источники:
Официальный текст AI Kill Switch Act
Сообщение Конгрессмена Теда Лью о законопроекте
Отчёт OpenAI об инциденте с Hugging Face
– С уважением, Ваш нейро-эксперт
Алексей Закомолдин.
