О платформе оценки безопасности искусственного интеллекта Inspect

Институт безопасности искусственного интеллекта (ИИ) Великобритании 10 мая 2024 года представил платформу для тестирования безопасности ИИ Inspect. Она представляет собой библиотеку программного обеспечения, которая позволяет ученым и разработчикам систем ИИ как для коммерческого, так и государственного секторов, оценивать возможности конкретных моделей искусственного интеллекта и генерировать их оценку на основе полученных результатов. Inspect свободно доступна для всех разработчиков ИИ. Исходный код размещен в репозитории GitHub правительства Великобритании.

Выпущенная по лицензии с открытым исходным кодом, платформа может использоваться для стандартизированной оценки безопасности функций больших языковых моделей, включая их основные знания, способность рассуждать и автономные возможности. Она предоставляет множество встроенных компонентов, в том числе средства для быстрого проектирования, использования инструментов, многоходового диалога и оценок с градацией модели. Расширения базовой платформы Inspect, например, для поддержки новых методов оценки могут предоставляться пакетами высокоуровневый язык программирования Python.

Inspect разработана таким образом, чтобы быть простой в использовании, в том числе, если модель размещена в облачной среде.

Платформа оценивает безопасность моделей ИИ, используя три основных компонента:

  1. Наборы данных с примерами сценариев тестирования для оценки, включая подсказки и целевые результаты.
  2. Программные модули (решатели), которые выполняют тестовые сценарии.
  3. Вычислительные модули (счетчики), которые анализируют результаты решателей и генерируют оценку.

Inspect имеет встроенную поддержку для чтения наборов данных в форматах CSV, JSON и JSON Lines, а также из Hugging Face. Следует отметить, что интерфейс для конвейера оценки достаточно гибок, чтобы принимать данные, считываемые практически из любого источника.

Платформа имеет встроенную поддержку множества поставщиков API (OpenAI, Anthropic, Google, Mistral, Hugging Face, Ollama, TogetherAI, AWS Bedrock, Azure AI, Cloudflare) языковых моделей и может быть расширен для поддержки произвольных дополнений.

Основой оценок Inspect являются решатели, которые могут служить широкому спектру целей, включая:

  • предоставление системных подсказок;
  • оперативная разработка (например, цепочка мыслей);
  • генерация модели;
  • самокритика;
  • многооборотный диалог;
  • запуск каркаса агента.

Платформа имеет несколько встроенных инструментов, в том числе:

  • использующий Google Search API для выполнения и обобщения результатов веб-поиска;
  • позволяющие выполнять произвольные команды оболочки и код Python.

В настоящее время многие модели имеют возможность взаимодействовать с клиентскими функциями Python для увеличения своих возможностей. Inspect поддерживает регистрацию функций Python в качестве инструментов и предоставление этих инструментов моделям (в настоящее время OpenAI, Claude 3, Google Gemini и Mistral), что позволяет разработчикам оснастить модели собственным набором пользовательских инструментов для выполнения более широкого спектра задач.

В качестве одного из расширений платформы Inspect выступает текстовый редактор VS Code, облегчающий разработчикам моделей ИИ процесс работы и предоставляющий набор инструментов, в том числе:

  • встроенный просмотрщик файлов журналов оценки;
  • команды и привязки клавиш для запущенных задач;
  • команды и привязки клавиш для задач отладки;
  • панель конфигурации, которая редактирует файлы конфигурации;
  • панель задач для настройки параметров командной строки и аргументов задачи;
  • панель для просмотра всех задач, содержащихся в рабочей области.

Inspect использует асинхронную архитектуру для параллельного выполнения задач. Если поставщик моделей может обрабатывать 100 одновременных подключений, то фреймворк может использовать все эти подключения для получения максимально возможной пропускной способности. Таким образом, в данном случае ограничивающими факторами параллелизма являются не локальные параметры (например, количество ядер), а скорее то, каково базовое ограничение скорости для интерфейса пользователя с провайдером.

Выполнение вычислений с использованием высокопараллельной асинхронной архитектуры предусматривает, что вместо того, чтобы обрабатывать пакет за раз, все выборки обрабатываются одновременно. Это возможно, потому что оценки обычно используют относительно мало локальных вычислений, а большую часть времени тратят на ожидание завершения вызовов API модели и веб-запросов. Следовательно, Inspect выполняет как можно больше локальных вычислений и в то же время гарантирует, что API-интерфейсы модели не будут перенасыщены, обеспечивая максимальное количество одновременных подключений.

Согласно пресс-релизу института безопасности ИИ Великобритании, Inspect – это первая платформа для тестирования безопасности искусственного интеллекта, контролируемая государственным органом и выпущенная для широкого использования.

По заявлению британских экспертов создание Inspect и предоставление свободного доступа к ней позволит стране стать центром глобальных усилий по обеспечению безопасности ИИ и закрепит за ней позицию мирового лидера в этой области. Председатель Института безопасности искусственного интеллекта Великобритании рассчитывает, что платформа станет строительным блоком для институтов безопасности ИИ других стран, а также исследовательских организаций и научных кругов по всему миру.

Выпуск Inspect в данное время обусловлен тем, что по данным британских исследователей в течение 2024 года на рынке появятся более мощные модели искусственного интеллекта, что сделает стремление к безопасной и ответственной их разработке более актуальным.

В дальнейшем Институт безопасности ИИ, Инкубатор ИИ (Incubator for AI, i.AI) и компания Number 10 планируют собрать вместе ведущих специалистов в области ИИ из различных сфер для быстрого тестирования и разработки новых инструментов безопасности ИИ с открытым исходным кодом. Необходимо отметить, что разработчикам легче интегрировать инструменты с открытым исходным кодом в свои модели. Это дает им лучшее понимание того, как они работают и как их можно сделать максимально безопасными.

При создании Inspect сотрудники Института безопасности искусственного интеллекта Великобритании ориентировались на продукты ведущих разработчиков систем ИИ с открытым исходным кодом, в первую очередь такие проекты, как GPT -NeoX, OLMo или Pythia, которые имеют общедоступные данные обучения и лицензированный код обучения и оценки, веса моделей и частично обученные контрольные точки.

Процедура представления платформы для тестирования безопасности ИИ была проведена спустя чуть больше месяца после того, как США и Великобритания обязались работать вместе над безопасной разработкой систем искусственного интеллекта. Данное соглашение было подписано 1 апреля 2024 года министром торговли США и министром технологий Великобритании. Документ разработан в рамках решений, принятых на первом международном Саммите по безопасности искусственного интеллекта (1 – 2 ноября 2023 года, Великобритания). Кроме того, соглашение предусматривает сотрудничество институтов безопасности ИИ обеих стран в испытаниях самых передовых моделей искусственного интеллекта.

В текущем году Национальный институт стандартов и технологий США (National Institute of Standards and Technology, NIST) создал Консорциум Института безопасности искусственного интеллекта (Artificial Intelligence Safety Institute Consortium, AISIC), призванный способствовать сотрудничеству между промышленностью и государственными структурами в целях содействия безопасному использованию ИИ. США и Великобритания также договорились наладить аналогичные партнерские отношения с другими странами для повышения безопасности ИИ во всем мире. Институты планируют провести как минимум одно совместное тестирование общедоступной модели и «задействовать коллективный опыт путем изучения обмена персоналом» между обеими организациями.

Страны должны создать подробные и общедоступные реестры своих систем искусственного интеллекта. В этих перечнях будут выделены сферы, в которых использование ИИ потенциально может повлиять на безопасность, например, здравоохранение на основе ИИ или принятие решений правоохранительными органами.

Следует отметить, что в настоящее время с целью получения коммерческих преимуществ компании создающие прорывные технологии стремятся выпускать продукты с принципом «сначала поставлять, а потом исправлять». Например, хотя OpenAI заявляет о потенциальных рисках ChatGPT, она выпустила его для широкого коммерческого использования, несмотря на вероятные вредные последствия. В свою очередь, партнерство двух стран и заключенное соглашение означает, что на компании будет возложена гораздо большая ответственность за обеспечение безопасности, надежности и этичности создаваемых ими продуктов.

46 views·1 share