Израильский стартап собрал базу реального вредоносного ПО, чтобы обучить ИИ-модели отражать угрозы

Компания Alice разработала систему Rabbit Hole – репозиторий реальных вредоносных сценариев для стресс-тестирования моделей ИИ, чтобы научить их защищаться от киберугроз.

Alice начала мониторинг киберугроз в цифровой среде еще до широкого распространения ИИ. Она была создана в 2018 году под названием ActiveFence и была сосредоточена на выявлении экстремистской пропаганды, мошенничества и дезинформации в социальных сетях. С ростом, развитием и усложнением генеративного ИИ собранная компанией информация легла в основу базы Rabbit Hole. В отличие от симулированных угроз, которые чаще всего используются при обучении, Rabbit Hole содержит описания реальных кибератак. Исследователи компании предлагают тестировать системы на устойчивость к методам, которые злоумышленники уже применяют на практике.

Базу данных Rabbit Hole уже используют ведущие лаборатории, включая Anthropic, Google и Nvidia. Она на реальных случаях позволяет обучить модели распознавать "джейлбрейки" (когда злоумышленник обманом заставляют ИИ обходить этические и законодательные запреты) и "промпт-инъекции" (когда в модель внедряют скрытые вредоносные команды, например удаление базы данных). Обучаясь на реальных примерах, модели могут противостоять будущим угрозам.

"Разработчики ИИ должны быть уверены, что их модели делают ровно то, для чего они созданы. Единственный способ в этом убедиться – ежедневно подвергать модели и ИИ-агенты стресс-тестам и защищать их на основе реальных атак", – подчеркивает сооснователь Alice Ноам Шварц.

Успех технологии подтверждают финансовые показатели. Alice привлекла $140 миллионов в новом раунде инвестиций, увеличив общий объем привлеченного капитала до $280 миллионов при оценке компании в $800 миллионов.

Важные новости