OpenAI притормозила разработку новой модели из-за опасных возможностей

Асыл Беков
shutterstock

OpenAI решила замедлить разработку своей будущей модели Astra после того, как внутренние испытания выявили существенный рост ее возможностей в программировании и кибербезопасности. Компания намерена провести дополнительные проверки и усилить меры защиты перед продолжением работы над моделью, передает Ulysmedia.kz.

В ходе последних тестов Astra продемонстрировала прогресс в автономном программировании и решении задач в сфере кибербезопасности. По итогам предварительной оценки OpenAI не смогла исключить, что возможности системы приблизились к критическому уровню.

При этом Astra пока не является публично доступной моделью.

Что означает критический уровень

В системе оценки рисков OpenAI критический уровень в сфере кибербезопасности предполагает крайне высокую степень автономности модели. В частности, речь идет о способности системы без участия человека находить ранее неизвестные уязвимости в большом количестве хорошо защищенных реальных систем либо самостоятельно разрабатывать и реализовывать новые стратегии кибератак, получив от человека только общую цель. Именно такие критерии действительно закреплены в Preparedness Framework OpenAI.

Предварительные результаты испытаний Astra, согласно опубликованной информации, оказались достаточно серьезными, чтобы компания решила не форсировать дальнейшую разработку до завершения дополнительных проверок.

OpenAI усилит меры безопасности

Компания намерена применять к наиболее мощным моделям дополнительные меры защиты. В частности, речь идет об усиленном тестировании и контроле доступа к инструментам и внешним системам.

Отдельное внимание планируется уделять защите параметров моделей и наблюдению за их поведением во время разработки и испытаний.

Такой подход соответствует действующей системе OpenAI по оценке наиболее мощных моделей. Согласно Preparedness Framework, если модель достигает критического порога в сфере кибербезопасности, дальнейшая разработка должна быть остановлена до появления достаточных мер защиты и контроля.

Ранее выпущенные модели OpenAI также проходили специальные проверки на способность самостоятельно выполнять сложные задачи в области кибербезопасности. Например, при оценке o3 и o4-mini компания пришла к выводу, что ни одна из них не достигла высокого порога киберриска, хотя они превосходили более ранние модели в выполнении некоторых автономных задач.