OpenAI решила замедлить разработку своей будущей модели Astra после того, как внутренние испытания выявили существенный рост ее возможностей в программировании и кибербезопасности. Компания намерена провести дополнительные проверки и усилить меры защиты перед продолжением работы над моделью, передает Ulysmedia.kz.
В ходе последних тестов Astra продемонстрировала прогресс в автономном программировании и решении задач в сфере кибербезопасности. По итогам предварительной оценки OpenAI не смогла исключить, что возможности системы приблизились к критическому уровню.
При этом Astra пока не является публично доступной моделью.
В системе оценки рисков OpenAI критический уровень в сфере кибербезопасности предполагает крайне высокую степень автономности модели. В частности, речь идет о способности системы без участия человека находить ранее неизвестные уязвимости в большом количестве хорошо защищенных реальных систем либо самостоятельно разрабатывать и реализовывать новые стратегии кибератак, получив от человека только общую цель. Именно такие критерии действительно закреплены в Preparedness Framework OpenAI.
Предварительные результаты испытаний Astra, согласно опубликованной информации, оказались достаточно серьезными, чтобы компания решила не форсировать дальнейшую разработку до завершения дополнительных проверок.
Компания намерена применять к наиболее мощным моделям дополнительные меры защиты. В частности, речь идет об усиленном тестировании и контроле доступа к инструментам и внешним системам.
Отдельное внимание планируется уделять защите параметров моделей и наблюдению за их поведением во время разработки и испытаний.
Такой подход соответствует действующей системе OpenAI по оценке наиболее мощных моделей. Согласно Preparedness Framework, если модель достигает критического порога в сфере кибербезопасности, дальнейшая разработка должна быть остановлена до появления достаточных мер защиты и контроля.
Ранее выпущенные модели OpenAI также проходили специальные проверки на способность самостоятельно выполнять сложные задачи в области кибербезопасности. Например, при оценке o3 и o4-mini компания пришла к выводу, что ни одна из них не достигла высокого порога киберриска, хотя они превосходили более ранние модели в выполнении некоторых автономных задач.