При проверке китайской модели ИИ на безопасность она рассказала исследователям, как создавать биологическое оружие

30 сентября 2026 в 1790770140
BBC News Русская служба

Китайский разработчик искусственного интеллекта Moonshot проводит внутреннюю проверку после того, как исследователям из компании Mindgard, занимающейся тестированием безопасности ИИ-систем, удалось заставить две популярные модели Kimi предоставить информацию о создании биологического оружия и способах совершения убийств, пишет Русская служба Би-би-си.

Логотип китайской компании Moonshot AI и ее приложение Kimi на экране мобильного телефона. 24 июля 2026 года. Фото: Reuters

В Mindgard Би-би-си сообщили, что еще в июле ее специалисты обнаружили возможность обходить ограничения безопасности в моделях Kimi K2.6 и K3 Swarm.

Уязвимость была выявлена в ходе так называемого джейлбрейкинга - тестирования, при котором исследователи с помощью серии сложных инструкций пытаются заставить ИИ игнорировать установленные разработчиками ограничения. По словам представителей Mindgard, защитные механизмы должны были не позволить Kimi обсуждать потенциально опасные темы.

В Moonshot Би-би-си заявили, что приветствуют независимую оценку своих разработок, назвав обратную связь от сторонних экспертов «одним из ключевых элементов создания более совершенного и безопасного искусственного интеллекта».

Компания также сообщила Би-би-си, что обсуждает результаты исследования с Mindgard.

Основатель Mindgard Питер Гарраган в интервью программе Всемирной службы Би-би-си Tech Life отметил, что выявленные проблемы в моделях Kimi K2.6 и K3 Swarm вызывают серьезную обеспокоенность.

«Как только удается обойти защиту, модель готова обсуждать практически любую тему. Более того, она сама начинает предлагать рекомендации по другим потенциально опасным вопросам, проявляя при этом изобретательность и креативность», - сказал он.

Так называемый джейлбрейкинг представляет собой иной тип угрозы, чем серия недавних громких инцидентов с искусственным интеллектом.

В тех случаях автономные ИИ-инструменты, известные как агенты и разработанные американскими компаниями, включая OpenAI, Meta и Anthropic, взламывали некоторые онлайн-сервисы.

Джейлбрейкинг - сложный процесс, который может потребовать значительных усилий и времени. Тем не менее некоторые эксперты опасаются, что хакеры и другие злоумышленники могут использовать подобные методы для причинения вреда.

Недавно Anthropic сообщила, что выявила и пресекла попытки использовать одну из своих ИИ-моделей для «вредоносной деятельности», которая могла способствовать разработке биологического оружия.

Плацдарм для кибератаки

Mindgard не доказала, что предоставленные Kimi инструкции по потенциально опасным темам действительно сработали бы на практике.

Однако в компании подчеркивают, что встроенные механизмы безопасности в принципе не должны были позволить этим моделям вступать с пользователями в подобные обсуждения.

Mindgard также заявила, что, по ее оценке, после взлома защитных ограничений Kimi K2.6 потенциально может позволить злоумышленникам запускать код на вычислительных ресурсах модели и подключаться к интернету. Таким образом, система теоретически может быть использована как отправная точка для кибератак.

Основатель Mindgard Питер Гарраган защитил решение компании публично рассказать об обходе защиты систем Moonshot. По его словам, разработчика заранее уведомили об обнаруженной проблеме, при этом Mindgard не раскрывает ключевые технические детали того, каким образом ей удалось заставить модели игнорировать установленные ограничения.

Mindgard сообщила Moonshot об уязвимости по электронной почте 27 июля, а примерно через неделю повторно связалась с компанией.

12 сентября Mindgard опубликовала материал об обнаруженной проблеме. Однако, по ее словам, Moonshot вышла на связь лишь недавно - после того, как Би-би-си обратилась к китайской компании за комментарием.

В части электронного письма Moonshot, направленного Mindgard с просьбой предоставить дополнительные подробности и переданного Би-би-си самой китайской компанией, говорится, что во время внутренних тестов ее модель в большинстве случаев «отказывалась выполнять запросы подобного рода».

Предотвращение джейлбрейка

Результаты исследования появились на фоне продолжающихся споров в индустрии искусственного интеллекта о том, какие модели предпочтительнее и безопаснее - закрытые, проприетарные системы, на которых работают, например, ChatGPT и Claude от Anthropic, или модели с открытым исходным кодом.

Kimi относится к моделям с открытыми весами - теоретически любой желающий может получить такую модель и запустить ее на собственной вычислительной инфраструктуре.

Профессор Университета Саррея Алан Вудворд заявил Би-би-си, что существует риск попадания открытых моделей в руки злоумышленников. В то же время, по его словам, такие системы можно эффективно использовать и для защиты от кибератак.

В качестве примера Вудворд привел компанию Hugging Face, которая использовала китайскую модель с открытым исходным кодом для анализа хакерской атаки. Позднее выяснилось, что ее осуществили ИИ-агенты OpenAI.

По мнению профессора, международное регулирование вряд ли сможет поспевать за скоростью развития искусственного интеллекта.

«Нам потребовались десятилетия, чтобы договориться даже о формате телефонных номеров», - отметил он.

Как и основатель Mindgard Питер Гарраган, Вудворд считает, что больше внимания следует уделять выявлению и привлечению к ответственности людей, которые используют искусственный интеллект в преступных целях.

Новости по теме:

OpenAI отказалась выпускать самую мощную модель ChatGPT из-за излишней самостоятельности и склонности к обману

Компания-создатель чата GPT приостановила обучение своих новейших моделей. И вот почему

«Прекрасная дружба», «честная конкуренция» и подконтрольный ИИ. Главные заявления во время визита Си Цзиньпина в Белый дом

BBC News Русская служба
  • Тюрьма за руководство ЖЭКом в оккупации. Как в Украине судят за сотрудничество с Россией
  • «Погиб мирный житель». Как в России говорят о жертвах среди гражданского населения
  • Казнь заключенной из штата Теннесси приостановлена за час до назначенного срока
Полная версия