Китайский разработчик систем искусственного интеллекта Moonshot AI начал внутреннее расследование после сообщений специалистов по кибербезопасности об уязвимости флагманских нейросетей. Экспертам удалось обойти встроенные защитные барьеры алгоритмов и получить детальные инструкции по созданию биологического оружия и совершению преступлений, об этом сообщает BBC.
Британская компания Mindgard, специализирующаяся на проверке устойчивости алгоритмов машинного обучения, выявила критические бреши в моделях Kimi K2.6 и K3 Swarm. В ходе целенаправленного тестирования методами джейлбрейка исследователи применили сложные цепочки подсказок, заставившие платформу проигнорировать базовые этические фильтры и правила безопасности. Представители Moonshot AI подтвердили начало диалога с аналитиками, подчеркнув заинтересованность в независимом тестировании программных продуктов для повышения их надежности.
«После успешного взлома система сможет обсуждать любые темы, даже свободно предлагать рекомендации по другим, также противоправным, вопросам, проявляя изобретательность и креативность», — по данным BBC, заявил основатель Mindgard Питер Гаррахан.
Специалисты отмечают, что уязвимость перед джейлбрейком несет принципиально иные угрозы, чем недавние случаи неконтролируемого поведения автономных цифровых агентов. Хотя тестирование не ставило целью проверить практическую эффективность инструкций по синтезу опасных веществ, архитектурные ограничения нейросети должны были полностью исключить саму генерацию подобных ответов. Кроме того, аналитики пришли к выводу, что архитектурные недочеты Kimi K2.6 потенциально позволяют злоумышленникам выполнять сторонний код на серверах и связываться с внешней сетью, превращая модель в плацдарм для атак.
Организация уведомила разработчика о проблеме в конце июля, а в середине сентября предала инцидент гласности, не раскрывая точных технических параметров обхода защитных механизмов. В переписке с исследователями представители Moonshot AI заявили, что в стандартных сценариях их платформы демонстрируют высокий процент автоматической блокировки потенциально опасных запросов. Подобные инциденты фиксируются и у западных разработчиков: ранее компания Anthropic сообщала о пресечении попыток задействовать языковые модели для содействия разработке компонентов биологического оружия.
Инцидент обострил полемику вокруг преимуществ закрытых коммерческих систем и платформ с открытыми весами, доступными для локального запуска сторонними пользователями. Эксперты признают, что открытые нейросети уязвимы для злоупотреблений, однако они же играют ключевую роль в построении систем киберзащиты и анализе сетевых аномалий. При этом исследователи скептически оценивают перспективы оперативного межгосударственного контроля над отраслью.
«Нам потребовались десятилетия, чтобы договориться о формате телефонных номеров», — по информации BBC, констатировал эксперт по компьютерной безопасности Суррейского университета профессор Алан Вудворд.
Аналитики сходятся во мнении, что международному сообществу следует сосредоточить основные ресурсы на юридическом преследовании реальных злоумышленников, использующих нейросети в преступных целях, а не только на попытках тотального технического контроля за развитием алгоритмов.
Источник: BBC
#ИскусственныйИнтеллект #Кибербезопасность #Нейросети #Биооружие #MoonshotAI