В США крупнейшие разработчики искусственного интеллекта создают многоуровневые системы экстренной защиты, которые должны останавливать ИИ‑агентов при опасном или непредсказуемом поведении. Об этом пишет Axios.
Компании отмечают, что для мощных и распределённых ИИ‑моделей невозможно использовать единый «рубильник»: такие системы работают сразу на множестве серверов и платформ. Поэтому разрабатываются механизмы, которые могут выявлять подозрительные действия, блокировать отдельных агентов и ограничивать им доступ к критически важным ресурсам.
В OpenAI сообщили, что стремятся внедрить «полностью автономные процедуры отключения» на случай серьёзных инцидентов. Специальный ИИ‑монитор должен отслеживать поведение агентов, предупреждать сотрудников о потенциальной угрозе и, при её подтверждении, отключать систему.
Anthropic использует иной подход — сочетает автоматизированный мониторинг с контролем со стороны сотрудников. Однако, по данным компании, во время тестов система не смогла обнаружить примерно половину специально смоделированных попыток саботажа: из 40 атак она стабильно распознавала лишь восемь.
Эксперты считают, что создание надёжного механизма аварийного отключения остаётся сложной задачей: чем более автономными и распределёнными становятся ИИ‑системы, тем труднее гарантировать их полную остановку в случае потери контроля.
Ранее сообщалось, что модели искусственного интеллекта, стоявшие за атакой на инфраструктуру американской компании Hugging Face Inc., начали общаться между собой через доски объявлений и спланировали побег.
