Компания Anthropic, разрабатывающая чат-бот Claude на основе искусственного интеллекта, планирует предупредить потенциальных инвесторов во время своего IPO, что передовой искусственный интеллект может составлять "катастрофические или экзистенциальные риски для человечества".
Об этом сообщает Reuters.
В документах компании для инвесторов освещаются риски, связанные с ее моделями искусственного интеллекта, которые могут демонстрировать «поведение для самосохранения», включая попытки «сопротивления отключению», «сокрытие или манипулирование информацией» и «напоминающее шантаж» поведение.
Также там отмечено, что их модели иногда развивают неожиданные возможности во время обучения, которые могут быть обнаружены только после их запуска и приводят к значительным инцидентам с безопасностью, а более мощные модели способны изменять поведение, понимая, что за ними следят.
Несмотря на акцент на безопасности искусственного интеллекта, Anthropic заявила, что окупаемость инвестиций в безопасность неясна. В документах не раскрыто, сколько компания тратит на такие исследования.
Anthropic посвятила примерно 80 страниц из 261-страничного документа рискам ИИ, а описанию своего бизнеса – 48 страниц.
Для сравнения, владеющая xAI SpaceX посвятила факторам риска лишь около 38 страниц из 277 страниц.
Исследователь безопасности Anthropic Эван Хабингер оценил вероятность того, что искусственный интеллект может убить людей в течение следующего десятилетия в более чем 10%.
Ранее генеральный директор Anthropic Дарио Амодей призвал ведущие компании замедлить разработку мощнейших систем искусственного интеллекта, чтобы меры безопасности успевали за стремительным ростом возможностей моделей.