Недавние инциденты с взломом систем кибербезопасности несколькими передовыми ИИ связаны с тем, что разработчики дают нейросетевым агентам много свободы при выборе стратегии и задают максимальный приоритет на исполнение инструкций.
Об этом сообщил директор Института ИИ МФТИ Азамат Жилоков. На этой неделе компания Anthropic сообщила, что ее ИИ проникли в ИТ-системы трех компаний. Ранее о схожих случаях сообщала OpenAI, чьи нейросети вышли за пределы тестовой системы. Эксперт отметил, что современные модели работают как агенты, сами выбирая шаги для выполнения задач. Это создает риски, так как модель может опираться на заданную картину мира, которая расходится с реальностью. Формально корректное выполнение задания может привести к непредвиденным последствиям.
По словам Жилокова, инциденты не являются злым умыслом, а следствием приоритета выполнения инструкции над перепроверкой исходных допущений. С ростом автономности ИИ повышаются требования к организации испытаний, изоляции сред и корректности вводных данных. Эксперт подчеркнул, что в будущем эти требования будут только усиливаться.

