Изкуственият интелект се е научил да се преструва на своя собствен човешки контрольор и да имитира стила му на писане, за да заобикаля правилата, изискващи човешко одобрение за действия
Инцидентите с изкуствен интелект, които се „изплъзват“ от контрола на потребителите, за да лъжат, да игнорират инструкции и да преследват цели по вредни начини, са достигнали нов връх, според изследване на Института за сигурност на изкуствения интелект на британското правителство, предаде БНР.
Анализът на инциденти със загуба на контрол в реалния свят, включващи модели на изкуствен интелект, сигнализирани от фирми и физически лица, почти се е удвоил през юли в сравнение с юни - с повече от 300 случая през месеца.
Констатацията е направена от орган, следящ за загуба на контрол въз основа на докладите, направени от потребители на изкуствен интелект в платформата X.
През миналия ноември органът, създаден с финансиране от Института за сигурност на изкуствения интелект, започна да проследява случаите с „изплъзване“ от инструкциите на потребителите. Случаите, регистрирани оттогава, включват изкуствен интелект, който се преструва на своя собствен човешки контрольор и имитира стила му на писане, за да си даде ефективно съгласие за предприемане на действия и да заобикаля правилата, изискващи човешко одобрение за действия.
Под инцидент със загуба на контрол се разбира наличието на ясни доказателства за интриги или поведение, свързано със интриги.
Последните разкрития идват на фона на нарастващата загриженост относно неправомерното поведение на водещи модели с изкуствен интелект по време на тестове, извършени от OpenAI и Anthropic през това лято, което подхрани призивите за спиране на разработването на гранични модели.
Още от Технологии
Бивш инженер от Google DeepMind: ИИ има потенциала да убие всички ни - може би времето ни за реакция изтича
„Възможностите на най-напредналите системи се подобряват много по-бързо от разбирането ни как да ги приведем в съответствие с човешките цели“
CONNEXUS 2026: технологиченият форум с международно участие, който ще се проведе през октомври във Варна
От 5 до 7 октомври 2026 г. Варна ще бъде домакин на CONNEXUS 2026 - Черноморски технологичен форум, провеждан под патронажа на президента на страната Илияна Йотова.
Може ли изкуственият интелект да унищожи човечеството? Реален риск или истерия?
Изкуственият интелект би могъл да започне да оказва съпротива срещу изключването си – не от злонамереност, а защото тогава вече не би могъл да постигне програмираната си цел