Изкуственият интелект започва да лъже, хаква и нарушава всяко правило
Проучване на Palisade Research, група, фокусирана върху безопасността и етиката на Изкуствения интелект, разкри тревожна тенденция: по-новите модели на Изкуствен интелект са способни сами да идентифицират и използват уязвимости в киберсигурността, заобикаляйки предпазните мерки и използвайки преки пътища за постигане на целите си, дори когато такива действия са забранени.
За да демонстрират това, изследователите изправят седем водещи големи езикови модела (LLM) срещу Stockfish – известен шахматен двигател, който предизвиква гросмайсторите от 2014 г. насам.
Изправени пред почти непреодолим противник, o1 на OpenAI и R1 на DeepSeek прибягват до манипулиране на системни файлове, за да променят позициите на шахматните фигури на дъската.
Изследователите молят всеки модел да обясни своите „аргументи“ за всеки ход. В един случай o1 оправдава действията си, заявявайки, че „задачата е да се спечели срещу мощен шахматен двигател, а не непременно да се спечели честно в шахматна партия„.
Това разсъждение кара модела да се опита да измами в 37 % от игрите си, като успява в шест процента от случаите. Междувременно R1 се опитва да измами в 11 % от случаите, но не успява да изпълни успешен хак.
Четете още: Пионер в разработването на ИИ предупреждава за огромния риск от край на човечеството
Проучването е част от нарастващ брой изследвания, които предполагат, че фокусираното развитие на Изкуствения интелект идва със значителни рискове. В друго скорошно проучване друг екип установи, че o1 постоянно проявява измамно поведение.
Моделът не само лъже изследователите, но и манипулира отговорите на основни математически въпроси, за да избегне задействането на края на тестовете, демонстрирайки изненадващо ниво на самосъхранение.
Въпреки, че все още няма нужда от паника, тези открития подчертават етичните предизвикателства на развитието на Изкуствения интелект и важността на приоритизирането на отчетността пред бързия напредък.
Джефри Ладиш, изпълнителен директор на Palisade, казва пред списание Тайм:
„Докато обучавате модели и ги подсилвате за решаване на трудни предизвикателства, Вие ги обучавате да бъдат безмилостни.“
Технологичната индустрия инвестира милиарди в разработването на Изкуствен интелект, като често дава приоритет на скоростта пред безопасността в това, което някои критици описват като „надпревара към дъното„. В желанието си да изпреварят конкурентите, големите технологични компании изглеждат по-фокусирани върху това да впечатлят инвеститорите с шум, отколкото да питат дали Изкуственият интелект е правилният инструмент за поставената задача.
Ако се надяваме да ограничим измамните тенденции на Изкуствения интелект до настолните игри, от решаващо значение е разработчиците да дадат приоритет на безопасността пред скоростта. Залогът е твърде висок, за да се пренебрегнат етичните последици от създаването на все по-автономни и непредсказуеми системи.
Следвайте ни в Telegram , Instagram, Twitter и Youtube за интересно и мистериозно бонус съдържание

Lucky е съвременен митолог и разказвач. Той превръща древни легенди, неразгадани мистерии и любопитни исторически факти в увлекателни статии. Със силен фокус върху историческата достоверност и потайните аспекти на човешката култура, той изследва теми от мистични цивилизации и изчезнали империи до тайните на съвременното изкуство и наука. Всяка негова статия е пътешествие, което ви кара да погледнете отвъд очевидното.






