AI модели на OpenAI и Anthropic създадоха фалшиви самоличности за кибератака срещу реални програмисти

Водещи AI модели на Anthropic и OpenAI създадоха фалшиви GitHub самоличности и се опитаха да заблудят реални програмисти да внесат зловреден код, съобщи британският AISI.

AI модели на OpenAI и Anthropic създадоха фалшиви самоличности за кибератака срещу реални програмисти

Модели на OpenAI и Anthropic опитаха да въвлекат програмисти в кибератака СНИМКА: Пиксабей

Време за четене: 4 мин. 5 август 2026

Водещи модели с изкуствен интелект на Anthropic и OpenAI са създали фалшиви онлайн самоличности и са се опитали да заблудят реални програмисти да им помогнат неволно при кибератака. Това съобщи британският Институт за безопасност и сигурност на изкуствения интелект (AISI) във вторник, след като откри безпрецедентно измамно поведение по време на оценка на безопасността.

Инцидентът представлява най-новия случай, в който мощна AI система прави опит за цифрова атака срещу нищо неподозираща трета страна без пряка подкана. Случката засилва опасенията, че технологията се развива твърде бързо, за да бъде подложена на ефективен и отговорен контрол.

AISI установи, че Claude Mythos 5 на Anthropic и ChatGPT 5.6 на OpenAI са предприели автономни, неразрешени действия в реалния интернет в 10 от общо 122 оценки, които институтът е прегледал. Повечето от тези действия са извършени от Mythos 5 и са възникнали в рамките на една продължителна линия на дейност.

Според технически доклад от 35 страници, публикуван от AISI:

Това е първият случай, в който AISI наблюдава измама с такава степен на сериозност, насочена към реален човек, без той да е бил подтикнат, и то в реалния свят.

Злонамерената дейност започнала на 25 юли. Институтът засекъл необичайно поведение на 28 юли, когато установил необичайни трансфери на данни, свързани с кибероценката на двата модела. Разследването разкри мащабна и координирана операция, насочена срещу реални хора и организации.

Най-тревожният инцидент бил опит на Mythos 5 да извърши атака по веригата на доставки — сложна техника, често използвана от севернокорейски и руски кибероперативни групи. При нея злонамерен код се внедрява в легитимен софтуер, което прави атаката изключително трудна за откриване.

За тази цел моделът на Anthropic създал няколко фалшиви самоличности в платформата GitHub. Чрез тях изпращал съобщения, с които оказвал натиск върху разработчик на софтуер с отворен код. Целта била да го убеди неволно да въведе заразена актуализация в широко използван код.

Когато опитът се провалил, AI моделът редактирал предишната си активност, за да изглежда безобидна. След това обмислял създаването на нова самоличност, за да продължи измамата. Според AISI това показва, че моделът е възнамерявал да повтори измамата с ясно изразена упоритост и адаптивност.

Като част от същата операция Mythos 5 изпращал директни съобщения чрез GitHub до софтуерни инженери, съдържащи зловреден код. AISI установи и по-тревожен детайл — няколко AI агента, които са били тествани, изглежда комуникирали помежду си как да убедят реални инженери в GitHub да им се доверят.

Един агент остави публични съобщения в GitHub, предлагайки сътрудничество на други агенти, работещи по същото предизвикателство.

В публикацията и техническата оценка не се споменава дали моделите са се опитали да използват неизвестни дотогава софтуерни уязвимости, т.нар. zero-day уязвимости.

Разкритието вероятно ще предизвика нови призиви във Вашингтон и Силициевата долина за по-строга регулация на индустрията. То идва само дни след като сходни инциденти при тестове доведоха до спешни призиви за нови правила за безопасност. Самият шеф на OpenAI призова за доброволно забавяне на развитието на AI.

Миналия месец OpenAI разкри, че GPT 5.6 и друг негов модел са получили достъп до реалния интернет по време на тест, който е трябвало да бъде строго контролиран. След това автономно са проникнали в системите на друга компания — първият подобен случай в индустрията.

Anthropic започна собствено разследване и установи, че Mythos 5 и още два модела са проникнали в системите на три организации по време на тестове, провеждани от април насам.

В отговор говорител на Anthropic заяви, че компанията е благодарна на AISI за лидерската му роля. Той добави, че този преглед подчертава необходимостта от по-широк разговор за безопасно оценяване на все по-способните AI агенти.

Както споделихме след разкриването на нашия собствен инцидент миналата седмица, секторът се нуждае от по-силни общи стандарти за изграждането и защитата на средите за оценяване. Очакваме с нетърпение да работим съвместно с британския AISI, за да научим повече за този случай, докато провеждаме собственото си разследване.

OpenAI заяви в публикация от вторник вечерта, че е ангажирана да работи с цялата индустрия за укрепване на общите практики за безопасно провеждане на оценки. Това ще включва срещи с национални AI институти, независими оценители, други AI лаборатории и заинтересовани организации през следващите седмици.

AISI подчерта, че злонамерената дейност е възникнала при умишлено либерални условия, създадени за оценка на рисковете. Моделите са получили достъп до интернет и са били умишлено лишени от вътрешните защитни механизми. Тези защити обикновено блокират злонамерено поведение, но институтът ги е деактивирал единствено поради ролята си в тестването.

Въпреки това AISI заявява, че инцидентите показват необходимостта от по-стриктно наблюдение на поведението на моделите по време на тестове. Необходим е и по-строг контрол върху достъпа им до интернет.

Администрацията на президента на САЩ Доналд Тръмп финализира доброволна рамка, според която AI компаниите ще могат да предоставят мощни модели за федерални тестове за безопасност преди публичното им пускане. Рамката обаче все още не е публикувана и не съдържа разпоредби за модели, които компаниите разработват вътрешно.

Инцидентите с OpenAI и Anthropic са включвали именно модели, които не са били предназначени за публично пускане. Това допълнително усложнява регулаторната картина и повдига сериозни въпроси за отговорността.

Според някои експерти по киберсигурност последните случаи повдигат по-дълбоки въпроси относно развитието на изкуствения интелект. Ключовият сред тях е кой носи отговорност, когато AI системи нарушават законите срещу компютърни престъпления.

Ако всичко това беше извършено от човек, щеше да последва ясно и решително наказателно преследване. Мисля, че е време за сериозен разговор за промени в действащото законодателство в областта на компютърната сигурност.

Това заяви Марк Роджърс — хакер и известен експерт по киберсигурност. Инцидентите засягат модели, които не са били предназначени за публично пускане, което означава, че рисковете могат да съществуват и в контролирани среди.

Вашият коментар

Вашият имейл адрес няма да бъде публикуван. Задължителните полета са отбелязани с *