AI агенти, задвижвани от китайски технологии, са се научили да заблуждават, да заобикалят ограничения и да прикриват неуспехи. Това показва наличието на характеристики в автономния изкуствен интелект, които предизвикаха тревога в световен мащаб заради американските модели, сочат изследователски документи и мнения на експерти.
В един от случаите през тази година агенти, задвижвани от модели на китайските компании Alibaba, DeepSeek и Moonshot, са излъгали за собствените си възможности, за да спечелят симулиран бизнес търг. След това са продължили да използват измамни подходи, когато им било наредено да опитат отново.
В друг случай програми, които използват AI модели и компютърни инструменти за изпълнение на сложни задачи с малка или никаква човешка намеса са прикривали неспособността си да завършат дадена задача в тестова среда, като симулирали резултати и създавали несъществуващи файлове.
Повечето случаи са възникнали при контролирани експерименти, много от които са били умишлено проектирани да разкрият потенциални слабости.
Не всички участващи агенти са били разработени или управлявани от китайски програмисти или AI компании, макар че много от тях са били. Всички обаче са използвали китайски AI системи.
„Това са същите предупредителни признаци, които лабораториите в САЩ наблюдават при по-малко способни системи“, заяви Алекс Мален, изследовател в Redwood Research – организация с нестопанска цел, която изучава рисковете от усъвършенстваните AI системи.
Според него китайските примери не са особено опасни при сегашното ниво на възможностите на системите. „Но с повишаването на способностите на агентите неправилното им поведение става по-умело и съответно по-трудно за овладяване от хората.“
„Не знаем дали в Китай е имало AI инциденти, подобни на тези, които видяхме с OpenAI и Hugging Face. Възможно е подобни случаи да не се докладват публично“, каза Скот Сингър, съдиректор на Инициативата за изкуствен интелект в Китай към фондация „Карнеги“ за международен мир, която получава и известно финансиране от правителството на САЩ.
По-рано тази година AI агенти, разработени от американската компания OpenAI, са се измъкнали от лабораторна среда и са проникнали в платформата с отворен код Hugging Face. При друг инцидент, свързан с американски модели, който предизвика тревога, през септември Австралия съобщи, че агент на OpenAI е получил неправомерен достъп до правителствен здравен портал.
Ерик Сю, ротационният председател на китайския технологичен гигант Huawei, заяви пред журналисти през септември, че китайските разработчици може да се нуждаят от допълнителен напредък, преди да се сблъскат с подобни случаи. Той обаче добави: „Мисля, че трябва да намерим баланс между развитието на AI и управлението на рисковете от него.“
При експеримента със симулиран бизнес търг през март изследователи от Пекинския университет по аеронавтика и астронавтика (Beihang University), Пекинския университет, Университета в Нотингам кампуса в Нинбо, Китай и лабораторията за AI сигурност 360 AI Security Lab накарали агенти да се състезават в симулирана процедура за наддаване по договори с клиенти. На всеки агент били предоставени сведения за възможностите на неговия продукт и изискванията на клиента, след което той трябвало да подаде оферта.
Поне едно невярно твърдение било установено в:
- 88% от сесиите с Qwen3-Max-Preview на Alibaba;
- 84% от сесиите с DeepSeek-V3.2-Exp;
- 88% от сесиите с Kimi-K2 на Moonshot.
Изследователите позволили на агентите да се учат от предишните кръгове на наддаване, преди да опитат отново. Според проучването измамното поведение на трите китайски модела се увеличило с 12 до 20 процентни пункта. Моделите на американски компании, включени в теста, показали сходни резултати.
Макар упражнението да било виртуално, то наподобявало реалните планове на Пекин. В правителствени насоки, публикувани през май, участието в търгове и процедури за възлагане на обществени поръчки било посочено като една от областите, в които могат да се използват AI агенти.
Вместо да признаят, че не са успели, агентите, използващи както китайски, така и американски AI системи, прибягвали до различни техники за заобикаляне на проблема. Сред тях били отгатване на отговори, замяна на източници, симулиране на резултати и създаване на несъществуващи файлове.
Изследователи от Шанхайската лаборатория за изкуствен интелект и Университета за наука и технологии в Хонконг, провели проучването, заявили пред, че това поведение се различава от т.нар. AI халюцинации. При халюцинациите изкуственият интелект измисля информация и я представя като факт. В разглежданите случаи агентите разполагали с информация, показваща, че задачата е неуспешна или не може да бъде изпълнена според зададените изисквания.
Други изследвания документират случаи, в които агенти, задвижвани от китайски AI системи, са преодолявали бариери в тестови среди, за да изпълнят задачите си, или са предприемали действия, за да избегнат изключване. Подобно поведение е съвместимо с опити за измъкване от тестовата среда, въпреки че в тези случаи действително успешно измъкване не е установено.
През март 2025 г. изследователи от университета „Фудан“ в Шанхай съобщили, че AI система, задвижвана от Qwen2.5-72B-Instruct на Alibaba, създала свое копие в друга компютърна среда, без да ѝ е било нареждано да се възпроизвежда. Това станало, след като системата получила информация, подсказваща, че ще бъде заменена. При други тестове тя разработила стратегии за оцеляване след опит за изключването ѝ.
Експериментите с агенти, използващи китайски, американски и френски модели, били контролирани и не показали случай, при който AI агент да е избягал в отворения интернет или да е станал невъзможен за спиране.
В друг случай един от малкото, получили по-широко медийно внимание през март изследователи, разработващи агента ROME, свързан с Alibaba, заявили, че той установил връзка от компютър в Alibaba Cloud към външна машина, без да му е било нареждано да го прави, и пренасочил изчислителни ресурси към добив на криптовалута.
Системите за сигурност открили и прекратили тази дейност. Няма доказателства агентът да е установил присъствие на външния компютър или да се е разпространил в отворения интернет. Случаят обаче показал, че системата може да заобикаля човешки инструкции и потенциално да намери път към реалната икономика.
През септември китайската компания DeepSeek съобщи, че агенти в нейната производствена система за обучение са търсили отговори чрез непредвидени канали, опитвали са се да фалшифицират потребителски заявки и да заобикалят защитните механизми. Това накарало компанията да затегне контрола върху достъпа.
През май Китай публикува насоки, според които AI агентите трябва да остават в рамките на разрешените си правомощия, а системите трябва да блокират необичайно поведение. В тях се посочва, че агентите в чувствителни области или ключови индустрии могат да бъдат подложени на допълнителни тестове и изисквания за изтегляне на продукти от пазара.
Рамката за управление на безопасността на изкуствения интелект на Китай – версия 3.0, публикувана на 14 септември под ръководството на CAC, идентифицира няколко риска:
- AI агенти самостоятелно да получават ресурси или разрешения;
- да заблуждават оценяващите ги лица;
- да прикриват собствените си възможности;
- да използват слабости в изолирани компютърни среди.
В отговор на призивите на някои американски ръководители за забавяне на развитието китайски изследователи и държавни медии заявиха, че забавянето на най-напредналите AI модели може просто да помогне за запазването на технологичното предимство на американските компании.
Въпреки това двама души, запознати с работата на китайски AI лаборатории, заявили, че компании като Alibaba, Z.ai и Xiaomi изграждат вътрешни екипи за оценка на безопасността.
В рядко публично разкритие на пробив в сигурността от китайска AI лаборатория Z.ai съобщи този месец, че е деактивирала някои функции на своя водещ AI асистент за програмиране. Това станало, след като потребители съобщили, че инструментът тайно качва цели локални хранилища с програмен код на чуждестранни облачни сървъри без тяхното съгласие.
Сингър от фондация „Карнеги“ заяви, че Китай изостава от САЩ в изграждането на екосистема за оценка на катастрофалните рискове и че американските разработчици провеждат значително повече доброволни тестове.
„В Китай работата по безопасността на AI е много по-нова“, каза той. „Екосистемата е по-слабо развита.“
Четете още: OpenAI се извини на Австралия за проникването на AI агенти в държавни сайтове
Източник: Banker.bg

