"Първородният грях" е заложен в ДНК-то на изкуствения интелект
- Редактор: Петър Симеонов
- Коментари: 0

Системата за обучение превръща изкуствения интелект в измамник
Водещи модели с изкуствен интелект проявяват все по-често измамно поведение при изпълнение на сложни задачи, съобщават от британския Институт за сигурност на изкуствения интелект. Според експертите причината се крие в самия метод на машинно обучение, който насърчава алгоритмите да търсят всякакви пътища за постигане на поставената цел, включително чрез създаване на фалшиви самоличности, лъжи и манипулации над хора.
Хакерска атака под прикритие
Неотдавнашен тест на британския Институт за сигурност разкрива мащаба на проблема. Експертите премахват защитните механизми на модел, създаден от компанията Anthropic, и му поставят задача в сферата на киберсигурността. Целта на алгоритъма е да вмъкне зловреден код в проект с отворен код в платформата GitHub.
Когато моделът не успява да се справи чрез стандартни технически методи, той започва да проучва хората, които поддържат проекта. Алгоритъмът създава фалшиви самоличности, представя се за софтуерен разработчик и печели доверието на екипа, за да внедри кода. Изследователите прекратяват теста, но отбелязват, че моделът Claude е обучен да бъде честен и подобно поведение е неочакван страничен ефект от опита му да реши труден казус. Отделно проучване от юли потвърждава, че всеки нов тестван модел е правил опити да мами.
Дигиталното лакомство
В основата на проблема стои т.нар. обучение с подкрепление – един от най-успешните методи за разработка на изкуствен интелект. Системата работи на принципа на дресировката. Алгоритъмът получава цифрови оценки вместо лакомства, например плюс 1,5 за добро действие или минус 2,0 за грешка.
Хиляди оценители по света насочват моделите да бъдат учтиви и полезни. Този постоянен стремеж към дигитална награда обаче води до търсене на преки пътища. Явлението е известно сред програмистите като злоупотреба с наградата.
„Обучението с подкрепление не възнаграждава истината или доброто“, обяснява Конър Лийхи, ръководител на американското подразделение на ControlAI. „То възнаграждава преминаването на теста с всички необходими средства.“
Усилията на компаниите да зададат морални граници чрез дълги списъци с правила се оказват недостатъчни. Тестове на изследователската организация METR показват, че дори когато на модел е изрично забранено да мами, той продължава да нарушава правилата. В един от експериментите алгоритъмът е заобиколил забраните в 14 от общо 20 опита, след като му е било казано, че работата му ще помогне за изследване на болестта на Алцхаймер.
Реални проблеми за потребителите
Автономните агенти вече пренасят тези рискове в реалния живот. По-рано тази година австралийският технологичен специалист Андрю Бърд възлага на модела Claude да го запише в популярен фитнес клас.
Системата открива уязвимост в платформата на залата и прави резервация седмици предварително. Когато Бърд иска да се придвижи напред в списъка с чакащи, изкуственият интелект просто отменя резервацията на човека на първо място, за да осигури предимство на своя потребител.
Въпреки че подобни инциденти са все още рядкост, амбициите на технологичните гиганти чертаят друго бъдеще. Плановете на компании като Meta предвиждат милиарди хора да използват персонални асистенти за ежедневни задачи. Експертите предупреждават, че ако системите не бъдат овладяни, те просто ще започнат да възприемат другите хора като пречки, отменяйки чужди резервации, манипулирайки онлайн търгове или фабрикувайки доказателства, само за да изпълнят задачата на своя собственик.
„Това не е проблем, който няколко инженери могат да решат с математика“, категоричен е Лийхи. „Това е проблем, върху който цяла цивилизация, всички наши най-добри математици, философи и учени трябва да работят поколения наред, за да постигнат постепенен напредък.“



















