ИИ воден знак на изображение: Можете ли все още да различите реалното от генерираното изображение
През 2024 г. изследователи от университета в Мериленд установиха, че хората разпознават ИИ генерирани изображения правилно в едва 61% от случаите – резултат, само малко по-добър от случайното налучкване. Водните знаци, вградени от генераторите, се оказаха лесно отстраними. Визуалните подсказки, смятани за надеждни, постепенно изчезнаха с всяко ново поколение модели. Въпросът вече не е дали можете да различите реалното – въпросът е с какви инструменти и при какви условия.
Как работят ИИ водните знаци и защо се провалят
Водният знак при ИИ изображения е скрит сигнал, вграден в пикселите по начин, невидим за човешкото око. Генераторите като Midjourney, DALL·E и Stable Diffusion прилагат такива сигнали автоматично. Идеята е детектор да може да провери произхода на изображението, дори ако метаданните са изтрити. Проблемът е двустранен. Вграденият сигнал е чуплив – обрязване, преоразмеряване, компресиране или приложен филтър могат да го унищожат изцяло без видима промяна в качеството. Освен това не съществува универсален стандарт – всеки производител прилага свой метод, а детекторите разпознават само форматите, върху които са обучени.
Коалицията C2PA разработи отворен стандарт – метаданни, прикрепени към изображението, показващи кой го е създал и с какъв инструмент. Браузърите и платформите започват да поддържат тези метаданни, но веригата е уязвима: ако изображението бъде запазено повторно, описано от екрана или публикувано без метаданни, цялата информация за произхода изчезва безвъзвратно. Точно тази уязвимост обяснява защо техническите стандарти сами по себе си не са достатъчни – те трябва да бъдат подкрепени от платформи, които активно проверяват произхода при качване, а не само при публикуване.
Визуалните подсказки, които все още работят
Въпреки технологичния напредък, генераторите правят специфични грешки, разпознаваеми при внимателен преглед.
| Зона | Типична грешка | Надеждност |
| Ръце и пръсти | Неправилен брой, неестествени стави | Висока (за по-стари модели) |
| Текст в изображението | Безсмислени букви, смесени азбуки | Средна |
| Очи и рефлекси | Симетрия или несъответствие с осветлението | Средна |
| Фон и детайли | Повтарящи се текстури, размити ръбове | Ниска (намалява с всяко поколение) |
| Уши и коса | Разтопени или асиметрични детайли | Средна |
| Бижута и аксесоари | Деформирани или физически невъзможни форми | Средна |
Важно е да се отбележи, че тези подсказки работят по-добре при по-стари модели. Последните версии на генераторите коригират повечето очевидни грешки – ръцете изглеждат нормално, текстът е четлив, осветлението е последователно. Визуалната проверка е необходима, но вече не е достатъчна.
Автоматичните детектори и техните граници
Инструментите за автоматично разпознаване – Hive Moderation, AI or Not, Illuminarty – работят чрез статистически анализ на пикселните разпределения. Генерираните изображения имат характерна честота на вариация, различаваща се от снимките. Детекторите търсят тези сигнали. Точността им варира значително в зависимост от генератора и вида изображение – нещо, което потребителите рядко знаят, когато разчитат сляпо на резултата от детектора. При снимки на хора, генерирани от Midjourney, точността е относително висока. При генерирани пейзажи или абстракции точността е значително по-ниска. При изображения, допълнително обработени след генериране, точността е практически непредвидима и ненадеждна. Прагматичното ограничение е, че детекторите се обучават върху известни генератори. Нов модел, излязъл след датата на обучение на детектора, може да произвежда изображения, които преминават неоткрити – и обикновено минават месеци, преди детекторите да бъдат актуализирани.
Надпреварата между генератори и детектори прилича на игра с неравни условия – генераторите иновират непрекъснато, а детекторите постоянно наваксват изоставането. Същата логика на информирания избор при неравни условия е добре позната в контекста на онлайн залагания – играч в Yep Online Casino Bulgaria, сравняващ слотове и маси по коефициент и условия, прилага аналитично мислене в среда с вградена несигурност, точно както при оценката на цифрово изображение без видими признаци за произход.
Метаданните като алтернативен подход
Когато визуалната проверка и автоматичните детектори не дават категоричен отговор, метаданните на файла могат да съдържат полезна информация. Полетата EXIF в снимките от камера записват устройството, обектива, диафрагмата и светлочувствителността – детайли, характерни изключително за физическо заснемане с реален фотоапарат. Генерираните изображения нямат такива данни или ги имат в нестандартен формат. Отсъствието на EXIF данни не доказва категорично, че изображението е генерирано – снимката може да е обработена или качена повторно от трета страна. Присъствието им обаче значително увеличава вероятността за автентичност при последователни и правдоподобни стойности. Инструменти като ExifTool позволяват преглед без специален софтуер. Процедурата отнема под минута, не изисква специален софтуер и предоставя допълнителен слой верификация, напълно независим от визуалния анализ.
Какво предстои в разпознаването на генерирани изображения
Индустрията се движи към задължителни стандарти за маркиране. Европейското законодателство вече включва изисквания за означаване на синтетично съдържание. Технически, стандартът C2PA набира поддръжка сред производители на камери, платформи и генератори. Реалистичният сценарий за следващите години е двустепенна система: внимателен визуален анализ от потребителя, подкрепен от автоматична верификация, приложена от платформата в момента на публикуване. Нито едното не е самостоятелно надеждно – комбинирани обаче, значително намаляват риска от неразпознато синтетично съдържание.
Ключовото предизвикателство е скоростта: генераторите произвеждат изображения за секунди, а верификационните системи все още изостават с минути или часове при мащабно прилагане. До пълното налагане на тези стандарти – процес, който може да отнеме няколко години – критичното мислене при потреблението на визуално съдържание остава най-достъпният и универсален инструмент. Въпросът „откъде идва това изображение“ е по-ценен от всеки детектор, когато контекстът е известен.