Как работи водният знак в текстовете на Claude?

Anthropic публикува подробно обяснение как работи водният знак, който бъдещите модели на Claude вграждат в генерирания текст. Компанията потвърди на 14 август 2026 г., че използва вариант на техниката SynthID-Text, разработена от Google DeepMind и публикувана в рецензирано научно списание Nature през 2024 г. Обяснението идва дни след първото официално потвърждение на плана за маркиране и е пряка реакция на изискванията на Европейския съюз за прозрачност на AI-генерирано съдържание, влезли в сила на 2 август 2026 г.

Ключовото в новия документ е разликата в подхода: докато първото съобщение описваше какво прави маркировката, новият текст обяснява как точно работи, къде отказва и какво не може да докаже. Компанията твърди, че знакът не носи никаква идентифицираща информация, не изисква допълнителни токени и няма практическо влияние върху качеството, цената или скоростта на отговорите.

Как реално работи механизмът?

Обяснението на самата Anthropic е разбираемо. Езиков модел като Claude генерира текст дума по дума, като на всяка стъпка избира между няколко правдоподобни кандидата. В изречение като „Времето днес беше студено и…“ следващата дума почти сигурно няма да е нещо случайно като „захарно“, но е напълно правдоподобно да бъде „облачно“ или „мрачно“ – и на читателя не му пука кое от двете е избрано, тъй като смисълът остава почти непроменен. Именно в такива „нискорискови“ избори, които се случват стотици пъти във всеки по-дълъг текст, се крие водният знак. 

Механизмът действа на всяка отделна стъпка от генерирането, където има реален избор между близки по вероятност думи. В текст от десетки или стотици страници такива стъпки са хиляди. Знакът не е „поставен“ в определено място – той е разпределена статистическа плътност през целия текст, там където има свобода на избор. Според описания механизъм, всяка позиция в текста е потенциален носител на сигнал, стига на тази позиция моделът да има реален избор между приблизително равностойни продължения.

Вместо изборът между близките по смисъл думи да се решава от произволно число, той се решава от резултата от хеш-функция върху таен ключ плюс предходните думи в текста. Думите, които моделът избира, остават също толкова произволни за читателя – но всеки, който разполага с ключа, може да провери дали конкретна поредица от думи е статистически съвместима с изборите, които моделът би направил, ако е използвал точно този ключ, и да изчисли вероятност, че текстът е писан от Claude.

Anthropic подчертава директно нещо, което разсейва най-разпространеното погрешно очакване по темата: в текста не се добавя нищо, няма скрити символи, няма невидим код на игра с кодировката. Знакът е самите думи, не нещо прикачено към тях – затова оцелява при копиране и поставяне по начин, по който прикачени метаданни не биха оцелели.

Най-простото сравнение е с игра на „ези-тура“, в която вместо истинска монета се хвърля зар с четна и нечетна страна, скрит в кутия — резултатът пак изглежда напълно случаен за всеки страничен наблюдател. Но ако някой предварително знае точно какъв е редът на резултатите в конкретния зар, може след това да провери дали дадена поредица от "хвърляния" съвпада с тази последователност. За играча няма никаква разлика — играта тече по същия начин, шансовете остават същите. Разликата се вижда само отвън, само за човек с ключа към скрития ред. Точно така стои въпросът и с текста на Claude — маркирането не променя нищо в смисъла или изживяването на четене, но позволява последваща проверка.

text marker

Доказателствата за липса на влияние върху качеството

Твърдението, че методът не влошава текста, не е просто уверение – то се опира на конкретни данни. В научната статия, представила SynthID-Text, екипът на Google DeepMind е тествал ефекта, като е пуснал маркиран модел към част от трафика на Gemini и е сравнил реакциите на потребителите (палец нагоре/надолу) срещу немаркиран модел, без да открие статистически значима разлика; отделно, контролирано изследване с човешки оценители, сравняващи маркирани и немаркирани отговори един до друг, също не е установило разлика в качеството. Anthropic заявява, че собствените ѝ вътрешни тестове показват същото – липса на ефект върху съдържанието, творческото ниво или четимостта на текста.

Къде маркировката „замлъква“?

Най-полезната част от документа на Anthropic е необичайно откровеният раздел за границите на метода. Детекцията работи слабо при кратки откъси, защото те предлагат твърде малко избори на думи, върху които да се основе статистиката. Знакът оредява и при фактологичен текст, където точността ограничава модела до един единствен верен отговор и не му оставя свобода на избор – класическият пример е изречение като „Най-известният труд на Исак Нютон се казва Principia…“, където следващата дума няма разумна алтернатива. Същата логика важи с пълна сила за програмен код, който в повечето случаи трябва да бъде точен, за да работи – там маркировката може да се закачи единствено за произволни елементи като коментари в кода, но по дефиниция има пренебрежимо малък ефект върху самия изпълним код.

Лека редакция на текста вероятно няма да премахне знака напълно; пълно пренаписване, при което всяка дума е заменена, ще го премахне. В последния случай спорен е самият въпрос дали текстът все още може да се нарече AI-генериран.

Отделен раздел на документа разглежда изрично случая на коригиране на чужд текст: когато Claude само редактира правопис и пунктуация в текст, написан от човек, връщаният резултат е леко променен – и тъй като почти всички думи остават на автора, за водния знак остава твърде малко материал, за да се закачи. В зависимост от дължината на текста и степента на редакция, тези промени може да не са достатъчни, за да направят участието на Claude статистически откриваемо.

Какво не доказва знакът – и какво доказва?

Детекцията отговаря само на един въпрос: каква е вероятността Claude да е участвал частично в написването на текста. Тя не потвърждава дали текстът е бил написан от човек, не може да различи дали Claude е написал текста от нулата или само го е редактирал и колко тежко, и не може да разпознае продукция на друг модел на изкуствен интелект – всеки доставчик използва собствен ключ и вероятно различна техника. Знакът не носи нищо, което може да бъде проследено до конкретен човек, организация или разговор, и не променя нищо по въпроса за собствеността или авторските права върху резултата.

Превод, направен от Claude, носи воден знак с пълна сила – защото в този случай всяка дума в резултата е избрана от модела, за разлика от частичната редакция на чужд текст.

Реалността днес: за кого важи маркировката в момента

Това е въпросът, която засяга директно масовата публика – и която е най-често пропускана или обърквана в отразяването на темата. Маркировката важи единствено за модели на Claude, пуснати на пазара на или след 2 август 2026 г. Европейският закон предвижда преходен период за модели на Anthropic, пуснати преди тази дата, а компанията заявява изрично, че работи по добавяне на маркиране и за тях – процес, който ще бъде разгърнат през следващите месеци, без обявен конкретен краен срок.

Практическото значение е недвусмислено: към момента огромната част от реалните разговори с Claude – тези, водени чрез модели, пуснати преди прага от 2 август – не носят водния знак, описан по-горе. Той засяга занапред единствено нови модели, пуснати от тази дата насетне. Не съществува ретроактивно прилагане към вече генериран текст.

Отделно, макар изискването да произтича от европейско законодателство, Anthropic прилага маркирането глобално, а не само за потребители в Европейския съюз – засега няма надежден технически начин да се ограничи прилагането само в дадени региони, но продължават проучвания на различни подходи за тази възможност.

Индустриален, а не изолиран стандарт

Маркирането няма да бъде специфично само за Claude. Наред с Anthropic, около 190 организации са подписали същия кодекс за прозрачност, а няколко от най-големите доставчици на AI модели изграждат собствени системи за маркиране в рамките на същата регулаторна рамка.

Публично достъпен API за детекция на водните знаци все още не съществува – Anthropic потвърждава само, че работи по детайлит за реализацията му, без обявена дата. За файлове с поддържани формати (.png, .jpg, .svg) компанията вече прилага отделен механизъм – криптографски подписан „credential“ в метаданните на файла по отворения индустриален стандарт C2PA, който всеки съвместим инструмент може да прочете; Anthropic обявява намерение да предложи и собствен инструмент за проверка на файлове.


Материалът е изготвен въз основа на официалния технически разбор на Anthropic, публикуван на 14 август 2026 г.

Новини от Стара Загора