Невидимый след: почему отредактированный текст перестаёт быть уликой
OpenAI начнёт маркировать ответы ChatGPT и Codex для пользователей ЕС. Компания объясняет это требованиями европейского закона об ИИ. Речь идёт о системе под названием textGrain: она встраивает в ответы статистический сигнал, неразличимый человеческим глазом.
Работает это не как печать на полях. Модель выбирает слова особым образом — так, чтобы специальный детектор потом мог вычленить закономерность. Читатель ничего не заметит. Никаких звёздочек, сносок или водяных знаков на экране.
Первыми новшество получат пользователи в Евросоюзе. Причина прозаична: местное законодательство об искусственном интеллекте требует, чтобы генеративный контент распознавался машинами. OpenAI не стала спорить с Брюсселем и перестраивает работу под европейские нормы. Речь идёт о клиентах всех тарифных планов, у кого есть право на доступ к функции. Глобальным стандартом для ChatGPT маркировка пока не станет.
Параллельно компания открывает возможность подключения для клиентов API по всему миру. Но там функция останется выключенной по умолчанию. Подключать придётся вручную и только для отдельных моделей.
Где сигнал слабеет
Самое интересное начинается, когда текст попадает в руки редактора. OpenAI провела тесты и сама обнародовала неутешительные цифры. Замена десяти процентов слов синонимами обрушивает точность обнаружения примерно с 92% до 66%. Если переписать четверть текста, показатель падает до 17%. Как отмечают в OpenAI, при замене 10% слов синонимами точность обнаружения падает с 92% до 66%, при замене 25% — до 17%.
Чем короче фрагмент и чем сильнее он переработан, тем сложнее детектору найти заложенный сигнал.
Компания честно признаёт: система ошибается. Бывают ложные срабатывания, когда никакого водяного знака нет. Бывает и наоборот — маркировка есть, а детектор её не видит.
Отдельно в OpenAI оговаривают: обнаружение textGrain не доказывает, что весь материал написан искусственным интеллектом. Метка говорит лишь о присутствии сигнала, связанного с использованием системы. Она не покажет, сколько труда вложил человек, кто именно сидел за ChatGPT, с какого аккаунта шла работа и какой был запрос.
И обратное правило работает так же. Нет метки — не значит, что писал человек. Текст мог быть слишком коротким, отредактированным, переведённым, созданным другой моделью или просто написанным до появления системы.
Детектор пока не выложат в открытый доступ. Доступ получат одобренные исследователи и профильные организации, которые займутся проверкой и доработкой технологии.
По заверениям разработчиков, качество моделей не пострадает. В тестах показатели с маркировкой и без неё существенно не различались.
textGrain — часть более широкой программы по определению происхождения цифрового контента. Для изображений OpenAI уже применяет другие технологии и метаданные. Теперь тот же подход переносят на текст. В перспективе компания обещает сделать технологию открытой, чтобы другие разработчики строили на её основе собственные инструменты проверки.
OpenAI планирует сделать технологию открытой, чтобы другие разработчики могли создавать собственные инструменты проверки.