OpenAI начнёт добавлять невидимые водяные знаки в ответы ChatGPT в Евросоюзе, чтобы выполнять требования EU AI Act.
Технология называется textGrain. Она не вставляет в текст скрытые символы или специальные пробелы. Вместо этого модель немного меняет статистику выбора слов и их частей. В результате в тексте появляется незаметный для человека паттерн, который можно обнаружить специальным детектором.
В течение ближайших недель водяные знаки появятся в подходящих текстовых ответах ChatGPT и Codex у пользователей в ЕС. Функция будет работать на всех тарифах. За пределами Евросоюза OpenAI пока не собирается включать её по умолчанию.
Для разработчиков через API водяные знаки уже стали доступны по всему миру, но их нужно включать самостоятельно.
При этом технология далеко не безошибочная: чем короче текст, тем сложнее определить наличие метки. При допустимом уровне ложных срабатываний 1% детектор находил водяной знак примерно в 80% текстов длиной 200 токенов и примерно в 95% текстов на 400 токенов в тестах на обычных вопросах. С математическими текстами результаты заметно хуже. Отредактировать текст тоже достаточно, чтобы сильно ухудшить распознавание.
Публичного сервиса для проверки текстов пока не будет. Доступ к детектору OpenAI выдаст только одобренным исследователям и профильным организациям.
При этом обнаруженная метка сама по себе не доказывает, что весь текст написал ChatGPT. Она также не позволяет определить пользователя, его аккаунт, промпт или конкретный диалог. А отсутствие метки, наоборот, не означает, что текст написал человек.
1 комментарий