Против OpenAI подан коллективный иск в Северном округе Калифорнии. Двое пользователей ChatGPT обвиняют компанию в том, что реальные переписки передавались внешним подрядчикам без надлежащего уведомления. Иск был вручён OpenAI 2 сентября, а ответ компании должен быть подан до 13 октября.
Претензии касаются внутренней программы Project Lily, о которой 14 сентября рассказало издание 404 Media. По данным жалобы, подрядчики, нанятые через кадровые агентства на роли «AI data reviewer» и «chatbot evaluator», читают реальные запросы и переписки пользователей ChatGPT, обобщают намерения пользователя, а затем оценивают четыре варианта ответа модели по шкале от 1 до 7. Это часть механизма обучения с подкреплением на основе обратной связи от людей, однако истцы утверждают, что пользователям не сообщали, что их чаты может читать живой человек.
OpenAI заявляет, что перед передачей на проверку переписки проходят автоматическую фильтрацию, но в иске говорится, что фильтр не всегда перехватывает личные данные. 404 Media обнаружило, что у проверяющих есть панель со сводкой «памяти пользователя» — она может раскрывать общую геолокацию, профессию или детали личной жизни, даже если имена удалены. В OpenAI поясняют, что проверки нужны для борьбы с излишней «человечностью» чат-бота и подхалимством, когда модель говорит то, что хочет услышать пользователь.
ChatGPT еженедельно используют более 900 млн человек, и многие делятся с ним медицинскими симптомами, налоговыми и юридическими вопросами. В жалобе утверждается, что политика конфиденциальности OpenAI не называет конкретно подрядчиков по разметке данных и оценке ответов. Иск содержит восемь оснований, включая нарушение закона Калифорнии о недобросовестной конкуренции, Калифорнийского закона о защите прав потребителей и вторжение в частную жизнь. Истцы требуют компенсацию ущерба, реституцию и штрафные санкции, а также запретительные меры: согласие пользователя до передачи чата внешнему проверяющему, отключённую по умолчанию настройку «Improve the model for everyone», предупреждение в окне чата и удаление результатов проверки с повторным обучением моделей.
Параллельно исследователи из ETH Zurich, группы MATS и Anthropic показали, что большие языковые модели могут связывать псевдонимные публикации с реальными личностями. Автоматизированный конвейер из четырёх этапов — Extract, Search, Reason и Calibrate — читает открытые посты, ищет совпадения и с высокой точностью определяет личность. В тесте на 338 пользователях Hacker News, чьи профили указывали на LinkedIn, система верно определила 226 человек при точности 90%. Стоимость составила от $1 до $4 за профиль, а весь эксперимент обошёлся менее чем в $2 000. Классические методы без LLM давали почти нулевой результат.
Работа впервые появилась на arXiv в феврале и попала в материалы конференции USENIX Security, а на этой неделе вновь разошлась в X и Reddit. Авторы не раскрыли код и найденные личности, но предупреждают, что «практическая анонимность псевдонимных пользователей больше не существует». Публикация всплыла на следующий день после того, как комиссар SEC Хестер Пирс предостерегла от массового сбора KYC-данных, назвав это «строительством всё более крупных стогов данных». Недавние утечки в Revolut и у поставщиков аппаратного кошелька Trezor усилили опасения по поводу физических атак на держателей криптовалют. Для крипторынка это негативный сигнал: приватность и безопасность пользователей вновь оказываются под давлением.