10% 바꾸면 92%에서 66%로
OpenAI가 EU의 ChatGPT와 Codex 글에 보이지 않는 워터마크를 넣는다
OpenAI가 EU 사용자의 ChatGPT와 Codex 출력에 텍스트 워터마크를 단계적으로 넣는다. 단어 25%를 바꾸면 탐지율이 17%까지 떨어진다. 감지기는 승인된 연구기관에만 열린다.
10월 5일 OpenAI가 EU 텍스트 출처 표시 규정에 대응하는 방식을 공개했다. 앞으로 몇 주에 걸쳐 EU 지역의 ChatGPT와 Codex 사용자에게 나가는 글에 보이지 않는 워터마크를 넣는다. 글자나 문구가 눈에 보이는 게 아니라 모델이 단어를 고르는 확률 분포에 통계적 신호를 심는 방식이다. 감지기가 그 신호를 찾으면 OpenAI 모델이 쓴 글로 판정한다.
API는 전 세계 어디서든 고객이 원하면 켤 수 있고 기본값은 꺼짐이다. 감지기는 출시 시점에 일반 공개되지 않고 승인된 연구자와 전문 기관에만 열린다.
한 줄 정리
OpenAI가 EU 사용자 글에 통계형 워터마크를 넣기 시작했고, 편집을 조금만 거치면 신호가 급격히 약해져서 "AI가 쓴 글" 판별기로는 쓰기 어렵다.
한눈에 보기
| 대상 | EU의 ChatGPT, Codex |
| API | 전 세계 선택 적용, 기본 꺼짐 |
| 시기 | 발표 후 수 주에 걸쳐 단계 도입 |
| 탐지율(1% 오탐 목표) | 200토큰 약 80%, 400토큰 약 95% (표현이 자유로운 주제) |
| 단어 10% 교체 | 약 92%에서 66% |
| 단어 25% 교체 | 17% |
| 감지기 접근 | 승인된 연구자와 전문 기관 |
| 품질 영향 | 평가 도구상 유의미한 차이 없음 (OpenAI 측정) |
숫자가 그리는 한계
탐지율은 글 길이와 주제에 크게 좌우된다. 심리학처럼 같은 뜻을 여러 표현으로 쓸 수 있는 글에서는 400토큰이면 95%까지 잡힌다. 수학은 정답이 정해져 있어 단어를 바꿀 여지가 없으므로 신호를 심을 자리 자체가 적고 탐지율이 눈에 띄게 낮다.
가장 큰 변수는 사람의 손질이다. 동의어로 10%만 바꿔도 92%가 66%로 내려가고 25%를 바꾸면 17%가 남는다. 초안을 받아 문장을 다듬는 평범한 편집 과정이 신호를 지운다. 그래서 이 방식은 사람이 읽고 고친 글을 가려내는 용도가 아니라 가공 없이 대량으로 퍼지는 글을 추적하는 용도에 맞다.
팀 업무에 닿는 지점
콘텐츠 팀이 걱정할 부분은 두 가지다. 하나는 EU 소비자에게 나가는 글이다. 유럽에 뉴스레터, 상품 설명, 광고 카피를 보내는 에이전시나 커머스 팀이 ChatGPT 초안을 거의 손대지 않고 내보내면 그 글은 감지기에 걸릴 수 있다. 다른 하나는 API로 자동화한 파이프라인이다. 켜는 쪽이 선택이므로 어느 공급자의 어떤 설정으로 글이 나오는지 팀이 알고 있어야 한다.
감지기가 연구기관에만 열린다는 점도 읽어 둘 대목이다. 지금은 플랫폼과 규제 당국과 연구자가 판별 능력을 갖고 일반 팀과 독자는 갖지 못한다. 거래처나 매체가 "이 글, AI 맞나요"라고 물어 오면 팀 입장에서 확인해 줄 도구가 없다.
위시클레이 관점
워터마크가 10% 편집에 66%로 떨어진다는 건 역설적으로 편집의 값어치를 숫자로 매긴다. 사람이 문장의 4분의 1을 고치면 기계 신호는 17%만 남는다. 고친 만큼 그 글은 모델이 아니라 팀의 글이 된다는 뜻이고, 규정이 요구하는 출처 표시와 팀이 지키려는 문체가 같은 작업에서 만난다.
그래서 팀이 문서로 남길 건 AI 사용 여부가 아니라 누가 어디까지 고쳤는지다. 초안 생성, 사실 확인, 톤 수정, 최종 승인을 나눈 체크 칸 네 개만 있어도 EU 거래처가 출처를 물을 때 답이 나온다. 도구의 탐지 능력에 기대는 대신 작업 기록을 쥐고 있으면 감지기가 누구에게 열리든 상관이 없다.