OpenAI, EU 챗GPT 문장에 투명 워터마크 추가

OpenAI는 10월 5일 EU AI법 제50조의 투명성 요건에 대응하기 위해 textGrain이라는 텍스트 워터마크 기술을 발표했다. 앞으로 몇 주 안에 EU 지역의 해당 ChatGPT·Codex 사용자가 받는 모델 생성 텍스트에는 눈으로는 보이지 않지만 기계로 식별할 수 있는 통계적 신호가 자동으로 붙게 된다.

같은 날부터 전 세계 API 고객도 일부 모델에서 이 기능을 수동으로 켤 수 있으며, 기본값은 꺼짐이다. 어떤 모델이 지원되는지는 발표에서 밝히지 않았다.

워터마크는 단어 선택 속에 숨어 있다

textGrain은 모델이 단어를 고르는 과정에 손을 댄다. 문장 곳곳에는 똑같이 적합한 후보 단어가 여럿 있는 경우가 많은데, OpenAI는 키를 이용해 최종적으로 어느 단어를 쓸지 결정한다. 한 문장만 보면 전혀 이상하지 않지만, 글이 충분히 길어지면 키가 선호하는 단어가 통계적으로 식별될 만큼 쌓이고, 키를 가진 쪽은 이 패턴으로 해당 텍스트가 워터마크가 적용된 모델에서 나왔는지 판단할 수 있다.

OpenAI가 제시한 검출 데이터는 오탐률 1%를 전제로 한다.

  • 200토큰 분량 글에서는 검출률이 약 80%
  • 400토큰에서는 약 95%
  • 400토큰 글에서 단어의 10%를 동의어로 바꾸면 검출률이 66%로 떨어짐
  • 25%를 바꾸면 17%까지만 남음

즉 독자가 ChatGPT가 쓴 글을 살짝만 고쳐도 워터마크는 거의 식별되지 않는다는 뜻이다. OpenAI도 설명에서 이 점을 피하지 않았다.

품질 면에서는 8개 벤치마크에서 워터마크를 켰을 때와 껐을 때 성적 차이가 노이즈 수준에 그쳤으며, 그중 한 항목은 49.57 대 49.76이었다고 밝혔다.

탐지기는 일반에 공개되지 않는다

이 방식에서 가장 제한이 큰 부분은 탐지 쪽이다. OpenAI는 같은 날 신청 창구를 열었지만, 탐지기는 "승인된 연구자와 전문 기관"에만 제공되며 건별로 심사한다. 일반 사용자나 학교, 출판사가 직접 글을 검사할 방법은 현재로서는 없다.

OpenAI는 설명문에서 다음과 같이 선을 그었다.

"A watermark does not measure human contribution, does not establish ownership or responsibility, does not identify the user, and does not verify accuracy."

(워터마크는 인간의 기여도를 측정하지 않으며, 소유권이나 책임을 확정하지 않고, 사용자를 식별하지도, 내용의 정확성을 검증하지도 않는다.)

회사는 또 워터마크가 검출되지 않았다고 해서 그 글이 사람이 쓴 것이라는 증거는 아니라고 덧붙였다.

규제 일정표

EU AI법 제50조는 생성 AI 제공자가 출력물을 기계가 'AI 생성'으로 식별할 수 있게 만들도록 요구한다. 공개된 일정에 따르면 이 조항은 8월 2일부터 적용되며, 이미 가동 중인 시스템에는 12월 2일까지 준수 유예 기간이 주어진다. OpenAI가 'EU에서 몇 주 안에' 적용하겠다고 한 시점은 대략 이 기간에 들어맞는다.

이는 기본값이 EU에서만 켜져 있는 이유도 설명해 준다. 다른 지역에서는 ChatGPT와 Codex 출력에 당분간 워터마크가 붙지 않으며, API 사용자는 원할 경우 직접 켤 수 있다.

같은 길을 가는 다른 업체들

텍스트 워터마크 분야에는 지난 1년 사이 여러 업체가 뛰어들었다.

구글 딥마인드의 SynthID는 텍스트 워터마크를 가장 먼저 내놓았고, 샘플링에 편향을 주는 같은 원리를 쓰며 이후 텍스트 부분을 오픈소스로 공개했다. 9월 말에는 같은 발상을 AI가 설계한 단백질 서열에도 적용했다. 외신 보도에 따르면 OpenAI는 textGrain의 성능이 SynthID와 비슷하거나 약간 더 낫다고 자체 평가한다고 하는데, 이 주장은 아직 제3자 검증을 거치지 않았다.

Anthropic은 8월 Claude의 텍스트 출력에 워터마크를 적용한다고 발표했는데, 방식이 비슷해 '다시 쓰면 무력화된다'는 같은 문제를 안고 있다. 추론 프레임워크 vLLM은 9월 Gumbel 샘플링 기반 텍스트 워터마크를 기본 옵션으로 넣었다. 테스트에서는 창작 글쓰기의 경우 약 100토큰에서 거의 전부를 식별했지만, 코드 작업은 400토큰에서도 43%만 식별됐다.

이 수치들을 함께 놓고 보면 공통된 경향이 뚜렷하다. 글이 길고 자유롭게 쓰일수록 워터마크를 식별하기 쉽고, 코드·수식·사실 확인형 질의응답처럼 답이 거의 하나로 정해진 내용은 단어 선택에 편향을 줄 여지가 적어 신호가 원래부터 약하다. textGrain이 공개한 수치는 일반 텍스트 기준이며, 코드 상황에 대해서는 OpenAI가 별도 수치를 제시하지 않았다.

중국 본토 사용자에게는 이번 변화가 당장 미치는 영향이 크지 않다. 워터마크는 기본값으로 EU에서만 켜지고, ChatGPT는 원래 중국에서 직접 쓸 수 없었기 때문이다. 중국 자체의 '인공지능 생성·합성 콘텐츠 표시 방법'은 지난해 9월부터 시행 중인데, 명시적 표시와 비명시적 메타데이터 표시를 함께 요구하는 다른 방식을 쓰고 있다.

참고 출처: OpenAI의 EU 텍스트 출처 관련 설명, AI Weekly, CocoLoop, CellCog 기술 분석; 검출률은 오탐률 1% 기준이며, 법 적용 시점은 EU가 공개한 일정을 따른다.