EU AI Act에 따른 Anthropic의 워터마킹 조치, 텍스트 품질 저하 논란
- 생성형 AI 확산과 함께 저품질 AI 콘텐츠인 ‘AI 슬롭(AI Slop)’이 증가하면서 AI 생성물의 식별·투명성 강화 필요성도 커지고 있음
- 이에 EU의 AI Act는 AI 생성 콘텐츠에 사람이 쉽게 인식할 수 없는 표시를 삽입해 합성 콘텐츠 식별과 허위 정보 위험 완화를 요구함
- Anthropic은 EU의 AI 투명성 행동규범 이행(AI transparency code)을 위해 AI 생성 텍스트에 비가시적 워터마크를 도입한다고 밝힘
- 그러나 구체적인 방식이 공개되지 않으면서, 일각에서는 Anthropic이 텍스트에 보이지 않는 특수문자나 표시를 추가하는 것 아니냐는 우려가 제기됨
단어 선택에 미세한 패턴 삽입
- Anthropic은 후속 설명을 통해 자사의 방식이 구글이 2024년 공개한 SynthID 기반 워터마킹 기술에 기반한다고 밝힘
- 생성형 AI는 앞서 생성된 내용을 바탕으로 다음에 등장할 가능성이 높은 단어나 토큰을 예측하면서 문장을 만들어냄
- 워터마킹 기술은 이러한 의미나 품질에 큰 영향을 주지 않는 단어 선택 과정에 미세한 편향을 적용하는 방식임
- 이러한 선택이 긴 텍스트에 걸쳐 반복되면 일정한 통계적 패턴이 형성되고, 이후 분석을 통해 해당 텍스트가 AI에 의해 생성됐는지를 판별할 수 있음
전문가, “충분히 긴 텍스트에서는 품질 문제 없어”
- EU AI 투명성 행동규범 작성에 공동의장으로 참여한 셰필드대학교 교수는 워터마킹의 텍스트 품질 저하 가능성이 주로 매우 짧은 텍스트에 한정된다고 설명함
- 실제로 행동규범 작성 과정에서도 이 문제가 집중적으로 논의됐으며, 주요 AI 기업들과 협의를 거쳐 워터마킹 적용이 가능한 최소 텍스트 길이에 대한 기준을 마련함
- 이에 따라 EU 행동규범에서는 200토큰(약 150단어)을 초과하는 텍스트에 대해서만 워터마킹을 적용하도록 하고 있음
- 집행위 역시 워터마킹이 최신 기술 수준에 맞춰 설계돼 텍스트 품질을 저해하지 않는다고 강조했으며, OpenAI·Google·Mistral 등 주요 AI 기업도 이를 적용하기로 함
워터마크 제거 기술과의 경쟁 가능성
- 한편 Anthropic의 발표 이후 Claude가 생성한 텍스트의 워터마크를 제거할 수 있다고 주장하는 도구들도 등장하고 있음
- 관계자는 워터마크를 완전히 제거하는 것이 불가능한 것은 아니라고 인정하면서도, 단순한 메타데이터 태그보다 우회하거나 제거하기 어렵다고 설명함
- 또한, 악의적인 목적으로 AI 콘텐츠를 생성하려는 이용자에게도 해당 콘텐츠가 추후 탐지될 수 있다는 부담을 줄 수 있을 만큼 충분한 효과가 있을 것으로 평가함
