본문 바로가기

IT & AI

AI 텍스트 워터마크는 단어 선택 확률에 숨어요

728x90

AI 텍스트 워터마크는 단어 선택 확률에 숨어요

AI 뉴스 썸네일
AI 뉴스 썸네일

AI가 만든 글에는 눈에 보이는 표식이 없어도 통계적인 흔적을 남길 수 있어요. 언어 모델이 다음 단어를 고를 때 특정 후보가 조금 더 자주 선택되도록 확률을 조정하는 방식이에요. 긴 글에서는 작은 편향이 쌓이지만, 짧은 문장이나 크게 고친 글은 판별하기 어려워요. 1

핵심 요약

구분확인된 내용읽을 때 볼 점
삽입 방식비밀 키가 문맥마다 단어 후보를 나누고 일부 후보의 선택 확률을 조금 높여요문장 안에 별도 문자나 메타데이터를 넣지 않아요
탐지 방식같은 키로 후보 분류를 재현한 뒤 특정 후보가 나온 비율을 통계적으로 계산해요제공자의 비밀 키나 공식 검사 서비스가 필요해요
길이 조건작은 확률 편향은 선택 지점이 많은 긴 글에서 더 분명해져요짧은 글과 코드, 인용문은 판별 근거가 부족해요
편집 영향표현을 일부 고치면 흔적이 약해지고 문장을 새로 구성하면 원래 구간이 크게 줄어요워터마크가 없다고 사람이 쓴 글이라고 단정할 수 없어요

1. 워터마크는 문자가 아니라 선택 경향에 남아요

언어 모델은 매 순간 하나의 정답 단어만 고르지 않아요. 문맥에 어울리는 여러 후보와 각 후보의 확률을 계산해 다음 토큰을 선택해요. 예를 들어 `important`, `significant`, `substantial`처럼 뜻이 비슷한 후보가 동시에 자연스러울 수 있어요. 이 선택 지점이 한 문서에 수백 번 생겨요. 2

워터마킹 시스템은 비밀 키를 이용해 후보를 임의의 그룹으로 나눠요. 널리 알려진 방식에서는 한쪽 그룹의 확률을 조금 높여요. 낮아진 그룹의 단어도 계속 선택될 수 있어서 문장이 눈에 띄게 달라지지는 않아요. 같은 단어라도 앞 문맥이 바뀌면 그룹이 달라질 수 있어요.

728x90

Google의 SynthID-Text는 후보 확률을 단순히 올리는 대신 비밀 토너먼트 방식으로 선택을 조정해요. 구현 방법은 다르지만, 텍스트에 숨은 흔적이 개별 문자보다 여러 선택의 누적 결과에 있다는 점은 같아요. 원문에 따르면 Google은 2024년부터 Gemini 앱과 웹에서 생성한 텍스트에 워터마크를 적용했어요. 작성 시점의 Gemini API는 문서화된 예외로 소개돼요. 새 Claude 모델도 2026년 8월부터 모델 수준의 표시를 적용한다고 설명해요. 2

비밀 키를 가진 쪽만 같은 분류를 재현할 수 있어요

탐지기는 문체가 AI처럼 보이는지 평가하지 않아요. 생성 때 쓴 비밀 키로 각 위치의 후보 분류를 다시 만들고, 확률을 높였던 그룹의 단어가 얼마나 자주 나왔는지 세요. 워터마크가 없거나 다른 키를 사용하면 비율은 우연한 선택에 가까워져요. 올바른 키로 긴 글을 검사하면 작은 편향이 여러 번 누적돼 통계적인 차이가 생겨요.

원문의 교육용 예시는 후보가 50대 50으로 나뉜 상황을 가정해요. 1,500단어 문서에서 한쪽 그룹이 약 55%만 나와도 탐지 기준에 닿을 수 있다고 설명해요. 5%포인트 차이는 문장 하나에서는 의미가 없어요. 선택 횟수가 충분히 많아지면 우연으로 보기 어려운 결과가 돼요. 실제 제품의 편향 강도와 판정 기준은 이 시각 예시와 같다고 볼 수 없어요. 2

짧은 글과 선택지가 적은 글은 흔적을 담기 어려워요

텍스트가 짧으면 통계가 쌓이지 않아요. 코드와 직접 인용문, 사실 목록처럼 다음 표현의 선택지가 적은 글도 워터마크를 넣을 여유가 작아요. 이런 자료에 같은 판정 기준을 적용하면 결과를 지나치게 믿기 쉬워요.

검사 권한에도 제약이 있어요. 교사나 편집자, 일반 탐지 사이트는 모델 제공자의 비밀 키가 없으면 실제 워터마크 검사를 재현할 수 없어요. Google은 SynthID 탐지 포털을 초기 접근 형태로 운영하고, Anthropic은 탐지 도구를 준비하고 있다고 원문이 전해요. 문체를 보고 AI 생성을 추정하는 서비스와 비밀 키를 쓰는 워터마크 검사는 서로 다른 기술이에요.

편집은 원래 단어 구간을 줄여 흔적을 약하게 만들어요

여러 워터마킹 방식은 바로 앞의 짧은 문맥으로 현재 단어의 분류를 정해요. 검사에 쓸 수 있는 증거가 남으려면 대상 단어와 주변 단어의 조합이 원문과 같아야 해요. 오타 수정이나 가벼운 교정은 많은 구간을 보존해 흔적을 약하게 만들 뿐 완전히 없애지 못할 수 있어요.

문장의 의미를 바탕으로 표현을 새로 구성하면 원래 단어 구간이 크게 줄어요. 원문 작성자가 공개 구현인 KGW와 EXP를 대상으로 진행한 실험에서는 전체 재구성 뒤 원래 구간의 약 0.5%만 남았어요. 탐지 정확도는 AUC 0.99 수준에서 약 0.5로 낮아졌다고 해요. 이 결과는 공개 방식에 대한 실험이에요. Anthropic의 실제 운영 방식은 공개되지 않아 Claude의 워터마크에 같은 결과가 나온다고 단정할 수 없어요. 2

모든 워터마크가 편집에 똑같이 반응하지도 않아요. 앞 문맥보다 단어 자체에 연결한 방식은 같은 의미로 다시 써도 일부 단어가 유지돼 흔적이 더 오래 남을 수 있어요. 의미 공간에 패턴을 숨기는 방식도 단순한 표현 변경을 견딜 수 있어요. 워터마크의 존재 여부를 말할 때는 어떤 방식과 키, 검사 조건을 썼는지 함께 확인해야 해요.

왜 중요한가요

워터마크가 검출됐다는 결과는 해당 문장이 처음부터 끝까지 AI가 썼다는 증거가 아니에요. 사람의 글을 모델이 교정하거나 번역하는 과정에서도 표시가 붙을 수 있어요. 이 경우 검사 결과가 말해 주는 범위는 특정 모델의 처리를 거쳤을 가능성이에요. 작성 주체와 편집 책임까지 판정하지는 못해요. 2

반대로 워터마크가 발견되지 않아도 사람이 쓴 글이라고 확인된 것은 아니에요. 표시 기능이 없는 이전 모델을 썼을 수 있고, 글이 너무 짧거나 편집으로 흔적이 약해졌을 수도 있어요. 교육과 출판, 플랫폼 운영에서 자동 판정을 쓴다면 문서 길이와 텍스트 종류, 제공자별 검사 가능 여부를 함께 기록해야 해요.

콘텐츠 출처를 확인할 때는 워터마크를 하나의 기술적 신호로 다루는 편이 안전해요. 검사 결과만으로 부정행위나 저작 주체를 확정하면 처리와 작성의 차이를 놓칠 수 있어요. 제공자가 공개한 적용 범위와 예외, 오탐지 기준을 확인하고 다른 근거와 함께 판단해야 해요.

참고 자료

  1. AI 텍스트 워터마킹의 작동 원리 — GeekNews
  2. How AI text watermarking works: a visual guide — declaude
728x90