본문 바로가기

IT & AI

LLM과 파일 압축이 같은 수학을 쓰는 이유

728x90

LLM과 파일 압축이 같은 수학을 쓰는 이유

AI 뉴스 썸네일
AI 뉴스 썸네일

파일 압축기와 대규모 언어 모델은 겉으로 전혀 다른 도구예요. 하지만 둘 다 앞에 나온 문맥으로 다음 데이터를 예측하고, 그 확률을 성능으로 바꿔요. 예측이 정확할수록 파일에는 더 적은 비트가 필요하고 언어 모델의 손실도 낮아져요. 1

핵심 요약

구분핵심왜 볼 만한가요
데이터 압축자주 나오거나 예측하기 쉬운 기호에는 짧은 비트 표현을 배정해요문맥을 잘 읽는 모델일수록 같은 데이터를 더 작게 표현할 수 있어요
언어 모델앞선 토큰을 바탕으로 다음 토큰의 확률 분포를 계산해요실제 토큰에 높은 확률을 주는 능력이 압축률과 직접 이어져요
현실의 한계LLM은 모델 파일과 연산 비용이 커요gzip이나 Brotli를 당장 대체하기보다 두 기술의 공통 원리를 이해하는 데 의미가 있어요

1. 예측하기 쉬운 데이터는 적은 비트로 저장해요

압축은 반복된 문자를 찾아 줄이는 작업에서 출발해요. `AAAAAAAAAA`를 문자 10개로 보관하는 대신 `A가 10번`이라는 규칙으로 기록하면 크기가 줄어요. 실제 압축기는 반복 횟수만 세지 않아요. 기호가 등장할 확률을 계산하고, 자주 나오거나 문맥상 예상하기 쉬운 기호에 더 짧은 표현을 줘요. 1

문맥이 들어오면 확률은 더 정교해져요. 영어에서 `U`는 전체 문자만 놓고 보면 특별히 흔하지 않지만 `Q` 뒤에서는 자주 나와요. 압축 모델이 앞 문자를 알고 있다면 `Q` 다음의 `U`를 짧게 표현할 수 있어요. 원문 예제에서는 이전 문자 하나를 문맥으로 썼을 때 `TO BE OR NOT TO BE`에 필요한 크기가 약 47비트에서 21비트로 줄어요.

728x90

확률을 실제 비트로 바꾸는 과정

압축기는 대체로 데이터를 정리하는 변환, 기호별 확률을 구하는 모델, 확률을 비트열로 바꾸는 엔트로피 부호화 단계를 거쳐요. 산술 부호화는 확률이 높은 기호에 넓은 수 구간을 배정해요. 실제 데이터가 모델의 예상과 자주 맞으면 최종 구간을 표시하는 데 필요한 비트가 줄어요.

이 관계는 정보량을 계산하는 식 `-log₂(p)`로도 볼 수 있어요. 실제 다음 기호의 확률 `p`가 높으면 필요한 비트 수가 작아요. 확률이 낮은 기호가 나오면 더 많은 비트가 필요해요. 압축률은 모델이 실제 데이터를 얼마나 덜 놀라워했는지 보여주는 셈이에요.

LLM도 다음 토큰의 확률을 계산해요

LLM은 앞에 나온 토큰을 읽고 다음 토큰 후보마다 확률을 매겨요. 텍스트를 생성할 때는 이 분포에서 다음 토큰을 고르고, 학습할 때는 실제 토큰에 얼마나 높은 확률을 줬는지 확인해요. 실제 토큰을 잘 맞힐수록 크로스 엔트로피 손실이 낮아져요.

같은 확률 분포를 압축에 쓰면 언어 모델은 곧 압축 모델이 돼요. 이미 저장할 원문이 있으므로 새 토큰을 생성할 필요는 없어요. 모델이 실제 토큰에 준 확률을 산술 부호화 같은 방식으로 비트열에 옮기면 돼요. 다음 토큰 예측 성능이 좋아질수록 필요한 평균 비트 수도 줄어요. 2

좋은 압축기가 곧 실용적인 압축기는 아니에요

LLM이 높은 압축률을 낼 수 있어도 일반 파일 압축에 바로 쓰기는 어려워요. 복원하는 쪽에도 동일한 모델이 있어야 하고, 수 GB에 이르는 모델 파일과 추론 연산을 감당해야 해요. 웹 문서 몇 KB를 줄이려고 거대한 모델을 실행하면 전송량 절감보다 계산 비용이 더 커질 수 있어요.

gzip과 Brotli는 모델이 작고 빠르며 다양한 환경에서 안정적으로 돌아가요. LLM 기반 압축은 예측력만 보면 흥미롭지만 속도, 메모리, 배포 크기까지 합치면 용도가 제한돼요. 압축률 하나만으로 압축기의 실용성을 판단하기 어려운 이유예요.

왜 중요한가요

이 관점은 LLM 평가 지표를 더 구체적으로 이해하게 해줘요. 손실이나 퍼플렉시티가 낮다는 말은 실제 다음 토큰에 더 높은 확률을 줬다는 뜻이에요. 같은 데이터를 표현하는 데 필요한 평균 비트 수가 줄었다고 해석할 수도 있어요. 추상적으로 보이는 모델 점수가 정보량과 연결돼요. 1

개발자에게는 압축과 생성 모델을 별개의 분야로만 보지 않게 해주는 설명이기도 해요. 문맥 길이, 토큰화 방식, 확률 보정이 달라지면 생성 품질뿐 아니라 데이터를 표현하는 효율도 바뀌어요. 다만 낮은 손실이 사실성이나 추론 능력을 모두 보장하지는 않아요. 다음 토큰을 잘 예측하는 능력과 답변의 정확성은 겹치는 부분이 있지만 같은 평가지표는 아니에요.

참고 자료

  1. Compression is prediction — ngrok Blog
  2. 압축은 예측이다 — GeekNews
728x90