IT & AI

코드를 이미지로 바꿔 AI 비용을 줄이는 실험, pxpipe가 던진 질문

헬조선의 알파고 2026. 7. 5. 10:22
728x90

코드를 이미지로 바꿔 AI 비용을 줄이는 실험, pxpipe가 던진 질문

AI 뉴스 썸네일
AI 뉴스 썸네일

AI 코딩 도구를 오래 쓰면 비용의 상당 부분이 코드 작성보다 입력 컨텍스트에서 나와요. pxpipe는 이 지점을 파고든 오픈소스 도구예요. 긴 코드와 도구 출력, 오래된 대화 흐름을 텍스트 대신 PNG 이미지로 넘겨 입력 토큰을 줄이는 방식이에요.

728x90

핵심 요약

구분핵심왜 볼 만한가요
비용 구조pxpipe는 큰 입력 블록을 이미지로 바꿔 Fable 기준 전체 청구액을 약 59~70% 낮췄다고 밝혔어요AI 코딩 도구 비용이 커지는 팀이라면 입력 토큰 최적화가 바로 운영비 문제로 이어져요
작동 원리이미지 토큰 비용은 이미지 안 글자 수보다 픽셀 크기에 더 크게 묶여요코드, JSON, 로그처럼 글자가 빽빽한 자료는 이미지 한 장에 많이 담을 수 있어요
주의점정확한 해시, ID, 비밀값 같은 정보는 이미지로 넘기면 틀리게 기억할 수 있어요비용 절감보다 정확성이 중요한 영역은 텍스트로 남겨야 해요
적용 범위최근 대화, 사용자 입력, 모델 출력은 그대로 두고 오래된 대량 입력만 바꿔요무작정 압축하는 방식이 아니라 손실 위험이 큰 구간을 피하려는 설계예요

1. AI 코딩 도구 비용을 텍스트가 아니라 이미지로 줄이는 방식이에요

pxpipe는 Claude Code 앞단에 놓는 로컬 프록시예요. 요청이 모델로 가기 전에 큰 `tool_result`, 오래된 대화 이력, 정적 시스템 지시문과 도구 문서를 PNG 이미지로 바꿔요. 원문 README는 실제 Claude Code 트래픽에서 밀집 텍스트가 이미지 토큰당 약 3.1자를 담았고, 텍스트 토큰은 약 1자 수준이었다고 설명해요. 이 차이를 이용해 Fable 정가 기준 전체 청구액이 약 59~70% 줄었다는 계산을 내놨어요. 1

핵심은 모델이 텍스트를 읽는 경로와 이미지를 읽는 경로의 과금 방식이 다르다는 점이에요. 이미지 안에 글자가 얼마나 들어갔는지보다 이미지의 픽셀 크기가 비용에 더 직접적으로 반영돼요. 그래서 코드, JSON, 로그처럼 빽빽한 자료는 텍스트 그대로 보내는 것보다 이미지로 접어 넣을 때 비용이 줄 수 있어요. pxpipe README의 예시는 약 48,000자를 이미지 한 장에 담아 텍스트 약 25,000토큰을 이미지 약 2,700토큰 수준으로 줄였다고 설명해요. 2

압축 대상은 오래되고 큰 입력이에요

pxpipe가 모든 내용을 이미지로 바꾸는 건 아니에요. 사용자 메시지, 최근 턴, 모델 출력, 짧거나 희소한 글은 텍스트로 그대로 지나가요. 대신 비용을 많이 차지하는 오래된 히스토리와 큰 도구 출력, 정적 문서 덩어리를 대상으로 잡아요.

이 설계는 AI 코딩 세션의 실제 흐름과 맞물려 있어요. 최근에 사용자가 지시한 내용이나 모델이 방금 작성한 코드는 정확성이 중요해요. 반면 오래된 로그나 도구 문서처럼 배경으로 깔리는 자료는 대체로 전체 흐름을 잡는 용도예요. pxpipe는 후자에 손실 압축을 적용하는 쪽을 택했어요.

비용 절감 수치는 직접 로그로 확인하게 돼 있어요

README는 절감률을 입력 일부가 아니라 전체 청구액 기준으로 계산했다고 설명해요. 작은 요청, 캐시 읽기와 쓰기, 출력 토큰까지 포함한 전체 비용을 비교했다는 뜻이에요. 요청마다 원래 텍스트 본문에 대한 토큰 카운터를 같이 돌리고, 실제 청구 사용량과 같은 로그 행에 남기는 구조예요.

이 부분은 꽤 중요해요. 입력 토큰만 줄였다고 전체 비용이 같은 비율로 줄지는 않기 때문이에요. 출력이 길어지거나 캐시 구조가 달라지면 계산이 흔들릴 수 있어요. pxpipe는 이 혼선을 줄이려고 요청별 로그를 `~/.pxpipe/events.jsonl`에 남기게 했어요.

손실 압축이라는 점은 숨기지 않아요

이 방식은 정확한 문자열을 보존하는 압축이 아니에요. README에 따르면 12자 hex 문자열 회상 테스트에서 Fable 5는 13/15를 맞췄지만, Opus는 0/15였어요. 더 까다로운 점은 틀릴 때 오류를 내는 게 아니라 그럴듯한 오답을 낼 수 있다는 거예요. 2

그래서 ID, 해시, 비밀값, 숫자처럼 한 글자라도 틀리면 안 되는 값은 텍스트로 남겨야 해요. 코딩 작업에서는 파일을 다시 읽고 테스트를 돌리는 절차가 어느 정도 안전망이 될 수 있어요. 하지만 사람 이름, 과거 대화의 정확한 표현, 특정 식별자를 기억해야 하는 순수 대화형 작업에서는 위험이 커져요.

모델마다 결과가 크게 달라요

pxpipe는 기본 적용 모델을 Fable 5와 GPT 5.6 쪽으로 잡고, Opus 4.7/4.8과 GPT 5.5는 명시적으로 켜야 쓰도록 뒀어요. 이유는 간단해요. 이미지로 바뀐 컨텍스트를 모델마다 읽는 능력이 다르게 나오기 때문이에요.

벤치마크도 같은 방향을 보여줘요. Fable 5는 새 랜덤 숫자 산술, gist recall, state tracking 같은 평가에서 텍스트 조건과 비슷한 결과를 냈다고 적혀 있어요. 반면 Opus는 일부 이미지화된 문구 카운트나 정확 문자열 회상에서 약한 모습을 보였어요. 이 도구를 쓴다면 모델 이름만 보고 켜기보다, 실제 업무 로그에서 오독이 생기는지 먼저 봐야 해요.

왜 중요한가요

AI 도구 비용 최적화가 단순히 더 싼 모델을 고르는 문제에서 벗어나고 있어요. 같은 모델을 쓰더라도 무엇을 텍스트로 보내고, 무엇을 이미지나 다른 표현으로 바꿀지에 따라 청구액과 정확도가 달라져요. pxpipe는 이 경계를 노골적으로 실험한 사례예요.

개발팀 입장에서는 흥미롭지만 바로 도입하기엔 확인할 게 많아요. 코드베이스가 크고 로그가 긴 팀은 비용 절감 여지가 클 수 있어요. 반대로 보안 값, 빌드 산출물 ID, 고객 식별자처럼 정확한 문자열이 자주 오가는 팀은 실수 비용이 더 클 수 있어요.

이 뉴스가 남기는 질문도 분명해요. 멀티모달 모델이 텍스트를 이미지로 읽는 비용 구조가 계속 유지될까요. 아니면 서비스 제공자가 과금 정책을 바꿔 이런 차이를 줄일까요. 어느 쪽이든 AI 에이전트 시대의 비용 관리는 모델 가격표만 보는 방식으로는 부족해지고 있어요. 입력을 어떻게 포장해 모델에 넘기는지가 새로운 최적화 영역이 되고 있어요. 1

참고 자료

  1. Fable 비용 60% 절감: 코드를 이미지로 변환하고 모델이 OCR하게 하기 — GeekNews
  2. pxpipe README — GitHub
728x90