본문 바로가기

IT & AI

Claude Code 토큰 비용을 줄이는 세션 운영법

728x90

Claude Code 토큰 비용을 줄이는 세션 운영법

AI 뉴스 썸네일
AI 뉴스 썸네일

Claude Code는 같은 코드를 고쳐도 세션을 어떻게 운영하느냐에 따라 토큰 사용량이 달라져요. Anthropic은 작업을 바꿀 때 대화를 비우고, 필요한 파일과 명령 출력만 남기는 방법을 공식 블로그에서 소개했어요. 2

핵심 요약

구분핵심왜 볼 만한가요
세션 길이새 작업은 `/clear`, 같은 작업의 단계 전환은 `/compact`가 맞아요이전 작업의 파일과 명령 결과가 다음 요청마다 다시 들어가는 일을 줄여요
캐시모델과 effort 수준은 세션 시작 전에 정해요긴 대화 중간에 설정을 바꾸면 기존 캐시를 다시 쓰기 어려워져요
파일 전달필요한 파일은 첫 요청에서 `@`로 지정해요저장소 검색과 불필요한 파일 읽기를 줄일 수 있어요
명령 출력테스트와 빌드에는 조용한 출력 옵션을 써요긴 로그가 남은 모든 턴의 컨텍스트를 차지하는 일을 막아요
작업 분리출력이 많은 조사는 별도 실행 환경에 맡겨요주 작업 세션에는 요약된 결과만 돌아와 컨텍스트가 덜 복잡해져요

1. Claude Code 비용은 세션 안에 무엇을 오래 남기느냐에 달렸어요

Claude Code는 파일을 읽거나 명령을 실행할 때마다 그 결과를 대화에 붙여요. 이후 요청은 앞선 대화 전체를 다시 포함해요. 40번째 턴에는 앞선 39개 턴의 내용도 함께 들어가므로, 같은 작업이라도 긴 세션 하나에 몰아넣으면 더 많은 토큰을 써요. Anthropic은 세션 비용을 컨텍스트에 들어간 토큰 수, 토큰이 남아 있는 턴 수, 동시에 실행하는 컨텍스트 수로 설명해요. 2

새 기능으로 넘어갈 때는 `/clear`로 이전 대화를 비우는 편이 좋아요. 같은 기능 안에서 조사나 구현 단계가 끝났다면 `/compact`로 필요한 내용만 압축할 수 있어요. 최근 몇 턴만 잘못 흘렀다면 `/rewind`가 더 알맞아요. 대화 끝부분만 덜어내므로 앞부분의 캐시를 유지할 수 있기 때문이에요.

728x90

출력 토큰은 입력보다 비싸요

공식 설명에 따르면 출력 토큰 가격은 입력 토큰의 약 5배예요. 모델이 답을 한 토큰씩 생성하는 동안 연산 장치를 더 오래 쓰기 때문이에요. 캐시 읽기 가격은 일반 입력의 0.1배이고, 캐시 쓰기는 최대 2배까지 들 수 있어요. 처음 한 번 저장한 내용을 다음 턴부터 0.1배 가격으로 읽을 수 있으므로, 대화 앞부분을 안정적으로 유지하면 반복 비용을 낮출 수 있어요. 2

모델, effort 수준, Fast mode는 캐시 키에 영향을 줘요. 긴 대화 중간에 이 설정을 바꾸면 다음 요청에서 앞선 내용을 다시 처리할 수 있어요. 설정 변경이 필요하다면 세션을 시작할 때나 `/clear` 직후가 나아요. 구독형 캐시는 마지막 턴에서 1시간이 지나면 만료되고, API 키를 쓸 때는 기본 5분 뒤 만료돼요. 오래 자리를 비우기 전 캐시가 남아 있을 때 `/compact`를 실행하면 나중에 전체 대화를 다시 읽는 부담을 줄일 수 있어요.

파일과 로그는 필요한 만큼만 남겨요

"테스트가 실패해요"처럼 범위가 넓은 요청은 저장소 검색과 여러 파일 읽기로 이어질 수 있어요. 실패한 테스트 파일을 처음부터 `@`로 지정하면 검색 단계를 줄여요. 같은 파일을 다음 턴에서 다시 지정하면 사본이 하나 더 붙을 수 있으니 한 세션에서는 한 번만 첨부하는 게 좋아요.

테스트, 빌드, `git log` 출력도 파일 내용과 똑같이 대화에 남아요. 30,000자를 넘는 출력은 파일로 빠지고 짧은 미리보기만 들어가지만, 그보다 짧은 로그는 통째로 컨텍스트에 들어갈 수 있어요. 테스트 러너의 quiet 옵션이나 짧은 리포터를 기본 명령에 넣으면 매 턴 따라다니는 로그를 줄일 수 있어요. 로그 분석처럼 출력이 많은 작업은 별도 실행 환경에서 처리하고 요약만 받아오는 방식이 효율적이에요. 1

왜 중요한가요

AI 코딩 도구의 비용은 모델 가격표만으로 결정되지 않아요. 어떤 파일을 읽혔는지, 명령이 얼마나 길게 출력됐는지, 그 내용이 몇 턴 동안 남았는지가 실제 사용량을 바꿔요. 개발팀은 모델을 무조건 낮추기보다 작업 경계를 분명히 나누고 불필요한 로그를 줄이는 것부터 적용할 수 있어요. 2

간단한 운영 기준도 만들 수 있어요. 새 작업은 `/clear`로 시작하고, 모델과 effort 수준을 먼저 확인해요. 필요한 파일은 첫 요청에 한 번만 붙여요. 테스트 명령에는 짧은 출력 옵션을 넣어요. 이 네 가지만 지켜도 Claude Code가 실제 작업과 관계없는 내용을 반복해서 읽는 횟수를 줄일 수 있어요.

참고 자료

  1. Claude Code 세션의 가치를 극대화하는 방법 — GeekNews
  2. Maximizing the value of your Claude Code sessions — Claude by Anthropic
728x90