본문 바로가기

IT & AI

Claude Opus 5 출시, Fable급 성능을 절반 비용에 겨냥했어요

728x90

Claude Opus 5 출시, Fable급 성능을 절반 비용에 겨냥했어요

AI 뉴스 썸네일
AI 뉴스 썸네일

Anthropic이 Claude Opus 5를 공개했어요. 회사는 코딩과 지식 업무에서 Fable 5에 가까운 성능을 작업당 절반 비용으로 제공한다고 설명해요. 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 이전 Opus 4.8과 가격도 같아요. 다만 공개 수치는 Anthropic 내부 평가가 적지 않아 실제 업무에서는 비용과 정확도를 함께 확인해야 해요. 1 2

핵심 요약

구분핵심왜 볼 만한가요
성능Frontier-Bench와 지식 업무 평가에서 높은 점수를 제시했어요긴 코딩 작업과 컴퓨터 사용 능력을 중심으로 개선 폭을 확인할 수 있어요
비용입력 5달러, 출력 25달러로 Opus 4.8과 같아요기존 Opus 사용자는 단가를 유지한 채 새 모델을 비교할 수 있어요
제품Claude Max 기본 모델이며 Claude Pro의 가장 강한 모델로 들어갔어요최상위 모델의 성능이 API와 구독 제품에 함께 배치됐어요
안전취약점 탐지는 허용하지만 침투 테스트와 익스플로잇 생성에는 제한을 둬요보안 업무에서는 모델 역량과 사용 제한을 따로 살펴야 해요

1. Opus 5는 성능뿐 아니라 작업당 비용을 앞세웠어요

Anthropic은 Opus 5를 매일 쓰는 고성능 모델로 소개했어요. Frontier-Bench v0.1에서는 Opus 4.8보다 성능이 2배 넘게 올랐고 작업당 비용은 더 낮았다고 밝혔어요. CursorBench 3.2의 최대 추론 설정에서는 Fable 5 최고점과 0.5% 이내 차이를 보이면서 작업당 비용은 절반이었다고 해요. Claude Max에서는 새 기본 모델로, Claude Pro에서는 가장 강한 모델로 제공돼요. 2

가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러예요. 이전 Opus 4.8과 같아요. 약 2.5배 빠른 Fast 모드도 있지만 기본 가격의 2배가 들어요. 속도를 높이면 비용도 함께 오르므로, 짧은 응답 시간 자체가 중요한 작업인지 먼저 따져볼 필요가 있어요. 2

코딩 외 업무에서도 긴 작업을 끝내는 능력을 강조했어요

Anthropic이 공개한 평가에서 Opus 5는 ARC-AGI 3 점수가 다음 모델보다 3배 높았어요. 업무 자동화 평가인 Zapier AutomationBench에서는 같은 작업당 비용 기준으로 다음 모델보다 약 1.5배 높은 통과율을 기록했다고 해요. 컴퓨터 사용 평가인 OSWorld 2.0에서는 Fable 5 최고 결과를 3분의 1을 조금 넘는 비용으로 앞섰다고 밝혔어요. 2

회사가 소개한 사례도 결과 확인과 반복에 초점을 맞춰요. Opus 5는 기계 부품 도면의 픽셀에서 형상을 뽑는 컴퓨터 비전 도구를 직접 만들고, 이를 이용해 3D 모델을 재구성했어요. 오픈소스 패키지 관리자의 버그 사례에서는 기존 패치가 놓친 경계 조건까지 찾아 고쳤다고 해요. 개발팀이 체감할 변화는 코드 생성량보다 긴 작업에서 오류를 찾아 다시 고치는 능력에 가까워 보여요. 2

벤치마크 숫자는 실제 업무 비용과 분리해서 봐야 해요

발표에 나온 Frontier-Bench 결과는 mini-SWE-agent 구성과 GKE 백엔드에서 작업마다 5번 시도한 평균 보상이에요. 안전 분류기가 요청을 거부한 경우에는 Opus 4.8을 대체 모델로 사용했어요. 이런 조건은 모델 단독 성능과 운영 시스템의 성능을 완전히 분리하기 어렵게 만들어요. 사내 코드베이스에서는 성공률뿐 아니라 재시도 횟수, 사람의 수정 시간, 토큰 사용량을 함께 재는 편이 맞아요. 2

보안 작업은 성능과 허용 범위가 달라요

Opus 5는 소스코드에서 취약점을 찾는 작업을 허용해요. 반면 바이너리 기반 취약점 스캔, 침투 테스트, 익스플로잇 생성은 차단해요. Anthropic은 취약점 발견 능력이 Mythos 5에 근접했지만, 발견한 취약점을 실제 공격으로 바꾸는 능력은 크게 뒤처진다고 밝혔어요. 보안팀이 도입할 때는 모델 점수만 보지 말고 필요한 작업이 정책상 허용되는지 먼저 확인해야 해요. 2

API에는 안전 분류기에 걸린 요청을 다른 모델로 보내는 자동 대체 기능이 베타로 추가됐어요. 대화 도중 사용할 도구를 바꿔도 캐시를 무효화하지 않는 기능도 함께 나왔어요. 여러 모델을 함께 운영하는 팀이라면 응답 차단을 줄일 수 있지만, 대체 모델이 바뀌었을 때 품질과 비용 기록도 따로 남겨야 해요. 2

왜 중요한가요

이번 발표에서 볼 부분은 최고 점수 하나보다 가격과 배치 방식이에요. Opus 5는 기존 Opus 4.8과 같은 토큰 단가로 들어왔고, Max와 Pro 구독에도 바로 배치됐어요. 고성능 모델을 일부 특수 작업에만 쓰기보다 일상적인 코딩과 문서 업무에 투입하려는 선택지예요. 2

도입 판단에는 자체 평가가 필요해요. 대표 작업 20~30개를 골라 Opus 4.8, Opus 5, 현재 쓰는 모델을 같은 조건에서 비교해 보세요. 첫 시도 성공률, 총 토큰 비용, 완료 시간, 사람이 고친 줄 수를 기록하면 발표 자료의 작업당 비용이 실제 환경에서도 이어지는지 확인할 수 있어요. 보안이나 생명과학 업무라면 자동 대체가 발생한 비율과 차단된 작업 유형도 함께 봐야 해요.

728x90

참고 자료

  1. Anthropic Opus 5 출시 — GeekNews
  2. Introducing Claude Opus 5 — Anthropic
728x90