본문 바로가기

728x90

CursorBench

(2)
Claude Opus 5 출시, Fable급 성능을 절반 비용에 겨냥했어요 Claude Opus 5 출시, Fable급 성능을 절반 비용에 겨냥했어요AI 뉴스 썸네일Anthropic이 Claude Opus 5를 공개했어요. 회사는 코딩과 지식 업무에서 Fable 5에 가까운 성능을 작업당 절반 비용으로 제공한다고 설명해요. 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 이전 Opus 4.8과 가격도 같아요. 다만 공개 수치는 Anthropic 내부 평가가 적지 않아 실제 업무에서는 비용과 정확도를 함께 확인해야 해요. 1 2핵심 요약구분핵심왜 볼 만한가요성능Frontier-Bench와 지식 업무 평가에서 높은 점수를 제시했어요긴 코딩 작업과 컴퓨터 사용 능력을 중심으로 개선 폭을 확인할 수 있어요비용입력 5달러, 출력 25달러로 Opus 4.8과 같아요기존 Op..
CursorBench 3.1은 코딩 모델 비교를 더 실무 쪽으로 당겼어요 CursorBench 3.1은 코딩 모델 비교를 더 실무 쪽으로 당겼어요AI 뉴스 썸네일AI 코딩 도구를 고를 때 이제 “코드를 얼마나 잘 쓰나”만 보면 부족해요. 긴 코드베이스를 읽고, 버그를 찾고, 리뷰 의견을 내고, 비용까지 감당할 수 있는지가 같이 중요해졌어요. CursorBench 3.1은 그 기준을 숫자로 보여주려는 평가표예요. 2핵심 요약구분핵심왜 볼 만한가요모델 순위Fable 5 Max가 72.9%로 1위를 기록했어요코딩 모델 상위권의 기준선이 다시 올라갔어요상위권 구조Fable 5 계열이 1~4위를 모두 차지했어요같은 모델군 안에서도 추론 강도와 비용 선택지가 갈려요평가 범위코드베이스 이해, 버그 찾기, 계획, 코드 리뷰 과제가 추가됐어요단순 수정보다 실제 개발 흐름에 가까운 비교로 이동..

728x90