본문 바로가기

728x90

ReasoningEffort

(2)
Claude Code 추론 설정 A/B 테스트, 성능 저하 논란과 Anthropic 해명 Claude Code 추론 설정 A/B 테스트, 성능 저하 논란과 Anthropic 해명AI 뉴스 썸네일Claude Code 일부 세션에서 사용자가 고른 추론 노력 단계와 내부 표시가 다르다는 보고가 나왔어요. Anthropic 측은 실제 추론 수준을 낮춘 게 아니라 표시 척도의 매핑을 시험한 것이라고 해명했어요. 체감 품질 논란과 공식 설명이 엇갈려서, 확인된 사실과 사용자 추측을 나눠 볼 필요가 있어요.핵심 요약구분확인된 내용개발자가 볼 점실험 대상Claude Code 2.1.236 이상 일부 세션에서 서버 측 A/B 테스트 정황이 포착됐어요같은 버전과 설정을 써도 계정이나 세션마다 내부 표시가 다를 수 있어요사용자 보고`high`를 골라도 `medium` 표기가 들어가거나 낮은 추론처럼 느껴졌다는 ..
DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요 DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요AI 뉴스 썸네일DeepSeek V4 Flash 0731이 ARC-AGI 평가에서 추론 강도별 결과를 공개했어요. 가장 높은 Max 설정은 ARC-AGI-1에서 89.0%, 더 어려운 ARC-AGI-2에서 61.4%를 기록했어요. Low 설정과 비교하면 ARC-AGI-2 점수가 15.4%포인트 벌어져, 같은 모델도 답을 생각하는 데 쓰는 계산량에 따라 성능과 비용이 크게 달라질 수 있다는 점을 보여줘요. 2핵심 요약구분핵심왜 볼 만한가요최고 점수Max에서 ARC-AGI-1 89.0%, ARC-AGI-2 61.4%를 기록했어요추론 강도를 높였을 때 복잡한 규칙 문제를 얼마나 더 풀 수 있는지 숫자로 비교할 수 ..

728x90