ARCAGI (3) 썸네일형 리스트형 DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요 DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요AI 뉴스 썸네일DeepSeek V4 Flash 0731이 ARC-AGI 평가에서 추론 강도별 결과를 공개했어요. 가장 높은 Max 설정은 ARC-AGI-1에서 89.0%, 더 어려운 ARC-AGI-2에서 61.4%를 기록했어요. Low 설정과 비교하면 ARC-AGI-2 점수가 15.4%포인트 벌어져, 같은 모델도 답을 생각하는 데 쓰는 계산량에 따라 성능과 비용이 크게 달라질 수 있다는 점을 보여줘요. 2핵심 요약구분핵심왜 볼 만한가요최고 점수Max에서 ARC-AGI-1 89.0%, ARC-AGI-2 61.4%를 기록했어요추론 강도를 높였을 때 복잡한 규칙 문제를 얼마나 더 풀 수 있는지 숫자로 비교할 수 .. LLM의 과학적 도약, 데이터 압축만으로 설명하기 어려운 이유 LLM의 과학적 도약, 데이터 압축만으로 설명하기 어려운 이유AI 뉴스 썸네일대규모 언어 모델은 방대한 사례에서 규칙을 찾고, 주어진 규칙으로 답을 계산하는 데 빠르게 능숙해지고 있어요. 한 OpenReview 논문은 여기서 한 걸음 더 나아가 새로운 설명의 출발점 자체를 만드는 능력을 묻고 있어요. 1핵심 요약구분핵심왜 볼 만한가요추론LLM은 귀납과 연역을 빠르게 자동화하고 있어요기존 규칙 안에서 찾는 답과 새 규칙을 세우는 발견을 구분할 수 있어요과학적 발견논문은 아인슈타인의 등가원리를 귀추적 도약의 사례로 읽어요관측 오차를 줄이는 일만으로는 설명하기 어려운 발견 과정을 다뤄요다음 단계행동할 수 있는 월드 모델과 환경 상호작용을 대안으로 제시해요모델 크기뿐 아니라 경험을 만드는 실행 환경도 연구 대상.. Claude Opus 5 출시, Fable급 성능을 절반 비용에 겨냥했어요 Claude Opus 5 출시, Fable급 성능을 절반 비용에 겨냥했어요AI 뉴스 썸네일Anthropic이 Claude Opus 5를 공개했어요. 회사는 코딩과 지식 업무에서 Fable 5에 가까운 성능을 작업당 절반 비용으로 제공한다고 설명해요. 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 이전 Opus 4.8과 가격도 같아요. 다만 공개 수치는 Anthropic 내부 평가가 적지 않아 실제 업무에서는 비용과 정확도를 함께 확인해야 해요. 1 2핵심 요약구분핵심왜 볼 만한가요성능Frontier-Bench와 지식 업무 평가에서 높은 점수를 제시했어요긴 코딩 작업과 컴퓨터 사용 능력을 중심으로 개선 폭을 확인할 수 있어요비용입력 5달러, 출력 25달러로 Opus 4.8과 같아요기존 Op.. 이전 1 다음