본문 바로가기

IT & AI

DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요

728x90

DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요

AI 뉴스 썸네일
AI 뉴스 썸네일

DeepSeek V4 Flash 0731이 ARC-AGI 평가에서 추론 강도별 결과를 공개했어요. 가장 높은 Max 설정은 ARC-AGI-1에서 89.0%, 더 어려운 ARC-AGI-2에서 61.4%를 기록했어요. Low 설정과 비교하면 ARC-AGI-2 점수가 15.4%포인트 벌어져, 같은 모델도 답을 생각하는 데 쓰는 계산량에 따라 성능과 비용이 크게 달라질 수 있다는 점을 보여줘요. 2

핵심 요약

구분핵심왜 볼 만한가요
최고 점수Max에서 ARC-AGI-1 89.0%, ARC-AGI-2 61.4%를 기록했어요추론 강도를 높였을 때 복잡한 규칙 문제를 얼마나 더 풀 수 있는지 숫자로 비교할 수 있어요
강도별 차이ARC-AGI-2는 Max 61.4%, High 56.0%, Low 46.0%였어요비용을 줄이려고 추론량을 낮추면 어려운 문제의 성공률이 더 크게 떨어질 수 있어요
평가 비용Max의 Semi-Private 작업당 비용은 ARC-AGI-1 0.02달러, ARC-AGI-2 0.04달러였어요정확도뿐 아니라 작업당 비용을 함께 공개해 서비스 운영 판단에 쓸 수 있어요
작업별 편차일부 문제는 Low만 통과하거나 High만 통과했어요추론량을 늘린다고 모든 입력에서 결과가 순서대로 좋아지는 것은 아니에요
공개 모델모델 가중치와 기술 보고서가 공개돼 있어요별도 환경에서 실행하고 결과를 재검토할 여지가 있어요

1. 추론 강도를 높이자 어려운 평가에서 차이가 더 커졌어요

ARC Prize는 DeepSeek V4 Flash 0731을 Low, High, Max 세 가지 추론 강도로 평가했어요. ARC-AGI-1 점수는 각각 84.0%, 87.0%, 89.0%였어요. ARC-AGI-2는 46.0%, 56.0%, 61.4%로 벌어졌어요. Low와 Max의 차이는 ARC-AGI-1에서 5.0%포인트였지만 ARC-AGI-2에서는 15.4%포인트였어요. 2

ARC-AGI는 낯선 시각 규칙을 찾아 출력 격자를 완성하는 문제로 모델의 일반화 능력을 살펴봐요. 정답을 기억해 꺼내기보다 입력에 숨은 변환 규칙을 찾아야 해요. 이번 결과만 놓고 보면 어려운 문제일수록 추가 추론 계산의 효과가 더 크게 나타났어요. 다만 한 모델과 한 평가에서 나온 수치이므로 다른 업무에도 같은 폭으로 적용된다고 볼 수는 없어요.

728x90

높은 추론량이 모든 문제를 해결하지는 못했어요

총점은 Max가 가장 높았지만 작업별 성공 여부는 깔끔한 순서를 따르지 않았어요. ARC-AGI-2의 일부 작업은 Low에서만 통과했고, 다른 작업은 High에서만 통과했어요. Max와 Low가 통과했는데 High는 실패한 사례도 공개됐어요. ARC-AGI-1에서도 Low만 성공한 작업과 Max만 성공한 작업이 함께 나왔어요. 1

이 편차는 추론 강도를 올리는 일이 동일한 답변 과정을 더 오래 실행하는 것과 다르다는 점을 보여줘요. 샘플링과 중간 추론 경로가 달라지면 다른 규칙을 선택할 수 있어요. 운영 환경에서 Max를 기본값으로 고정하기 전에 실제 입력 묶음으로 재평가해야 하는 이유예요.

점수와 함께 작업당 비용도 봐야 해요

Max 설정의 Semi-Private 평가 비용은 ARC-AGI-1에서 작업당 0.02달러, ARC-AGI-2에서 0.04달러였어요. ARC Prize 결과 페이지는 점수와 비용을 함께 제시해요. 높은 점수가 필요한 요청에만 추론 강도를 올리고, 단순한 요청은 낮은 설정으로 보내는 라우팅을 검토할 수 있어요. 2

공개된 비용은 해당 벤치마크의 작업당 수치예요. 긴 문서 분석, 코딩 에이전트, 반복 도구 호출처럼 토큰 사용 구조가 다른 업무의 실제 비용과 같지는 않아요. 서비스에 적용하려면 성공률뿐 아니라 응답 시간, 토큰 사용량, 재시도율을 같은 데이터셋에서 확인해야 해요.

모델 카드도 세 단계 추론 설정을 지원해요

DeepSeek의 모델 카드에는 `reasoning_effort`를 Low, High, Max로 조절할 수 있다고 적혀 있어요. 모델은 MIT 라이선스로 공개됐고, vLLM과 SGLang 실행 방법도 제공돼요. 공식 릴리스는 미리보기 버전을 대체하며 에이전트 작업 성능을 강화했다고 설명해요. 3

모델 카드의 자체 벤치마크와 ARC Prize 결과는 평가 주체와 문제 구성이 달라요. 숫자를 한 줄로 이어 비교하기보다 각 평가의 실행 설정, 도구 사용 여부, 추론 강도와 비용 기준을 따로 봐야 해요. 기술 보고서도 함께 공개돼 있어 모델 구조와 학습·평가 조건을 더 확인할 수 있어요. 4

왜 중요한가요

AI 서비스를 운영할 때 최고 점수 하나만 보면 비용과 지연 시간을 놓치기 쉬워요. 이번 결과는 같은 모델 안에서도 추론 강도를 낮추면 ARC-AGI-2 성능이 61.4%에서 46.0%로 떨어질 수 있다는 구체적인 사례를 제공해요. 요청 난이도에 따라 추론 설정을 나누려면 실제 서비스 입력으로 만든 평가 세트가 필요해요. 2

개발팀은 Low, High, Max를 같은 입력에 반복 실행해 정답률과 비용을 함께 기록할 수 있어요. 단순 분류나 형식 변환은 Low로 처리하고, 실패 비용이 큰 분석은 High나 Max로 보내는 방식이에요. 작업별 결과가 뒤집힌 사례가 있으므로 단 한 번의 실행으로 설정을 결정하기보다 여러 번 실행해 성공률 분포를 확인하는 편이 안전해요.

공개 가중치 모델이라는 점도 비교 범위를 넓혀요. 자체 인프라에서 실행하면 데이터 처리 위치와 서빙 비용을 직접 조절할 수 있어요. 대신 필요한 하드웨어, 동시 처리량, 모델 업데이트와 보안 운영까지 팀이 맡아야 해요. 벤치마크 점수는 후보를 고르는 출발점이고, 최종 선택은 실제 업무 정확도와 전체 운영비를 기준으로 해야 해요.

참고 자료

  1. DeepSeek V4 Flash 0731의 ARC-AGI 평가 결과 — GeekNews
  2. DeepSeek V4 Flash 0731 - ARC-AGI Results — ARC Prize
  3. DeepSeek-V4-Flash-0731 Model Card — Hugging Face
  4. DeepSeek-V4 Technical Report — arXiv
728x90