본문 바로가기

728x90

ArtificialAnalysis

(6)
Qwen3.8 27B 지능 지수 52점, 점수보다 토큰 사용량을 함께 봐야 해요 Qwen3.8 27B 지능 지수 52점, 점수보다 토큰 사용량을 함께 봐야 해요AI 뉴스 썸네일Qwen3.8 27B가 Artificial Analysis Intelligence Index에서 52점을 받았어요. 같은 규모의 오픈 가중치 모델 중앙값 9보다 높지만, 평가에 쓴 출력 토큰도 1억 6,000만 개로 중앙값보다 약 3.7배 많았어요. 모델을 고를 때는 점수와 함께 응답 길이, 속도, 실제 운영 비용을 확인해야 해요. 1핵심 요약구분내용평가 결과Artificial Analysis Intelligence Index 52점을 기록했어요. 같은 규모의 오픈 가중치 모델 중앙값은 9점이에요.토큰 사용전체 평가에서 출력 토큰 1억 6,000만 개를 생성했어요. 비교군 중앙값 4,300만 개보다 약 3.7배..
Grok 4.6, 성능보다 비용표가 더 눈에 띄어요 Grok 4.6, 성능보다 비용표가 더 눈에 띄어요Grok 4.6 벤치마크 썸네일Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받았어요. GPT-5.6 Sol과 같은 점수지만 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정됐어요. 여러 단계에 걸쳐 도구를 쓰는 작업에서도 상위권 결과를 냈고, 장시간 작업에서는 비교 모델보다 적은 턴과 입력 토큰을 썼어요. 1핵심 요약구분확인된 결과실제로 볼 부분종합 점수AAII 61점으로 GPT-5.6 Sol과 같아요단일 점수보다 평가 항목별 편차를 함께 봐야 해요세대 변화Grok 4.5보다 5점 올랐어요한 달여 만에 가격을 유지하며 점수를 높였어요도구 사용GDPval-AA v2 Elo 1753, T..
Qwen3.8 Max가 에이전트 평가에서 보여준 것 Qwen3.8 Max가 에이전트 평가에서 보여준 것AI 뉴스 썸네일Qwen3.8 Max가 에이전트형 작업 평가에서 최상위권에 올랐어요. 단순 문답 점수보다 도구 사용과 계획, 여러 단계를 잇는 능력을 따로 측정했다는 점이 더 눈에 들어와요. 다만 순위표는 평가 추가와 모델 업데이트에 따라 바뀌므로, 1위라는 숫자만 떼어 보면 판단을 놓치기 쉬워요. 1핵심 요약구분핵심왜 볼 만한가요에이전트 성능Qwen3.8 Max가 Agentic Index 최상위권에 올랐어요도구 사용과 계획을 포함한 실제 작업형 평가예요일반 지능공식 모델 페이지의 Intelligence Index 점수는 58점이에요에이전트 순위와 일반 지능 순위는 같은 지표가 아니에요운영 비용입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러예요..
DeepSeek V4 Flash 0731, 50점 성능과 낮은 API 가격의 조건 DeepSeek V4 Flash 0731, 50점 성능과 낮은 API 가격의 조건AI 뉴스 썸네일DeepSeek V4 Flash 0731은 성능 점수와 API 가격을 함께 봐야 성격이 드러나요. Artificial Analysis 평가에서는 상위권에 올랐고, 입력과 출력 가격은 비교군 중앙값보다 낮았어요. 다만 많은 출력 토큰을 쓴 만큼 실제 서비스 비용과 응답 시간은 업무별로 따져봐야 해요. 1핵심 요약구분확인된 내용실무에서 볼 부분지능 평가Intelligence Index v4.1에서 50점, 101개 모델 중 3위한 개 종합지수이므로 실제 업무와 맞는 세부 평가도 확인해야 해요모델 구조전체 2,840억 파라미터 중 토큰마다 130억 개를 활성화하는 MoE전체 규모와 실제 추론 연산량을 구분해 봐야 ..
Claude Opus 5가 지능 지수 1위, 모델 선택은 순위보다 복잡해졌어요 Claude Opus 5가 지능 지수 1위, 모델 선택은 순위보다 복잡해졌어요IT & AI 뉴스 썸네일Claude Opus 5의 최대 추론 설정이 Artificial Analysis Intelligence Index에서 61점을 받아 선두에 올랐어요. 170개 모델을 비교한 종합 순위라는 점은 눈에 띄지만, 실제 서비스를 고를 때는 점수 하나만 보면 부족해요. 같은 비교표에서 속도, 지연 시간, 작업당 비용, 문맥 창의 선두 모델이 모두 달라요. 1핵심 요약구분핵심왜 볼만한가요종합 지능Claude Opus 5 최대 추론 설정이 61점으로 1위에 올랐어요에이전트 업무와 코딩, 과학 추론, 지식 신뢰성, 장문맥 추론을 한 점수로 비교해요평가 구성Intelligence Index v4.1은 9개 평가를 가중 ..
Kimi K3 펠리컨 실험이 보여준 벤치마크의 쓸모와 한계 Kimi K3 펠리컨 실험이 보여준 벤치마크의 쓸모와 한계AI 뉴스 썸네일Moonshot AI의 Kimi K3는 2.8조 개 매개변수와 100만 토큰 문맥을 내세운 대형 모델이에요. 자전거를 타는 펠리컨 SVG 하나를 그리게 했더니 비용, 추론량, 공간 인식은 드러났지만 실제 업무 능력까지 판단하기에는 빈틈이 컸어요.핵심 요약구분핵심왜 볼만한가요모델Kimi K3는 2.8조 개 매개변수와 멀티모달 기능을 갖췄어요오픈 가중치 모델의 규모와 활용 범위가 한 단계 커졌어요가격API 가격은 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러예요단순 작업도 추론량이 많으면 비용이 빠르게 늘어요실험펠리컨 SVG 생성에 출력 16,658 토큰과 0.25달러가 들었어요짧은 입력만으로 실제 비용과 출력 형식을 확..

728x90