본문 바로가기

728x90

GDPval

(4)
GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간 GPT-5.6 Sol Ultrafast, 초당 750 토큰이 바꾸는 대기 시간GPT-5.6 Sol Ultrafast 썸네일GPT-5.6 Sol이 Cerebras 인프라에서 초당 최대 750개 출력 토큰을 내는 Ultrafast Mode로 제공돼요. OpenAI API의 새 서비스 계층으로 일부 고객에게 먼저 열렸어요. 빠른 출력이 실제 작업 시간까지 얼마나 줄이는지는 모델 밖의 도구와 시스템 속도에 따라 달라져요. 1핵심 요약구분확인된 내용실제로 볼 부분제공 방식OpenAI API에서 제한 공개됐어요용량이 늘면 접근 대상도 넓어질 예정이에요출력 속도초당 최대 750개 출력 토큰을 제시했어요최대치와 실제 요청의 지속 속도는 구분해서 봐야 해요HLE 평가2,500문항을 11시간 11분에 처리했어요Cerebr..
Grok 4.6, 성능보다 비용표가 더 눈에 띄어요 Grok 4.6, 성능보다 비용표가 더 눈에 띄어요Grok 4.6 벤치마크 썸네일Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받았어요. GPT-5.6 Sol과 같은 점수지만 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정됐어요. 여러 단계에 걸쳐 도구를 쓰는 작업에서도 상위권 결과를 냈고, 장시간 작업에서는 비교 모델보다 적은 턴과 입력 토큰을 썼어요. 1핵심 요약구분확인된 결과실제로 볼 부분종합 점수AAII 61점으로 GPT-5.6 Sol과 같아요단일 점수보다 평가 항목별 편차를 함께 봐야 해요세대 변화Grok 4.5보다 5점 올랐어요한 달여 만에 가격을 유지하며 점수를 높였어요도구 사용GDPval-AA v2 Elo 1753, T..
Solar Pro 4, 문서부터 엑셀·보고서까지 맡는 업무형 LLM Solar Pro 4, 문서부터 엑셀·보고서까지 맡는 업무형 LLMAI 뉴스 썸네일업스테이지가 Solar Pro 4를 공개했어요. 대화형 답변보다 문서를 읽고 도구를 호출해 엑셀, 보고서, 발표 자료까지 만드는 업무에 초점을 둔 LLM이에요. 1핵심 요약구분내용용도문서 검토, 터미널 작업, 여러 차례의 도구 호출, 업무 파일 생성을 이어서 처리해요.모델 사양512K 컨텍스트와 최대 128K 출력 토큰을 지원해요. 영어·한국어·일본어를 입출력에 쓸 수 있어요.공식 평가Terminal-Bench v2.1 57.0점, GDPval-AA v2 38.8점, τ³-Banking 23.0점, AA-LCR 71.0점을 공개했어요.API 가격100만 토큰당 입력 0.30달러, 캐시 입력 0.06달러, 출력 1.20달러예..
Qwen3.8 Max가 에이전트 평가에서 보여준 것 Qwen3.8 Max가 에이전트 평가에서 보여준 것AI 뉴스 썸네일Qwen3.8 Max가 에이전트형 작업 평가에서 최상위권에 올랐어요. 단순 문답 점수보다 도구 사용과 계획, 여러 단계를 잇는 능력을 따로 측정했다는 점이 더 눈에 들어와요. 다만 순위표는 평가 추가와 모델 업데이트에 따라 바뀌므로, 1위라는 숫자만 떼어 보면 판단을 놓치기 쉬워요. 1핵심 요약구분핵심왜 볼 만한가요에이전트 성능Qwen3.8 Max가 Agentic Index 최상위권에 올랐어요도구 사용과 계획을 포함한 실제 작업형 평가예요일반 지능공식 모델 페이지의 Intelligence Index 점수는 58점이에요에이전트 순위와 일반 지능 순위는 같은 지표가 아니에요운영 비용입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러예요..

728x90