본문 바로가기

728x90

TerminalBench

(8)
GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요 GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요AI 뉴스 썸네일Z.ai가 GLM-5.2의 기반 모델을 그대로 두고 포스트 트레이닝을 확장한 GLM-5.3을 공개했어요. 코딩 과제 성능이 크게 올랐고, 취약점을 찾은 뒤 공격 단계를 연결하는 사이버 보안 능력도 빠르게 향상됐어요. 1핵심 요약구분확인된 내용읽을 때 볼 점훈련 방식기반 모델은 GLM-5.2와 같고 환경·과제·연산을 늘렸어요모델 크기보다 훈련 환경과 검증 설계가 성능 차이를 만들었어요코딩 성능Terminal Bench 3.0은 4.6에서 28.3, DeepSWE v1.1은 46.2에서 66.9로 올랐어요실제 개발 흐름에 가까운 장기 과제를 훈련에 넣은 결과예요사이버 보안CyberGym 84.5%, ExploitBench 54...
Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요 Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요Qwen3.8-27B 로컬 실행 썸네일270억 파라미터 모델을 개인 장비에서 돌릴 때 가장 먼저 막히는 곳은 메모리예요. Unsloth가 공개한 Qwen3.8-27B 양자화 판은 4비트 기준으로 총 17~19GB 메모리를 요구해요. 24GB 통합 메모리를 갖춘 Mac이나 24GB급 GPU 데스크톱이라면 로컬 실행을 시험해 볼 수 있는 크기예요. 2핵심 요약구분공개된 내용실제로 확인할 점모델270억 파라미터 밀집형 모델이에요비전과 추론을 함께 지원해요4비트 메모리총 17~19GB가 필요해요24GB 장비가 실행 여유를 두기 좋아요실행 형식GGUF와 NVFP4를 제공해요GPU 세대와 실행 도구에 맞춰 골라야 해요문맥 길이기본 262,..
Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요 Qwen 3.8 27B 공개, 이미지·영상과 장기 AI 작업을 한 모델에 담았어요Qwen 3.8 27B AI 모델 썸네일Qwen이 270억 파라미터 규모의 멀티모달 모델 Qwen3.8-27B와 FP8 가중치를 공개했어요. 이미지와 영상을 읽고, 코딩이나 긴 작업을 여러 단계로 이어가는 용도를 한 모델에서 다뤄요. 개발자는 Hugging Face에서 가중치를 내려받아 자체 환경에 배치할 수 있어요. 2핵심 요약구분내용모델270억 파라미터의 밀집형 비전·언어 모델이에요.배포판블록 크기 128을 적용한 FP8 가중치를 Apache 2.0 라이선스로 제공해요.문맥기본 262,144 토큰이며 YaRN 설정으로 최대 100만 토큰까지 늘릴 수 있어요.추론 제어사고 모드를 끄거나 `reasoning_effort`를 ..
Grok 4.6, 성능보다 비용표가 더 눈에 띄어요 Grok 4.6, 성능보다 비용표가 더 눈에 띄어요Grok 4.6 벤치마크 썸네일Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받았어요. GPT-5.6 Sol과 같은 점수지만 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정됐어요. 여러 단계에 걸쳐 도구를 쓰는 작업에서도 상위권 결과를 냈고, 장시간 작업에서는 비교 모델보다 적은 턴과 입력 토큰을 썼어요. 1핵심 요약구분확인된 결과실제로 볼 부분종합 점수AAII 61점으로 GPT-5.6 Sol과 같아요단일 점수보다 평가 항목별 편차를 함께 봐야 해요세대 변화Grok 4.5보다 5점 올랐어요한 달여 만에 가격을 유지하며 점수를 높였어요도구 사용GDPval-AA v2 Elo 1753, T..
Solar Pro 4, 문서부터 엑셀·보고서까지 맡는 업무형 LLM Solar Pro 4, 문서부터 엑셀·보고서까지 맡는 업무형 LLMAI 뉴스 썸네일업스테이지가 Solar Pro 4를 공개했어요. 대화형 답변보다 문서를 읽고 도구를 호출해 엑셀, 보고서, 발표 자료까지 만드는 업무에 초점을 둔 LLM이에요. 1핵심 요약구분내용용도문서 검토, 터미널 작업, 여러 차례의 도구 호출, 업무 파일 생성을 이어서 처리해요.모델 사양512K 컨텍스트와 최대 128K 출력 토큰을 지원해요. 영어·한국어·일본어를 입출력에 쓸 수 있어요.공식 평가Terminal-Bench v2.1 57.0점, GDPval-AA v2 38.8점, τ³-Banking 23.0점, AA-LCR 71.0점을 공개했어요.API 가격100만 토큰당 입력 0.30달러, 캐시 입력 0.06달러, 출력 1.20달러예..
Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AI Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AIAI 뉴스 썸네일Qwen이 2.4조 파라미터 규모의 Qwen3.8-Max를 공개했어요. 짧은 코드 생성보다 여러 날 이어지는 개발과 연구를 끝까지 수행하는 능력에 초점을 맞췄고, Max급 모델 가중치도 처음으로 공개할 예정이에요. 1핵심 요약구분핵심왜 볼 만한가요모델 규모전체 2.4조, 추론 때 활성화되는 파라미터는 950억 개예요큰 모델을 필요한 부분만 쓰는 구조로 성능과 실행 비용의 균형을 노려요장기 작업개발, 논문 재현, 경진대회를 24시간에서 16일 동안 수행한 사례를 공개했어요코딩 AI의 평가 기준이 함수 작성에서 프로젝트 완수로 옮겨가고 있어요공개 계획Qwen Max 계열 가중치를 다음 주 공개할 예정이에요API뿐 아니라 직접..
DeepSeek V4 Flash 공개, 코딩 에이전트와 Codex 연동을 앞세웠어요 DeepSeek V4 Flash 공개, 코딩 에이전트와 Codex 연동을 앞세웠어요AI 뉴스 썸네일DeepSeek이 V4 Flash API 정식 버전을 공개 베타로 내놨어요. 기존 API 주소와 호출 방식을 바꾸지 않고 모델 이름만 `deepseek-v4-flash`로 지정하면 새 버전을 쓸 수 있어요. 코딩 에이전트 벤치마크와 Responses API 지원이 이번 업데이트의 중심이에요. 1핵심 요약구분핵심왜 볼 만한가요출시DeepSeek V4 Flash 정식 API가 공개 베타로 나왔어요기존 연동에서 모델 이름만 바꿔 시험할 수 있어요성능Terminal Bench 2.1에서 82.7점을 기록했어요터미널 작업과 도구 사용 성능을 강조한 업데이트예요연동Responses API를 기본 지원하고 Codex 설..
Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요 Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요AI 뉴스 썸네일AI 모델 경쟁은 이제 “답을 잘하느냐”만으로 설명하기 어려워졌어요. 코딩 에이전트가 실제 저장소를 고치고, 터미널을 다루고, 긴 작업을 여러 단계로 끝내야 하기 때문이에요. Grok 4.5는 이 시장에서 성능 수치보다 속도와 토큰 효율을 전면에 둔 모델로 나왔어요. 1핵심 요약구분핵심왜 봐야 하나요모델 방향Grok 4.5는 코딩, 에이전트형 작업, 지식 업무를 겨냥한 최상위 모델이에요범용 챗봇보다 개발 작업 실행 능력을 앞세운 출시예요벤치마크Terminal Bench 2.1 83.3%, SWE Bench Pro 64.7%, DeepSWE 1.0 62.0%를 제시했어요터미널 작업과 소프트웨어 수정 과제에서 어느 정도 위치..

728x90