본문 바로가기

728x90

DeepSWE

(3)
GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요 GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요AI 뉴스 썸네일Z.ai가 GLM-5.2의 기반 모델을 그대로 두고 포스트 트레이닝을 확장한 GLM-5.3을 공개했어요. 코딩 과제 성능이 크게 올랐고, 취약점을 찾은 뒤 공격 단계를 연결하는 사이버 보안 능력도 빠르게 향상됐어요. 1핵심 요약구분확인된 내용읽을 때 볼 점훈련 방식기반 모델은 GLM-5.2와 같고 환경·과제·연산을 늘렸어요모델 크기보다 훈련 환경과 검증 설계가 성능 차이를 만들었어요코딩 성능Terminal Bench 3.0은 4.6에서 28.3, DeepSWE v1.1은 46.2에서 66.9로 올랐어요실제 개발 흐름에 가까운 장기 과제를 훈련에 넣은 결과예요사이버 보안CyberGym 84.5%, ExploitBench 54...
Gemini 3.7 Flash 공개, 코딩 성능과 가격을 함께 낮췄어요 Gemini 3.7 Flash 공개, 코딩 성능과 가격을 함께 낮췄어요AI 뉴스 썸네일Google이 Gemini 3.6 Flash를 내놓은 지 3주 만에 후속 모델인 Gemini 3.7 Flash를 공개했어요. 코딩과 웹 개발, 복잡한 문서 처리 성능을 높였고 올해 말까지 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러의 도입 가격을 적용해요. 1 2핵심 요약구분핵심왜 볼 만한가요코딩FrontierCode 1.1 Main 43.6%, DeepSWE v1.1 65.3%를 기록했어요3.6 Flash의 34.4%, 49.0%보다 높아졌어요웹 개발WebDev Arena Elo가 1538에서 1588로 올랐어요적은 요청으로 기능이 갖춰진 앱을 만드는 데 초점을 맞췄어요지식 업무GDP.pdf ..
Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요 Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요AI 뉴스 썸네일AI 모델 경쟁은 이제 “답을 잘하느냐”만으로 설명하기 어려워졌어요. 코딩 에이전트가 실제 저장소를 고치고, 터미널을 다루고, 긴 작업을 여러 단계로 끝내야 하기 때문이에요. Grok 4.5는 이 시장에서 성능 수치보다 속도와 토큰 효율을 전면에 둔 모델로 나왔어요. 1핵심 요약구분핵심왜 봐야 하나요모델 방향Grok 4.5는 코딩, 에이전트형 작업, 지식 업무를 겨냥한 최상위 모델이에요범용 챗봇보다 개발 작업 실행 능력을 앞세운 출시예요벤치마크Terminal Bench 2.1 83.3%, SWE Bench Pro 64.7%, DeepSWE 1.0 62.0%를 제시했어요터미널 작업과 소프트웨어 수정 과제에서 어느 정도 위치..

728x90