본문 바로가기

728x90

CyberGym

(2)
GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요 GLM-5.3, 같은 기반 모델로 코딩과 보안 성능을 끌어올렸어요AI 뉴스 썸네일Z.ai가 GLM-5.2의 기반 모델을 그대로 두고 포스트 트레이닝을 확장한 GLM-5.3을 공개했어요. 코딩 과제 성능이 크게 올랐고, 취약점을 찾은 뒤 공격 단계를 연결하는 사이버 보안 능력도 빠르게 향상됐어요. 1핵심 요약구분확인된 내용읽을 때 볼 점훈련 방식기반 모델은 GLM-5.2와 같고 환경·과제·연산을 늘렸어요모델 크기보다 훈련 환경과 검증 설계가 성능 차이를 만들었어요코딩 성능Terminal Bench 3.0은 4.6에서 28.3, DeepSWE v1.1은 46.2에서 66.9로 올랐어요실제 개발 흐름에 가까운 장기 과제를 훈련에 넣은 결과예요사이버 보안CyberGym 84.5%, ExploitBench 54...
DeepSeek V4 Flash 공개, 코딩 에이전트와 Codex 연동을 앞세웠어요 DeepSeek V4 Flash 공개, 코딩 에이전트와 Codex 연동을 앞세웠어요AI 뉴스 썸네일DeepSeek이 V4 Flash API 정식 버전을 공개 베타로 내놨어요. 기존 API 주소와 호출 방식을 바꾸지 않고 모델 이름만 `deepseek-v4-flash`로 지정하면 새 버전을 쓸 수 있어요. 코딩 에이전트 벤치마크와 Responses API 지원이 이번 업데이트의 중심이에요. 1핵심 요약구분핵심왜 볼 만한가요출시DeepSeek V4 Flash 정식 API가 공개 베타로 나왔어요기존 연동에서 모델 이름만 바꿔 시험할 수 있어요성능Terminal Bench 2.1에서 82.7점을 기록했어요터미널 작업과 도구 사용 성능을 강조한 업데이트예요연동Responses API를 기본 지원하고 Codex 설..

728x90