본문 바로가기

728x90

SpaceXAI

(5)
Grok 4.6, 성능보다 비용표가 더 눈에 띄어요 Grok 4.6, 성능보다 비용표가 더 눈에 띄어요Grok 4.6 벤치마크 썸네일Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받았어요. GPT-5.6 Sol과 같은 점수지만 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정됐어요. 여러 단계에 걸쳐 도구를 쓰는 작업에서도 상위권 결과를 냈고, 장시간 작업에서는 비교 모델보다 적은 턴과 입력 토큰을 썼어요. 1핵심 요약구분확인된 결과실제로 볼 부분종합 점수AAII 61점으로 GPT-5.6 Sol과 같아요단일 점수보다 평가 항목별 편차를 함께 봐야 해요세대 변화Grok 4.5보다 5점 올랐어요한 달여 만에 가격을 유지하며 점수를 높였어요도구 사용GDPval-AA v2 Elo 1753, T..
Grok 4.6, 모델 크기보다 사후 학습으로 코딩 성능을 높였어요 Grok 4.6, 모델 크기보다 사후 학습으로 코딩 성능을 높였어요AI 뉴스 썸네일xAI가 장시간 코딩 작업과 지식 노동에 초점을 맞춘 Grok 4.6을 공개했어요. 새 기반 모델을 크게 키우기보다 추가 학습, 지도 미세조정(SFT), 강화학습(RL)을 다듬어 성능을 끌어올린 점이 눈에 띄어요. 1핵심 요약구분핵심왜 볼 만한가요학습Grok 4.5보다 긴 추가 학습과 새 SFT 궤적을 적용했어요파라미터 수 확대 외에도 학습 데이터와 후처리 방식이 모델 품질을 바꿀 수 있다는 사례예요코딩CursorBench 3.2에서 69.9%, FrontierCode 1.1 Extended에서 61.3%를 기록했어요여러 단계가 이어지는 코딩 작업과 초기 제품 구현에 초점을 맞췄어요한계DeepSWE 1.1은 65.9%, T..
Grok Bot 공개, 여러 AI 봇이 업무를 나눠 맡아요 Grok Bot 공개, 여러 AI 봇이 업무를 나눠 맡아요Grok Bot AI 뉴스 썸네일Grok Bot은 사용자가 일을 맡기면 전용 컴퓨터에서 앱과 웹사이트를 조작하는 업무용 AI 봇이에요. 여러 봇이 같은 프로젝트의 맥락을 공유하며 역할을 나눌 수 있고, 사람의 승인이 필요한 시점에만 다시 확인을 요청해요. 1핵심 요약구분내용실행 방식각 봇이 클라우드 컴퓨터에서 앱, 받은 편지함, 웹사이트를 직접 다뤄요.협업 방식여러 봇을 동시에 실행하고 같은 스레드에서 맥락과 작업을 넘길 수 있어요.반복 업무사용자가 작업하는 과정을 보여 주면 예약 실행할 수 있는 루틴으로 저장해요.이용 범위데스크톱과 iOS에서 쓸 수 있고, 현재 얼리 베타로 제공돼요.확인할 점로그인 권한, 외부 전송, 비용 집행처럼 되돌리기 어려..
Grok Build 오픈 소스 공개, Rust로 만든 코딩 에이전트의 내부가 열렸어요 Grok Build 오픈 소스 공개, Rust로 만든 코딩 에이전트의 내부가 열렸어요AI 뉴스 썸네일SpaceXAI가 터미널 기반 AI 코딩 에이전트 Grok Build의 Rust 소스와 런타임을 공개했어요. 코드 탐색과 파일 수정, 셸 명령, 웹 검색을 한 화면에서 다루며 대화형 TUI와 헤드리스 실행, Agent Client Protocol 연동을 지원해요. 1핵심 요약구분공개된 내용개발자가 볼 부분실행 방식전체 화면 TUI, 헤드리스 모드, ACP 연동을 지원해요터미널 사용부터 CI·편집기 통합까지 한 런타임으로 이어갈 수 있어요코드 구조TUI, 런타임, 도구, 워크스페이스를 Rust 크레이트로 나눴어요에이전트가 파일과 명령을 다루는 경계를 소스에서 확인할 수 있어요설치와 빌드macOS·Linux·..
Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요 Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요AI 뉴스 썸네일AI 모델 경쟁은 이제 “답을 잘하느냐”만으로 설명하기 어려워졌어요. 코딩 에이전트가 실제 저장소를 고치고, 터미널을 다루고, 긴 작업을 여러 단계로 끝내야 하기 때문이에요. Grok 4.5는 이 시장에서 성능 수치보다 속도와 토큰 효율을 전면에 둔 모델로 나왔어요. 1핵심 요약구분핵심왜 봐야 하나요모델 방향Grok 4.5는 코딩, 에이전트형 작업, 지식 업무를 겨냥한 최상위 모델이에요범용 챗봇보다 개발 작업 실행 능력을 앞세운 출시예요벤치마크Terminal Bench 2.1 83.3%, SWE Bench Pro 64.7%, DeepSWE 1.0 62.0%를 제시했어요터미널 작업과 소프트웨어 수정 과제에서 어느 정도 위치..

728x90