본문 바로가기

728x90

grok

(8)
Grok 4.6, 성능보다 비용표가 더 눈에 띄어요 Grok 4.6, 성능보다 비용표가 더 눈에 띄어요Grok 4.6 벤치마크 썸네일Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받았어요. GPT-5.6 Sol과 같은 점수지만 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정됐어요. 여러 단계에 걸쳐 도구를 쓰는 작업에서도 상위권 결과를 냈고, 장시간 작업에서는 비교 모델보다 적은 턴과 입력 토큰을 썼어요. 1핵심 요약구분확인된 결과실제로 볼 부분종합 점수AAII 61점으로 GPT-5.6 Sol과 같아요단일 점수보다 평가 항목별 편차를 함께 봐야 해요세대 변화Grok 4.5보다 5점 올랐어요한 달여 만에 가격을 유지하며 점수를 높였어요도구 사용GDPval-AA v2 Elo 1753, T..
Grok 4.6, 모델 크기보다 사후 학습으로 코딩 성능을 높였어요 Grok 4.6, 모델 크기보다 사후 학습으로 코딩 성능을 높였어요AI 뉴스 썸네일xAI가 장시간 코딩 작업과 지식 노동에 초점을 맞춘 Grok 4.6을 공개했어요. 새 기반 모델을 크게 키우기보다 추가 학습, 지도 미세조정(SFT), 강화학습(RL)을 다듬어 성능을 끌어올린 점이 눈에 띄어요. 1핵심 요약구분핵심왜 볼 만한가요학습Grok 4.5보다 긴 추가 학습과 새 SFT 궤적을 적용했어요파라미터 수 확대 외에도 학습 데이터와 후처리 방식이 모델 품질을 바꿀 수 있다는 사례예요코딩CursorBench 3.2에서 69.9%, FrontierCode 1.1 Extended에서 61.3%를 기록했어요여러 단계가 이어지는 코딩 작업과 초기 제품 구현에 초점을 맞췄어요한계DeepSWE 1.1은 65.9%, T..
Grok Bot 공개, 여러 AI 봇이 업무를 나눠 맡아요 Grok Bot 공개, 여러 AI 봇이 업무를 나눠 맡아요Grok Bot AI 뉴스 썸네일Grok Bot은 사용자가 일을 맡기면 전용 컴퓨터에서 앱과 웹사이트를 조작하는 업무용 AI 봇이에요. 여러 봇이 같은 프로젝트의 맥락을 공유하며 역할을 나눌 수 있고, 사람의 승인이 필요한 시점에만 다시 확인을 요청해요. 1핵심 요약구분내용실행 방식각 봇이 클라우드 컴퓨터에서 앱, 받은 편지함, 웹사이트를 직접 다뤄요.협업 방식여러 봇을 동시에 실행하고 같은 스레드에서 맥락과 작업을 넘길 수 있어요.반복 업무사용자가 작업하는 과정을 보여 주면 예약 실행할 수 있는 루틴으로 저장해요.이용 범위데스크톱과 iOS에서 쓸 수 있고, 현재 얼리 베타로 제공돼요.확인할 점로그인 권한, 외부 전송, 비용 집행처럼 되돌리기 어려..
AI 연구소가 자전거 타는 펠리컨에 맞춰 모델을 훈련했을까요 AI 연구소가 자전거 타는 펠리컨에 맞춰 모델을 훈련했을까요자전거 타는 펠리컨 AI 벤치마크 분석유명한 SVG 과제만 잘 풀도록 AI 모델을 따로 조정했다는 의심을 검증한 실험이 나왔어요. 7개 모델이 만든 SVG 1,008개를 비교했지만, 자전거를 타는 펠리컨 조합에서만 성능이 높아진 흔적은 찾지 못했어요. 1핵심 요약구분핵심왜 볼 만한가요실험 규모8종의 동물과 6종의 탈것을 조합해 48개 과제를 만들고, 7개 모델에서 3회씩 실행했어요특정 과제 하나가 아니라 비슷한 과제 47개와 나란히 비교했어요결과펠리컨은 동물 8종 중 6위, 자전거는 탈것 6종 중 5위였어요유명한 조합만 유난히 잘 그렸다는 설명과 맞지 않았어요조합 순위펠리컨과 자전거 조합은 전체 48개 중 42위였어요개별 요소의 난이도를 고려해도..
Grok Build 오픈 소스 공개, Rust로 만든 코딩 에이전트의 내부가 열렸어요 Grok Build 오픈 소스 공개, Rust로 만든 코딩 에이전트의 내부가 열렸어요AI 뉴스 썸네일SpaceXAI가 터미널 기반 AI 코딩 에이전트 Grok Build의 Rust 소스와 런타임을 공개했어요. 코드 탐색과 파일 수정, 셸 명령, 웹 검색을 한 화면에서 다루며 대화형 TUI와 헤드리스 실행, Agent Client Protocol 연동을 지원해요. 1핵심 요약구분공개된 내용개발자가 볼 부분실행 방식전체 화면 TUI, 헤드리스 모드, ACP 연동을 지원해요터미널 사용부터 CI·편집기 통합까지 한 런타임으로 이어갈 수 있어요코드 구조TUI, 런타임, 도구, 워크스페이스를 Rust 크레이트로 나눴어요에이전트가 파일과 명령을 다루는 경계를 소스에서 확인할 수 있어요설치와 빌드macOS·Linux·..
Grok Build CLI, 읽지 않은 저장소까지 전송했어요 Grok Build CLI, 읽지 않은 저장소까지 전송했어요Grok Build CLI 데이터 전송 분석 썸네일AI 코딩 도구에 저장소 접근 권한을 주면 모델이 읽은 파일만 서버로 갈 거라고 생각하기 쉬워요. Grok Build CLI 0.2.93의 통신을 직접 캡처한 분석에서는 모델 요청과 별도로 저장소 전체를 묶어 올리는 경로가 관찰됐어요. 비밀값과 Git 이력까지 포함될 수 있어 도입 전에 전송 범위를 따로 확인해야 해요.핵심 요약확인된 항목관찰 결과실무에서 볼 부분모델 요청도구가 읽은 파일과 `.env`의 테스트 비밀값이 마스킹 없이 포함됐어요실제 비밀값이 있는 작업 폴더를 그대로 열지 않는 편이 안전해요저장소 업로드읽지 말라고 지정한 파일과 Git 이력이 담긴 bundle이 별도 저장 경로로 전송..
Boko Haram의 AI 활용이 드러낸 새로운 보안 과제 Boko Haram의 AI 활용이 드러낸 새로운 보안 과제AI 뉴스 썸네일나이지리아의 무장 조직 Boko Haram 계열 분파들이 여러 프런티어 AI 서비스를 전투와 조직 운영에 활용했다는 현장 조사 결과가 나왔어요. 케임브리지대 CASP 연구진은 전직 구성원 27명과 57회 대면 인터뷰를 진행했어요. 이들의 증언은 AI 안전장치가 개인의 일회성 오용뿐 아니라 역할과 교육 체계를 갖춘 조직의 반복적인 시도도 막아야 한다는 과제를 드러내요. 1핵심 요약구분핵심왜 볼 만한가요조사 범위2025~2026년에 전직 Boko Haram 구성원 27명을 상대로 57회 인터뷰했어요온라인 흔적이 아니라 현장 증언을 통해 조직 내부의 AI 사용 방식을 추적했어요활용 방식여러 AI 서비스를 작전 준비, 장비 문제 해결, 보..
Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요 Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요AI 뉴스 썸네일AI 모델 경쟁은 이제 “답을 잘하느냐”만으로 설명하기 어려워졌어요. 코딩 에이전트가 실제 저장소를 고치고, 터미널을 다루고, 긴 작업을 여러 단계로 끝내야 하기 때문이에요. Grok 4.5는 이 시장에서 성능 수치보다 속도와 토큰 효율을 전면에 둔 모델로 나왔어요. 1핵심 요약구분핵심왜 봐야 하나요모델 방향Grok 4.5는 코딩, 에이전트형 작업, 지식 업무를 겨냥한 최상위 모델이에요범용 챗봇보다 개발 작업 실행 능력을 앞세운 출시예요벤치마크Terminal Bench 2.1 83.3%, SWE Bench Pro 64.7%, DeepSWE 1.0 62.0%를 제시했어요터미널 작업과 소프트웨어 수정 과제에서 어느 정도 위치..

728x90