본문 바로가기

728x90

SWEbench

(8)
Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요 Qwen3.8-27B 4비트 로컬 실행, 24GB Mac이 현실적인 기준이에요Qwen3.8-27B 로컬 실행 썸네일270억 파라미터 모델을 개인 장비에서 돌릴 때 가장 먼저 막히는 곳은 메모리예요. Unsloth가 공개한 Qwen3.8-27B 양자화 판은 4비트 기준으로 총 17~19GB 메모리를 요구해요. 24GB 통합 메모리를 갖춘 Mac이나 24GB급 GPU 데스크톱이라면 로컬 실행을 시험해 볼 수 있는 크기예요. 2핵심 요약구분공개된 내용실제로 확인할 점모델270억 파라미터 밀집형 모델이에요비전과 추론을 함께 지원해요4비트 메모리총 17~19GB가 필요해요24GB 장비가 실행 여유를 두기 좋아요실행 형식GGUF와 NVFP4를 제공해요GPU 세대와 실행 도구에 맞춰 골라야 해요문맥 길이기본 262,..
AI 자기 개선, 모델보다 실행 시스템을 먼저 고쳐요 AI 자기 개선, 모델보다 실행 시스템을 먼저 고쳐요AI 뉴스 썸네일AI가 스스로 나아지는 가장 가까운 길은 모델 가중치를 직접 고치는 방식이 아닐 수 있어요. 도구 사용, 기억, 작업 순서, 평가를 묶는 실행 시스템부터 개선하면 같은 모델로도 더 나은 결과를 낼 수 있어요. 1핵심 요약구분핵심왜 볼 만한가요개선 대상모델 주변의 실행 시스템도 자동 최적화 대상이 돼요모델을 다시 학습하지 않아도 작업 성능을 높일 여지가 있어요설계 방식파일 기반 기억, 반복 실행, 병렬 작업, 권한 제어를 함께 다뤄요긴 작업에서 맥락 손실과 실패 반복을 줄일 수 있어요평가점수만 높이는 편법을 막을 별도 검사와 감독이 필요해요약한 평가 기준은 잘못된 개선을 성공으로 오인할 수 있어요1. AI가 고치는 대상이 모델 밖으로 넓어..
Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AI Qwen3.8-Max가 겨냥한 다음 단계, 며칠짜리 일을 끝내는 AIAI 뉴스 썸네일Qwen이 2.4조 파라미터 규모의 Qwen3.8-Max를 공개했어요. 짧은 코드 생성보다 여러 날 이어지는 개발과 연구를 끝까지 수행하는 능력에 초점을 맞췄고, Max급 모델 가중치도 처음으로 공개할 예정이에요. 1핵심 요약구분핵심왜 볼 만한가요모델 규모전체 2.4조, 추론 때 활성화되는 파라미터는 950억 개예요큰 모델을 필요한 부분만 쓰는 구조로 성능과 실행 비용의 균형을 노려요장기 작업개발, 논문 재현, 경진대회를 24시간에서 16일 동안 수행한 사례를 공개했어요코딩 AI의 평가 기준이 함수 작성에서 프로젝트 완수로 옮겨가고 있어요공개 계획Qwen Max 계열 가중치를 다음 주 공개할 예정이에요API뿐 아니라 직접..
AI가 코드를 빨리 써도 소프트웨어 팩토리가 무너지는 이유 AI가 코드를 빨리 써도 소프트웨어 팩토리가 무너지는 이유IT & AI 뉴스 썸네일AI 코딩 도구는 구현 시간을 크게 줄였어요. 하지만 사람이 코드를 읽지 않는 자동 개발 방식은 복잡한 프로덕션 코드에서 유지보수 비용을 뒤로 미룰 수 있어요. HumanLayer의 창업자 덱스는 자동 검사와 반복 실행을 늘리는 것만으로 장기 품질까지 지키기 어렵다고 주장해요. 1핵심 요약구분핵심왜 볼 만한가요보상의 한계코딩 모델은 테스트 통과처럼 바로 확인할 수 있는 결과에 맞춰 학습해요수개월 뒤 드러나는 결합도와 변경 비용은 짧은 평가에서 잡기 어려워요벤치마크의 빈틈SWE-bench 계열은 문제 해결과 기존 테스트 보존을 확인해요무리한 예외 처리나 넓은 타입 변환도 테스트만 통과하면 높은 점수를 받을 수 있어요리뷰 병목..
Tencent Hy3 공개, 작지만 에이전트 작업을 노린 오픈소스 모델 Tencent Hy3 공개, 작지만 에이전트 작업을 노린 오픈소스 모델AI 뉴스 썸네일Tencent가 Hy3를 정식 공개했어요. 4월 말 preview 이후 50개 이상 제품에서 나온 피드백을 반영했고, Apache 2.0 라이선스로 GitHub과 Hugging Face 등에 모델을 올렸어요. 핵심은 단순 벤치마크 점수보다 실제 업무형 에이전트 작업, 도구 호출 안정성, 비용을 함께 밀어붙였다는 점이에요. 1핵심 요약구분핵심왜 볼 만한가요모델 공개Tencent가 Hy3를 Apache 2.0 라이선스로 공개했어요중국 대형 플랫폼의 오픈소스 LLM 경쟁이 더 촘촘해지고 있어요실무 평가270명 전문가 블라인드 평가에서 Hy3가 2.67/4를 기록했어요프론트엔드, 데이터·스토리지, CI/CD 같은 개발 업무를 ..
Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요 Grok 4.5, 코딩 에이전트 경쟁을 속도와 토큰 효율로 밀어붙여요AI 뉴스 썸네일AI 모델 경쟁은 이제 “답을 잘하느냐”만으로 설명하기 어려워졌어요. 코딩 에이전트가 실제 저장소를 고치고, 터미널을 다루고, 긴 작업을 여러 단계로 끝내야 하기 때문이에요. Grok 4.5는 이 시장에서 성능 수치보다 속도와 토큰 효율을 전면에 둔 모델로 나왔어요. 1핵심 요약구분핵심왜 봐야 하나요모델 방향Grok 4.5는 코딩, 에이전트형 작업, 지식 업무를 겨냥한 최상위 모델이에요범용 챗봇보다 개발 작업 실행 능력을 앞세운 출시예요벤치마크Terminal Bench 2.1 83.3%, SWE Bench Pro 64.7%, DeepSWE 1.0 62.0%를 제시했어요터미널 작업과 소프트웨어 수정 과제에서 어느 정도 위치..
코드를 이미지로 바꿔 AI 비용을 줄이는 실험, pxpipe가 던진 질문 코드를 이미지로 바꿔 AI 비용을 줄이는 실험, pxpipe가 던진 질문AI 뉴스 썸네일AI 코딩 도구를 오래 쓰면 비용의 상당 부분이 코드 작성보다 입력 컨텍스트에서 나와요. pxpipe는 이 지점을 파고든 오픈소스 도구예요. 긴 코드와 도구 출력, 오래된 대화 흐름을 텍스트 대신 PNG 이미지로 넘겨 입력 토큰을 줄이는 방식이에요.핵심 요약구분핵심왜 볼 만한가요비용 구조pxpipe는 큰 입력 블록을 이미지로 바꿔 Fable 기준 전체 청구액을 약 59~70% 낮췄다고 밝혔어요AI 코딩 도구 비용이 커지는 팀이라면 입력 토큰 최적화가 바로 운영비 문제로 이어져요작동 원리이미지 토큰 비용은 이미지 안 글자 수보다 픽셀 크기에 더 크게 묶여요코드, JSON, 로그처럼 글자가 빽빽한 자료는 이미지 한 장에 ..
코딩 에이전트가 시니어 개발자 일을 얼마나 풀 수 있을까요 코딩 에이전트가 시니어 개발자 일을 얼마나 풀 수 있을까요AI 뉴스 썸네일AI 코딩 도구 평가는 오래전부터 실제 업무와 조금 어긋나 있었어요. 새 벤치마크인 Senior SWE-Bench는 정리된 작은 과제가 아니라, 기능 개발과 버그 조사처럼 시니어 엔지니어가 맡는 일에 더 가까운 문제를 내세워요.핵심 요약구분핵심왜 볼 만한가요코딩 에이전트 평가Senior SWE-Bench가 실제 PR 기반 과제 100개를 공개·비공개 세트로 나눠 평가해요단순 코드 수정보다 런타임 조사, 프로젝트 관행, 코드 품질을 함께 봐요기능 개발 과제요구사항을 과하게 쪼개지 않고 자연어 요청에 가까운 지시를 써요실제 제품 개발에서 생기는 빈칸을 모델이 어떻게 메우는지 볼 수 있어요현재 성능리더보드 1위 Claude Opus 4...

728x90