본문 바로가기

728x90

GLM

(6)
추론은 강해졌는데 사실은 자주 틀려요, 소형 AI 모델의 새로운 절충 추론은 강해졌는데 사실은 자주 틀려요, 소형 AI 모델의 새로운 절충AI 뉴스 썸네일요즘 소형 LLM은 수학과 코딩 문제를 꽤 잘 풀어요. 그런데 인물의 생년이나 특정 라이브러리 버전처럼 세부 사실을 물으면 자신 있게 틀리는 경우가 많아요. 모델을 작게 만드는 과정에서 무엇을 기억하고 무엇을 외부 자료에 맡길지 다시 따져볼 시점이에요. 1핵심 요약구분핵심왜 볼 만한가요성능 변화적은 활성 매개변수로 높은 추론 점수를 내는 모델이 늘고 있어요모델 크기와 문제 해결 능력의 관계가 달라지고 있어요약점도구 없이 세부 사실을 회상할 때 오답과 환각이 많아요벤치마크 점수만으로 실제 답변 품질을 판단하기 어려워요설계 방향최신 세부 정보는 검색, 문서, 도구 호출로 가져오는 방안이 거론돼요오래된 API나 가격 정보를 가..
AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요 AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요AI 뉴스 썸네일Netlify가 AI 코딩 모델 11개에 같은 커피숍 웹사이트 제작 지시를 주고, 모델마다 3번씩 실행했어요. 가장 비싼 실행이 늘 가장 나은 결과를 내지는 않았고, 같은 모델 안에서도 비용과 디자인 편차가 컸어요. 1핵심 요약구분확인된 결과실무에서 볼 점비용실행당 2.4~1,055 크레딧으로 차이가 컸어요모델 이름보다 작업별 예산 범위를 먼저 정해야 해요결과물같은 모델을 3번 실행해도 디자인과 콘텐츠가 달라졌어요한 번의 결과만으로 모델을 평가하기 어려워요고가 모델Claude Opus 5가 풍부한 화면을 만들었지만 비용 변동도 컸어요높은 비용이 같은 비율의 품질 향상을 보장하지 않아요저가 모델GLM 5.2, Kimi K..
LM Studio Bionic, 로컬 오픈 모델로 코딩과 문서 작업을 묶었어요 LM Studio Bionic, 로컬 오픈 모델로 코딩과 문서 작업을 묶었어요LM Studio Bionic AI 뉴스 썸네일LM Studio가 오픈 모델용 작업 에이전트 ‘Bionic’을 공개했어요. 기존 LM Studio와 분리된 프로젝트 작업용 앱이에요. 코딩과 문서 편집, 음성 입력을 한곳에 넣고 로컬 실행과 클라우드 실행을 작업마다 고를 수 있게 했어요. 1핵심 요약구분제공 기능확인할 점모델 실행기기 내부 모델, LM Link 연결 모델, Secure Cloud 모델을 선택해요로컬과 클라우드의 데이터 경계를 작업 전에 확인해야 해요코딩코드베이스 검색, 설명, 편집, 디버깅, 인라인 diff를 지원해요변경 검토와 테스트는 개발자가 직접 맡아야 해요문서 작업PDF·문서·프레젠테이션·스프레드시트를 샌드..
코딩 모델 12개에 같은 앱을 시켰더니, 과제마다 승자가 달랐어요 코딩 모델 12개에 같은 앱을 시켰더니, 과제마다 승자가 달랐어요코딩 AI 모델 비교 썸네일코딩 모델의 실력은 순위표 한 줄로 설명하기 어려워요. 12개 모델에 같은 앱 4개를 과제별로 5번씩 만들게 한 비교에서도 GPT-5.6 Sol과 Claude Fable 5가 서로 다른 과제에서 앞섰어요. 비용이 적게 드는 모델도 익숙한 문제에서는 꽤 좋은 결과를 냈어요. 1핵심 요약구분핵심왜 볼 만한가요비교 규모12개 모델이 앱 4개를 각각 5번씩 만들었어요한 번의 성공보다 실행 간 편차를 확인할 수 있어요복잡한 과제레이캐스터는 GPT-5.6 Sol, 3D 큐브는 Claude Fable 5가 5번 모두 성공했어요모델마다 잘 다루는 구현 문제가 다르다는 점이 드러났어요비용Grok 4.5와 일부 오픈 웨이트 모델이 ..
Claude 구독 논란, 개발자 도구 선택권을 다시 묻다 Claude 구독 논란, 개발자 도구 선택권을 다시 묻다AI 뉴스 썸네일Claude 구독을 어디까지 쓸 수 있느냐가 다시 논쟁거리가 됐어요. 개발자들은 모델 성능만 보지 않고, 구독 한도와 도구 선택권, 제3자 도구 과금 조건까지 같이 따지기 시작했어요.핵심 요약구분핵심왜 볼 만한가요구독 정책Claude 구독 사용처와 제3자 도구 과금 조건이 논란이 됐어요개발자는 모델보다 워크플로 전체 비용을 먼저 보게 돼요개발자 도구Claude Code 중심 구조가 편리함과 종속을 동시에 만들어요좋은 모델을 써도 원하는 편집기와 실행 도구를 못 쓰면 체감 가치가 내려가요과금 변화2026년 6월 Agent SDK 크레딧 분리안은 반발 뒤 보류된 흐름으로 보여요공지가 되돌려져도 팀은 같은 변화가 반복될 수 있다고 봐요대안..
CursorBench 3.1은 코딩 모델 비교를 더 실무 쪽으로 당겼어요 CursorBench 3.1은 코딩 모델 비교를 더 실무 쪽으로 당겼어요AI 뉴스 썸네일AI 코딩 도구를 고를 때 이제 “코드를 얼마나 잘 쓰나”만 보면 부족해요. 긴 코드베이스를 읽고, 버그를 찾고, 리뷰 의견을 내고, 비용까지 감당할 수 있는지가 같이 중요해졌어요. CursorBench 3.1은 그 기준을 숫자로 보여주려는 평가표예요. 2핵심 요약구분핵심왜 볼 만한가요모델 순위Fable 5 Max가 72.9%로 1위를 기록했어요코딩 모델 상위권의 기준선이 다시 올라갔어요상위권 구조Fable 5 계열이 1~4위를 모두 차지했어요같은 모델군 안에서도 추론 강도와 비용 선택지가 갈려요평가 범위코드베이스 이해, 버그 찾기, 계획, 코드 리뷰 과제가 추가됐어요단순 수정보다 실제 개발 흐름에 가까운 비교로 이동..

728x90