본문 바로가기

728x90

Kimi

(10)
AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요 AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요AI 뉴스 썸네일Netlify가 AI 코딩 모델 11개에 같은 커피숍 웹사이트 제작 지시를 주고, 모델마다 3번씩 실행했어요. 가장 비싼 실행이 늘 가장 나은 결과를 내지는 않았고, 같은 모델 안에서도 비용과 디자인 편차가 컸어요. 1핵심 요약구분확인된 결과실무에서 볼 점비용실행당 2.4~1,055 크레딧으로 차이가 컸어요모델 이름보다 작업별 예산 범위를 먼저 정해야 해요결과물같은 모델을 3번 실행해도 디자인과 콘텐츠가 달라졌어요한 번의 결과만으로 모델을 평가하기 어려워요고가 모델Claude Opus 5가 풍부한 화면을 만들었지만 비용 변동도 컸어요높은 비용이 같은 비율의 품질 향상을 보장하지 않아요저가 모델GLM 5.2, Kimi K..
미국 AI, 중국 오픈 모델에 기대는 역설 미국 AI, 중국 오픈 모델에 기대는 역설AI 뉴스 썸네일미국 기업은 가장 강한 폐쇄형 AI 모델을 만들고 있어요. 그런데 미국 개발사가 자유롭게 고치고 소유할 수 있는 오픈 모델을 만들 때는 Qwen과 Kimi 같은 중국 모델에 기대는 일이 늘고 있어요. 폐쇄형 프런티어의 우위가 오픈 모델 생태계의 우위로 곧장 이어지지 않는 이유예요. 1핵심 요약구분핵심왜 볼 만한가요오픈 모델 생태계Qwen 기반 신규 미세조정·변형 모델의 비중이 2024년 1월 1%에서 2026년 2월 69%로 커졌어요미국 기업도 제품과 연구에 중국 오픈 가중치를 쓰는 구조가 굳어질 수 있어요학습 경로중국 오픈 모델의 출력은 후속학습에 쓸 수 있지만 GPT나 Claude 출력은 약관상 같은 방식으로 쓰기 어려워요미국의 프런티어 능력이..
Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTE Kimi K3 2.78조 모델을 64GB 맥북에서 돌린 WASTEKimi K3 로컬 추론 썸네일2.78조 파라미터 규모의 Kimi K3를 64GB MacBook Pro에서 실행한 오픈소스 프로젝트가 나왔어요. WASTE는 모델 전체를 메모리에 올리는 대신, 토큰 생성에 필요한 전문가 가중치만 NVMe에서 읽어요. 속도는 빠르지 않지만 초대형 MoE 모델을 개인용 하드웨어에서 구동하는 방법을 구체적인 수치로 보여줘요. 1핵심 요약구분내용실제 의미모델Kimi K3 2.78조 파라미터 전체 모델증류하거나 가지치기한 축소판이 아니에요저장공간변환된 컨테이너 982GiB내부 NVMe에 약 1TB 여유 공간이 필요해요메모리4K 컨텍스트 최소 29.05GiB, 권장 구성 64GB최소치로 열 수는 있어도 운영체제 페이징..
중국 오픈 가중치 AI가 배포 경쟁에서 유리한 이유 중국 오픈 가중치 AI가 배포 경쟁에서 유리한 이유AI 뉴스 썸네일중국 AI 기업들이 모델 가중치를 공개하며 배포 범위를 넓히고 있어요. 미국 기업이 중앙 서버의 유료 API로 최상위 성능을 파는 동안, 공개 가중치 모델은 기업이 원하는 인프라에 직접 올리고 공급자를 바꿀 선택지를 줘요. 다만 공개 전략이 장기적인 우위로 이어질지는 성능, 운영비, 라이선스와 정책까지 함께 봐야 해요.핵심 요약구분핵심왜 볼 만한가요배포 방식공개 가중치 모델은 여러 클라우드와 자체 서버에서 운영할 수 있어요모델 개발사가 모든 추론 인프라를 직접 확보하지 않아도 사용처가 늘어날 수 있어요기업 도입실제 전환 비용은 모델보다 계약, 데이터 연결, 권한 관리와 운영 도구에서 생겨요기업은 업무 시스템을 유지한 채 모델 공급자를 교체..
Kimi K3가 신규 구독을 멈춘 이유 Kimi K3가 신규 구독을 멈춘 이유AI 뉴스 썸네일Moonshot AI가 Kimi K3의 신규 유료 구독을 잠시 멈췄어요. 출시 뒤 수요가 예상보다 빠르게 늘면서 최근 48시간의 GPU 사용량이 현재 용량 한계에 가까워졌기 때문이에요. 기존 가입자는 계속 이용할 수 있어요.핵심 요약구분핵심왜 볼 만한가요신규 가입Moonshot AI가 Kimi K3 신규 구독을 일시 중단했어요대기열보다 기존 유료 사용자의 이용 품질을 먼저 지키는 결정을 내렸어요인프라최근 48시간의 수요가 현재 GPU 용량 한계에 근접했어요AI 서비스의 성장 속도와 실제 추론 자원 확보 속도가 맞지 않을 수 있어요재개 방식용량을 늘린 뒤 신규 가입 자리를 배치 단위로 다시 열 계획이에요한꺼번에 가입을 받지 않고 실제 처리 여력을 보며 ..
Kimi K3가 Claude의 가격 장벽을 흔들기 시작했어요 Kimi K3가 Claude의 가격 장벽을 흔들기 시작했어요Kimi K3와 Claude 가격 경쟁 썸네일Kimi K3를 실제 코딩 업무에 써 본 개발자가 Claude와 결과를 구별하기 어려웠다고 평가했어요. 체감 품질이 비슷하다면 모델 선택 기준은 이름보다 작업당 비용, 사용량 제한, 데이터 처리 방식으로 옮겨가요.핵심 요약구분확인된 내용개발자가 볼 지점코딩 품질원문 작성자는 일상적인 코딩 작업에서 Kimi K3와 Claude의 결과 품질과 토큰 사용량이 비슷했다고 평가했어요개인 사용기라서 팀의 실제 저장소와 업무로 다시 시험해야 해요API 가격작성자가 제시한 Kimi K3 단가는 입력 100만 토큰당 3달러, 출력 15달러예요표시 단가보다 한 작업을 끝낼 때 소비한 총 토큰과 재시도 횟수를 함께 봐야 ..
Kimi K3 펠리컨 실험이 보여준 벤치마크의 쓸모와 한계 Kimi K3 펠리컨 실험이 보여준 벤치마크의 쓸모와 한계AI 뉴스 썸네일Moonshot AI의 Kimi K3는 2.8조 개 매개변수와 100만 토큰 문맥을 내세운 대형 모델이에요. 자전거를 타는 펠리컨 SVG 하나를 그리게 했더니 비용, 추론량, 공간 인식은 드러났지만 실제 업무 능력까지 판단하기에는 빈틈이 컸어요.핵심 요약구분핵심왜 볼만한가요모델Kimi K3는 2.8조 개 매개변수와 멀티모달 기능을 갖췄어요오픈 가중치 모델의 규모와 활용 범위가 한 단계 커졌어요가격API 가격은 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러예요단순 작업도 추론량이 많으면 비용이 빠르게 늘어요실험펠리컨 SVG 생성에 출력 16,658 토큰과 0.25달러가 들었어요짧은 입력만으로 실제 비용과 출력 형식을 확..
LM Studio Bionic, 로컬 오픈 모델로 코딩과 문서 작업을 묶었어요 LM Studio Bionic, 로컬 오픈 모델로 코딩과 문서 작업을 묶었어요LM Studio Bionic AI 뉴스 썸네일LM Studio가 오픈 모델용 작업 에이전트 ‘Bionic’을 공개했어요. 기존 LM Studio와 분리된 프로젝트 작업용 앱이에요. 코딩과 문서 편집, 음성 입력을 한곳에 넣고 로컬 실행과 클라우드 실행을 작업마다 고를 수 있게 했어요. 1핵심 요약구분제공 기능확인할 점모델 실행기기 내부 모델, LM Link 연결 모델, Secure Cloud 모델을 선택해요로컬과 클라우드의 데이터 경계를 작업 전에 확인해야 해요코딩코드베이스 검색, 설명, 편집, 디버깅, 인라인 diff를 지원해요변경 검토와 테스트는 개발자가 직접 맡아야 해요문서 작업PDF·문서·프레젠테이션·스프레드시트를 샌드..
코딩 모델 12개에 같은 앱을 시켰더니, 과제마다 승자가 달랐어요 코딩 모델 12개에 같은 앱을 시켰더니, 과제마다 승자가 달랐어요코딩 AI 모델 비교 썸네일코딩 모델의 실력은 순위표 한 줄로 설명하기 어려워요. 12개 모델에 같은 앱 4개를 과제별로 5번씩 만들게 한 비교에서도 GPT-5.6 Sol과 Claude Fable 5가 서로 다른 과제에서 앞섰어요. 비용이 적게 드는 모델도 익숙한 문제에서는 꽤 좋은 결과를 냈어요. 1핵심 요약구분핵심왜 볼 만한가요비교 규모12개 모델이 앱 4개를 각각 5번씩 만들었어요한 번의 성공보다 실행 간 편차를 확인할 수 있어요복잡한 과제레이캐스터는 GPT-5.6 Sol, 3D 큐브는 Claude Fable 5가 5번 모두 성공했어요모델마다 잘 다루는 구현 문제가 다르다는 점이 드러났어요비용Grok 4.5와 일부 오픈 웨이트 모델이 ..
CursorBench 3.1은 코딩 모델 비교를 더 실무 쪽으로 당겼어요 CursorBench 3.1은 코딩 모델 비교를 더 실무 쪽으로 당겼어요AI 뉴스 썸네일AI 코딩 도구를 고를 때 이제 “코드를 얼마나 잘 쓰나”만 보면 부족해요. 긴 코드베이스를 읽고, 버그를 찾고, 리뷰 의견을 내고, 비용까지 감당할 수 있는지가 같이 중요해졌어요. CursorBench 3.1은 그 기준을 숫자로 보여주려는 평가표예요. 2핵심 요약구분핵심왜 볼 만한가요모델 순위Fable 5 Max가 72.9%로 1위를 기록했어요코딩 모델 상위권의 기준선이 다시 올라갔어요상위권 구조Fable 5 계열이 1~4위를 모두 차지했어요같은 모델군 안에서도 추론 강도와 비용 선택지가 갈려요평가 범위코드베이스 이해, 버그 찾기, 계획, 코드 리뷰 과제가 추가됐어요단순 수정보다 실제 개발 흐름에 가까운 비교로 이동..

728x90