본문 바로가기

728x90

deepseek

(15)
추론은 강해졌는데 사실은 자주 틀려요, 소형 AI 모델의 새로운 절충 추론은 강해졌는데 사실은 자주 틀려요, 소형 AI 모델의 새로운 절충AI 뉴스 썸네일요즘 소형 LLM은 수학과 코딩 문제를 꽤 잘 풀어요. 그런데 인물의 생년이나 특정 라이브러리 버전처럼 세부 사실을 물으면 자신 있게 틀리는 경우가 많아요. 모델을 작게 만드는 과정에서 무엇을 기억하고 무엇을 외부 자료에 맡길지 다시 따져볼 시점이에요. 1핵심 요약구분핵심왜 볼 만한가요성능 변화적은 활성 매개변수로 높은 추론 점수를 내는 모델이 늘고 있어요모델 크기와 문제 해결 능력의 관계가 달라지고 있어요약점도구 없이 세부 사실을 회상할 때 오답과 환각이 많아요벤치마크 점수만으로 실제 답변 품질을 판단하기 어려워요설계 방향최신 세부 정보는 검색, 문서, 도구 호출로 가져오는 방안이 거론돼요오래된 API나 가격 정보를 가..
AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요 AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요AI 뉴스 썸네일Netlify가 AI 코딩 모델 11개에 같은 커피숍 웹사이트 제작 지시를 주고, 모델마다 3번씩 실행했어요. 가장 비싼 실행이 늘 가장 나은 결과를 내지는 않았고, 같은 모델 안에서도 비용과 디자인 편차가 컸어요. 1핵심 요약구분확인된 결과실무에서 볼 점비용실행당 2.4~1,055 크레딧으로 차이가 컸어요모델 이름보다 작업별 예산 범위를 먼저 정해야 해요결과물같은 모델을 3번 실행해도 디자인과 콘텐츠가 달라졌어요한 번의 결과만으로 모델을 평가하기 어려워요고가 모델Claude Opus 5가 풍부한 화면을 만들었지만 비용 변동도 컸어요높은 비용이 같은 비율의 품질 향상을 보장하지 않아요저가 모델GLM 5.2, Kimi K..
코딩 에이전트를 플러그인으로 조립하는 DeepSeek Harness 코딩 에이전트를 플러그인으로 조립하는 DeepSeek HarnessDeepSeek Harness 썸네일AI 코딩 도구를 바꾸려면 모델뿐 아니라 파일 접근, 셸 실행, 권한 정책, 세션 저장 방식까지 함께 손봐야 할 때가 많아요. DeepSeek Harness는 이 구성 요소를 플러그인으로 분리해 필요한 실행 환경을 조립하도록 만든 오픈소스 코딩 에이전트예요. 1핵심 요약구분내용확인할 점구조모델, 도구, 세션, 샌드박스, 실행 루프와 UI를 플러그인으로 다뤄요교체 범위가 넓은 만큼 플러그인 간 호환성 관리가 필요해요실행Web UI와 Python SDK를 제공해요Node.js를 설치하면 `npx @deepseek-ai/dsh web`으로 Web UI를 열 수 있어요기록모델 입력과 도구 호출 결과를 추가 전용..
DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요 DeepSeek V4 Flash, 추론 강도에 따라 ARC-AGI-2 점수가 15.4%p 갈렸어요AI 뉴스 썸네일DeepSeek V4 Flash 0731이 ARC-AGI 평가에서 추론 강도별 결과를 공개했어요. 가장 높은 Max 설정은 ARC-AGI-1에서 89.0%, 더 어려운 ARC-AGI-2에서 61.4%를 기록했어요. Low 설정과 비교하면 ARC-AGI-2 점수가 15.4%포인트 벌어져, 같은 모델도 답을 생각하는 데 쓰는 계산량에 따라 성능과 비용이 크게 달라질 수 있다는 점을 보여줘요. 2핵심 요약구분핵심왜 볼 만한가요최고 점수Max에서 ARC-AGI-1 89.0%, ARC-AGI-2 61.4%를 기록했어요추론 강도를 높였을 때 복잡한 규칙 문제를 얼마나 더 풀 수 있는지 숫자로 비교할 수 ..
AI 모델 고를 때, 지능만큼 응답 속도를 봐야 하는 이유 AI 모델 고를 때, 지능만큼 응답 속도를 봐야 하는 이유AI 뉴스 썸네일AI 모델의 성능이 일정 수준을 넘으면 기다리는 시간이 선택을 바꿔요. 코딩과 리서치처럼 사람이 중간 결과를 보며 방향을 잡는 작업에서는 답의 품질뿐 아니라 결과가 나오는 속도도 중요해졌어요. Martin Alderson은 일상 작업에 쓸 모델을 고를 때 순수한 지능보다 처리 속도를 더 많이 본다고 설명했어요. 2핵심 요약구분핵심왜 볼 만한가요체감 속도100~200tok/s는 빠르게 느껴지고, 50tok/s 아래는 기다림이 두드러져요사람이 결과를 읽고 다음 지시를 내리는 흐름이 달라져요모델 선택충분히 좋은 모델이 여러 개라면 응답 속도가 선택 조건이 돼요최고 성능 모델을 늘 고집할 이유가 줄어요제공자 경쟁같은 오픈 웨이트 모델도 제..
미국 AI, 중국 오픈 모델에 기대는 역설 미국 AI, 중국 오픈 모델에 기대는 역설AI 뉴스 썸네일미국 기업은 가장 강한 폐쇄형 AI 모델을 만들고 있어요. 그런데 미국 개발사가 자유롭게 고치고 소유할 수 있는 오픈 모델을 만들 때는 Qwen과 Kimi 같은 중국 모델에 기대는 일이 늘고 있어요. 폐쇄형 프런티어의 우위가 오픈 모델 생태계의 우위로 곧장 이어지지 않는 이유예요. 1핵심 요약구분핵심왜 볼 만한가요오픈 모델 생태계Qwen 기반 신규 미세조정·변형 모델의 비중이 2024년 1월 1%에서 2026년 2월 69%로 커졌어요미국 기업도 제품과 연구에 중국 오픈 가중치를 쓰는 구조가 굳어질 수 있어요학습 경로중국 오픈 모델의 출력은 후속학습에 쓸 수 있지만 GPT나 Claude 출력은 약관상 같은 방식으로 쓰기 어려워요미국의 프런티어 능력이..
DeepSeek V4 Flash 0731, 50점 성능과 낮은 API 가격의 조건 DeepSeek V4 Flash 0731, 50점 성능과 낮은 API 가격의 조건AI 뉴스 썸네일DeepSeek V4 Flash 0731은 성능 점수와 API 가격을 함께 봐야 성격이 드러나요. Artificial Analysis 평가에서는 상위권에 올랐고, 입력과 출력 가격은 비교군 중앙값보다 낮았어요. 다만 많은 출력 토큰을 쓴 만큼 실제 서비스 비용과 응답 시간은 업무별로 따져봐야 해요. 1핵심 요약구분확인된 내용실무에서 볼 부분지능 평가Intelligence Index v4.1에서 50점, 101개 모델 중 3위한 개 종합지수이므로 실제 업무와 맞는 세부 평가도 확인해야 해요모델 구조전체 2,840억 파라미터 중 토큰마다 130억 개를 활성화하는 MoE전체 규모와 실제 추론 연산량을 구분해 봐야 ..
DeepSeek V4 Flash 공개, 코딩 에이전트와 Codex 연동을 앞세웠어요 DeepSeek V4 Flash 공개, 코딩 에이전트와 Codex 연동을 앞세웠어요AI 뉴스 썸네일DeepSeek이 V4 Flash API 정식 버전을 공개 베타로 내놨어요. 기존 API 주소와 호출 방식을 바꾸지 않고 모델 이름만 `deepseek-v4-flash`로 지정하면 새 버전을 쓸 수 있어요. 코딩 에이전트 벤치마크와 Responses API 지원이 이번 업데이트의 중심이에요. 1핵심 요약구분핵심왜 볼 만한가요출시DeepSeek V4 Flash 정식 API가 공개 베타로 나왔어요기존 연동에서 모델 이름만 바꿔 시험할 수 있어요성능Terminal Bench 2.1에서 82.7점을 기록했어요터미널 작업과 도구 사용 성능을 강조한 업데이트예요연동Responses API를 기본 지원하고 Codex 설..
DeepSeek 투자 중단설, 유출 녹취록이 드러낸 중국 AI의 계산 DeepSeek 투자 중단설, 유출 녹취록이 드러낸 중국 AI의 계산AI 뉴스 썸네일DeepSeek가 두 번째 투자 라운드의 계약 체결을 당분간 멈췄다는 보도가 나왔어요. 창업자 량원펑의 비공개 발언으로 알려진 녹취록이 퍼진 뒤 나온 결정이에요. 투자 중단 자체보다 녹취록에 담긴 연산 자원, 오픈소스, 지속 학습에 대한 판단이 중국 AI 산업의 현재 위치를 더 구체적으로 보여줘요. 1핵심 요약구분핵심왜 볼 만한가요투자 유치DeepSeek가 2차 투자 라운드의 계약 체결을 일시 중단했다고 전해졌어요협상 재개 가능성이 남아 있어 투자 철회로 단정하기는 일러요유출 논란첫 투자 당시 발언으로 알려진 녹취록이 온라인에 퍼졌어요보도는 녹취록의 진위를 독립적으로 확인하지 못했다고 밝혔어요연산 격차발언에는 중국 AI의..
GigaToken, LLM 토큰화를 최대 1,000배 빠르게 만든 방법 GigaToken, LLM 토큰화를 최대 1,000배 빠르게 만든 방법GigaToken 토큰화 성능 썸네일대규모 텍스트를 언어 모델에 넣기 전에는 문장을 작은 토큰 단위로 바꿔야 해요. GigaToken은 이 토큰화 과정을 CPU에서 GB/s 단위로 처리하는 오픈소스 도구예요. 특정 벤치마크에서는 HuggingFace Tokenizers보다 약 1,000배 높은 처리량을 기록했어요. 다만 이 숫자는 모든 환경에 그대로 적용되는 평균값이 아니에요. 1핵심 요약구분핵심왜 볼 만한가요성능GPT-2 기준 EPYC 9565에서 24.53GB/s를 기록했어요수십 GB 이상의 학습 데이터를 준비할 때 대기 시간을 줄일 수 있어요구현사전 토큰화를 SIMD로 처리하고 캐시·분기·스레드 통신을 손봤어요단순히 스레드 수만 ..

728x90