GPT (4) 썸네일형 리스트형 AI 연구소가 자전거 타는 펠리컨에 맞춰 모델을 훈련했을까요 AI 연구소가 자전거 타는 펠리컨에 맞춰 모델을 훈련했을까요자전거 타는 펠리컨 AI 벤치마크 분석유명한 SVG 과제만 잘 풀도록 AI 모델을 따로 조정했다는 의심을 검증한 실험이 나왔어요. 7개 모델이 만든 SVG 1,008개를 비교했지만, 자전거를 타는 펠리컨 조합에서만 성능이 높아진 흔적은 찾지 못했어요. 1핵심 요약구분핵심왜 볼 만한가요실험 규모8종의 동물과 6종의 탈것을 조합해 48개 과제를 만들고, 7개 모델에서 3회씩 실행했어요특정 과제 하나가 아니라 비슷한 과제 47개와 나란히 비교했어요결과펠리컨은 동물 8종 중 6위, 자전거는 탈것 6종 중 5위였어요유명한 조합만 유난히 잘 그렸다는 설명과 맞지 않았어요조합 순위펠리컨과 자전거 조합은 전체 48개 중 42위였어요개별 요소의 난이도를 고려해도.. Codex 한도 리셋 35회, 다음 초기화는 언제 올까요 Codex 한도 리셋 35회, 다음 초기화는 언제 올까요AI 뉴스 썸네일Codex를 자주 쓰면 모델 성능만큼 사용량 한도가 신경 쓰여요. 비공식 사이트 Codex Resets는 OpenAI 관계자 @thsottiaux가 X에 올린 한도 초기화 공지를 모아, 언제 어떤 이유로 리셋됐는지 보여줘요. 2026년 7월 20일 확인 기준으로 35회를 기록했고 마지막 리셋은 2일 전이에요. 1핵심 요약구분핵심왜 볼 만한가요현재 기록리셋 35회, 평균 간격 8.9일, 최장 공백 67.7일이에요고정 주기가 아니라는 점을 숫자로 확인할 수 있어요리셋 이유장애 보상, 사용량 계산 오류, 제품 출시, 이용자 증가가 섞여 있어요초기화 공지만으로 서비스 상태를 단정하면 안 돼요적용 방식즉시 초기화 외에 원하는 때 쓰는 저장형 .. GPT-5.6 정식 공개, 성능보다 비용 구조가 더 크게 바뀌었어요 GPT-5.6 정식 공개, 성능보다 비용 구조가 더 크게 바뀌었어요AI 뉴스 썸네일OpenAI가 GPT-5.6 패밀리를 정식 공개했어요. 이름만 보면 또 하나의 고성능 모델처럼 보이지만, 이번 발표에서 더 눈에 띄는 건 성능을 올리면서도 토큰 사용량과 작업당 비용을 줄이려는 방향이에요.핵심 요약구분핵심왜 볼 만한가요모델 구성Sol, Terra, Luna 3개 티어로 나뉘어요최고 성능 모델 하나가 아니라 작업 난도와 비용에 맞춰 고르는 구조예요코딩Sol은 Artificial Analysis Coding Agent Index 80점을 기록했다고 공개됐어요에이전트 코딩 도구가 성능 경쟁에서 비용 경쟁으로 넘어가는 흐름이 보여요비용API 가격은 Sol 기준 입력 100만 토큰당 5달러, 출력 100만 토큰당 3.. 코딩 에이전트가 시니어 개발자 일을 얼마나 풀 수 있을까요 코딩 에이전트가 시니어 개발자 일을 얼마나 풀 수 있을까요AI 뉴스 썸네일AI 코딩 도구 평가는 오래전부터 실제 업무와 조금 어긋나 있었어요. 새 벤치마크인 Senior SWE-Bench는 정리된 작은 과제가 아니라, 기능 개발과 버그 조사처럼 시니어 엔지니어가 맡는 일에 더 가까운 문제를 내세워요.핵심 요약구분핵심왜 볼 만한가요코딩 에이전트 평가Senior SWE-Bench가 실제 PR 기반 과제 100개를 공개·비공개 세트로 나눠 평가해요단순 코드 수정보다 런타임 조사, 프로젝트 관행, 코드 품질을 함께 봐요기능 개발 과제요구사항을 과하게 쪼개지 않고 자연어 요청에 가까운 지시를 써요실제 제품 개발에서 생기는 빈칸을 모델이 어떻게 메우는지 볼 수 있어요현재 성능리더보드 1위 Claude Opus 4... 이전 1 다음