본문 바로가기

728x90

Opus5

(2)
Opus 5가 더 똑똑해도 함께 일하기 불편한 이유 Opus 5가 더 똑똑해도 함께 일하기 불편한 이유AI 뉴스 썸네일Claude Opus 5가 이전 모델보다 문제 해결 능력은 좋아졌지만, 실제 코딩에서는 더 자주 감독해야 한다는 개발자 경험담이 나왔어요. 모호한 지시를 받았을 때 질문하기보다 가정을 세우고 움직이는 성향이 협업 부담을 키운다는 지적이에요. 1핵심 요약구분확인된 내용읽을 때 볼 점모델 역량글쓴이는 Opus 5가 Opus 4.7·4.8보다 유능하고 벤치마크에서도 Fable과 경쟁한다고 평가해요높은 문제 해결 점수와 편한 협업 경험은 같은 지표가 아니에요확인 행동이전 모델은 의도가 불분명하면 질문했지만 Opus 5는 가정을 확인하는 과정이 부족했다고 해요잘못된 방향으로 빠르게 진행하면 수정 비용이 커져요평가 방식글쓴이는 벤치마크와 RLVR이 ..
LLM 평가는 짧은 정답에서 두 시간짜리 세계 제작으로 가고 있어요 LLM 평가는 짧은 정답에서 두 시간짜리 세계 제작으로 가고 있어요AI 뉴스 썸네일자전거를 탄 펠리컨 SVG는 한동안 AI 모델의 시각 이해와 코드 생성 능력을 가볍게 비교하는 과제로 쓰였어요. Andrej Karpathy는 이제 평가 범위를 넓혀, 문학 작품의 한 문단을 3D 세계로 구현하는 장시간 작업을 시험했어요. 결과물의 화려함보다 모델이 긴 작업을 계획하고 끝까지 이어 가는 과정이 더 볼만해요. 1핵심 요약구분내용과제《반지의 제왕》 첫 문단을 Three.js 기반 3D 장면으로 구현했어요.작업 규모Opus 5가 약 2시간 동안 5,500줄가량의 코드를 작성했어요.자원토큰 예산은 100만 개였고 비용은 약 10달러였어요.결과폴리곤 자산, 3차원 배치, 애니메이션을 묶어 작동하는 장면을 만들었어요...

728x90