본문 바로가기

728x90

vlm

(2)
GPT-5.6 Sol 비전 성능, 탐지는 뛰었지만 OCR은 제자리였어요 GPT-5.6 Sol 비전 성능, 탐지는 뛰었지만 OCR은 제자리였어요AI 뉴스 썸네일GPT-5.6 Sol은 객체 탐지와 계수에서 GPT-5.5보다 나은 결과를 냈어요. 하지만 OCR과 특정 정보 추출 점수는 이전 모델을 넘지 못했어요. 화면을 이해하는 AI 기능을 만들 때는 모델 이름보다 작업별 성능, 이미지 크기, 처리 비용을 함께 봐야 해요. 2핵심 요약구분내용객체 탐지Sol의 mAP@50은 46.2로, GPT-5.5의 13.8보다 32.4포인트 높았어요.객체 계수Sol은 73.0%를 기록해 GPT-5.5의 64.9%를 앞섰어요.OCR·추출OCR은 90.7%, 텍스트 추출은 82.5%로 GPT-5.5보다 각각 0.5포인트와 5.1포인트 낮았어요.대형 이미지약 2,000×2,000픽셀 이상에서는 경계..
Mistral의 Robostral Navigate, 로봇 내비게이션을 카메라 하나로 줄였어요 Mistral의 Robostral Navigate, 로봇 내비게이션을 카메라 하나로 줄였어요AI 뉴스 썸네일로봇 내비게이션은 센서가 많을수록 안정적이라는 인식이 강했어요. Mistral의 Robostral Navigate는 그 전제를 조금 다르게 건드려요. RGB 카메라 하나와 자연어 지시만으로 길을 찾는 8B 모델을 내놓았고, 시뮬레이션 벤치마크에서는 다중 센서 접근보다 높은 수치를 냈어요. 2핵심 요약구분핵심왜 관심 가나요모델8B embodied navigation 모델 Robostral Navigate가 공개됐어요로봇이 자연어 지시와 단일 RGB 카메라만으로 이동 경로를 고르는 방향을 보여줘요성능R2R-CE validation unseen 성공률 76.6%를 기록했어요단일 카메라뿐 아니라 depth..

728x90