GPT-5.6 Sol 비전 성능, 탐지는 뛰었지만 OCR은 제자리였어요

GPT-5.6 Sol은 객체 탐지와 계수에서 GPT-5.5보다 나은 결과를 냈어요. 하지만 OCR과 특정 정보 추출 점수는 이전 모델을 넘지 못했어요. 화면을 이해하는 AI 기능을 만들 때는 모델 이름보다 작업별 성능, 이미지 크기, 처리 비용을 함께 봐야 해요. 2
핵심 요약
| 구분 | 내용 |
| 객체 탐지 | Sol의 mAP@50은 46.2로, GPT-5.5의 13.8보다 32.4포인트 높았어요. |
| 객체 계수 | Sol은 73.0%를 기록해 GPT-5.5의 64.9%를 앞섰어요. |
| OCR·추출 | OCR은 90.7%, 텍스트 추출은 82.5%로 GPT-5.5보다 각각 0.5포인트와 5.1포인트 낮았어요. |
| 대형 이미지 | 약 2,000×2,000픽셀 이상에서는 경계 상자가 엉뚱한 곳에 생기는 사례가 있었어요. |
| 비용·속도 | Sol은 이미지 1장당 약 10초와 2.5센트가 들었어요. 대량 처리에서는 총비용이 늘어요. |
1. GPT-5.6 Sol은 탐지에서 가장 크게 달라졌어요
Roboflow는 GPT-5.6 제품군인 Sol, Terra, Luna를 객체 탐지, 계수, OCR, 데이터 추출 과제로 평가했어요. 이 평가에서 Sol의 mAP@50은 46.2였어요. GPT-5.5의 13.8과 비교하면 32.4포인트 높아요. Terra는 44.7, Luna는 43.3을 기록해 제품군 전체가 이전 모델을 앞섰어요. 2
문서 레이아웃을 찾는 작업에서도 차이가 나타났어요. Sol은 제목, 문단, 표, 이미지, 서명 영역을 구분했어요. 문서 처리 시스템은 OCR을 시작하기 전에 필요한 영역부터 찾아야 할 때가 많아요. 탐지 정확도가 오르면 페이지 전체를 무작정 읽지 않고 표나 서명처럼 필요한 부분만 다음 단계로 넘길 수 있어요.
좌표 형식은 성능에 직접 영향을 줬어요. GPT-5.6에 이미지 픽셀 기준의 절대 XYXY 좌표를 요청했을 때 결과가 가장 좋았어요. 다른 좌표 형식을 쓰면 탐지 성능이 약 15 mAP 포인트 낮아졌어요. 같은 모델을 써도 출력 좌표 규칙을 어떻게 정하느냐에 따라 결과가 달라질 수 있다는 뜻이에요. 2
객체 계수도 나아졌어요. Sol은 73.0%, Terra는 67.6%, Luna는 66.2%였어요. GPT-5.5는 64.9%였어요. 겹쳐 있는 금속 부품이나 지정된 구역 안의 흔적을 세는 과제에서는 Sol이 대상과 범위를 함께 처리했어요. 반사광이 있는 알약 포장처럼 빈칸과 채워진 칸의 차이가 작은 장면에서는 여전히 틀렸어요.
큰 이미지는 잘라서 보내는 편이 안전해요
약 2,000×2,000픽셀 이상의 이미지에서는 Sol이 실제 물체와 겹치지 않는 경계 상자를 반환한 사례가 있었어요. 낮은 추론 강도에서 더 불안정했어요. 추론 강도를 높이면 안정성은 나아졌지만 토큰 사용량과 대기 시간, 비용도 늘었어요. Roboflow가 사례를 공유하자 OpenAI도 큰 이미지에서 불안정성이 생길 수 있다고 답했어요. 운영 환경에서는 큰 이미지를 축소하거나 여러 조각으로 나눠 보내는 방식이 현실적인 대응이에요. 2
OCR과 데이터 추출은 이전 모델보다 낫지 않았어요
Sol의 OCR 평균 유사도는 90.7%였어요. GPT-5.5의 91.2%보다 0.5포인트 낮아요. 특정 정보를 골라내는 텍스트 추출에서는 Sol이 82.5%, GPT-5.5가 87.6%를 기록해 차이가 더 컸어요. 손 글씨나 타이어 곡면의 글자를 읽은 성공 사례가 있었지만, 반사광이 있는 알약 포장의 유효기간은 읽지 못했어요. 탐지 점수의 상승을 문서 인식 전반의 개선으로 넓혀 해석하기는 어려워요.
속도와 가격도 작업 선택에 영향을 줘요. Roboflow 측정에서 Sol은 이미지 1장당 약 10초와 2.5센트가 들었어요. Terra는 약 6초와 1센트, Luna는 5초를 조금 넘기고 0.5센트 미만이었어요. Gemini 3.5 Flash는 0.8센트였고 같은 평가의 탐지와 계수에서 Sol보다 높은 점수를 냈어요. 다량의 이미지를 반복 처리한다면 Sol의 최고 점수보다 처리량과 총비용이 더 중요한 기준이 될 수 있어요. 2
이 수치는 Roboflow가 준비 중인 자체 VLM 벤치마크에서 나온 결과예요. 모든 산업 이미지와 평가 조건을 대표하는 공식 종합 점수로 보기는 어려워요. 실제 도입 전에는 서비스에서 쓰는 이미지, 좌표 형식, 추론 강도로 별도 시험해야 해요.
왜 중요한가요
화면을 보고 버튼과 입력창을 찾는 UI 에이전트는 객체 위치를 안정적으로 알아야 해요. 문서 자동화도 제목, 표, 서명 영역을 먼저 찾은 뒤 OCR과 추출을 이어 가요. GPT-5.6 Sol의 탐지 성능 상승은 이런 앞단 작업에 쓸 수 있는 OpenAI 모델 선택지가 늘었다는 의미가 있어요. 2
한 모델이 모든 비전 작업에서 고르게 좋아진 것은 아니에요. 탐지와 계수는 개선됐지만 OCR과 텍스트 추출은 GPT-5.5보다 낮았어요. 이미지 크기에 따른 불안정성과 좌표 형식의 민감도도 확인됐어요. 화면 탐지에는 Sol을 쓰고 OCR에는 다른 모델이나 전용 엔진을 붙이는 식으로 작업을 나누는 편이 합리적이에요.
운영 전에는 정확도만 기록하면 부족해요. 이미지 1장당 지연 시간과 비용, 실패한 이미지의 크기, 사용한 좌표 형식까지 함께 남겨야 해요. 대량 처리에서는 작은 단가 차이도 전체 비용으로 커지고, 10초 안팎의 지연은 실시간 화면 조작에 부담이 될 수 있어요. Roboflow 결과만 놓고 보면 Sol은 품질을 우선하는 탐지 작업에 맞고, 대량 탐지와 계수는 Gemini 3.5 Flash 같은 대안과 직접 비교할 필요가 있어요. 2
참고 자료
- GPT-5.6 Sol은 OpenAI가 지금까지 출시한 최고의 비전 모델 — GeekNews
- GPT 5.6 Sol is the best "vision" model OpenAI ever released — Roboflow Blog
'IT & AI' 카테고리의 다른 글
| Bluesky는 어떻게 스크린샷에만 로고를 띄울까요 (0) | 2026.08.18 |
|---|---|
| Qwen3.8 27B 지능 지수 52점, 점수보다 토큰 사용량을 함께 봐야 해요 (1) | 2026.08.18 |
| DuckDB v2.0 미리보기, 파일 안의 분석 DB가 서버로 넓어져요 (0) | 2026.08.18 |
| Stripe의 OpenRouter 인수 합의 보도, AI 모델 선택과 결제가 만나요 (0) | 2026.08.18 |
| Qwen 3.8 27B, 성능보다 먼저 바꿔야 할 추론 설정 (0) | 2026.08.18 |