본문 바로가기

728x90

OCR

(4)
GPT-5.6 Sol 비전 성능, 탐지는 뛰었지만 OCR은 제자리였어요 GPT-5.6 Sol 비전 성능, 탐지는 뛰었지만 OCR은 제자리였어요AI 뉴스 썸네일GPT-5.6 Sol은 객체 탐지와 계수에서 GPT-5.5보다 나은 결과를 냈어요. 하지만 OCR과 특정 정보 추출 점수는 이전 모델을 넘지 못했어요. 화면을 이해하는 AI 기능을 만들 때는 모델 이름보다 작업별 성능, 이미지 크기, 처리 비용을 함께 봐야 해요. 2핵심 요약구분내용객체 탐지Sol의 mAP@50은 46.2로, GPT-5.5의 13.8보다 32.4포인트 높았어요.객체 계수Sol은 73.0%를 기록해 GPT-5.5의 64.9%를 앞섰어요.OCR·추출OCR은 90.7%, 텍스트 추출은 82.5%로 GPT-5.5보다 각각 0.5포인트와 5.1포인트 낮았어요.대형 이미지약 2,000×2,000픽셀 이상에서는 경계..
문서 처리 도구를 하나로 묶은 xberg, HWP부터 OCR·RAG까지 다뤄요 문서 처리 도구를 하나로 묶은 xberg, HWP부터 OCR·RAG까지 다뤄요IT & AI 뉴스 썸네일PDF 파서, OCR, 표 추출기, 음성 전사 도구를 따로 연결하다 보면 입력 형식이 하나 늘 때마다 관리할 코드도 함께 늘어요. xberg는 여러 문서 처리 단계를 Rust 기반 코어에 모으고, 같은 결과 형식으로 꺼내 쓰게 만든 오픈소스 프레임워크예요. 1핵심 요약구분내용입력PDF, 오피스 문서, 이미지, 오디오, URL, 압축 파일, 소스 트리를 처리해요.출력일반 텍스트, Markdown, Djot, HTML, JSON 트리와 구조화 결과를 지원해요.문서 분석OCR, 표·레이아웃 복원, 메타데이터 추출, 음성 전사를 한 도구에서 선택할 수 있어요.개발 연동라이브러리, CLI, REST API, MC..
정지 화면에는 없고 움직임에만 보이는 글자, Ghost Font 정지 화면에는 없고 움직임에만 보이는 글자, Ghost FontAI 뉴스 썸네일Ghost Font는 글자 모양을 한 프레임에 그리지 않아요. 배경과 구분되지 않는 점들이 시간에 따라 움직일 때만 문장이 보여요. 사람과 AI가 영상을 읽는 방식의 차이를 이용한 시각 실험이에요. 1핵심 요약구분핵심확인할 점표현 방식점의 위치가 아니라 움직임으로 글자를 만들어요영상을 멈추면 메시지가 사라져요AI 인식단일 프레임 중심 분석은 실제 문장을 놓치기 쉬워요연속 프레임과 광학 흐름을 쓰면 복원할 수 있어요방해 장치정적인 미끼 문구를 넣어 분석을 다른 방향으로 유도해요미끼는 지연 장치일 뿐 보안 키가 아니에요활용 범위CAPTCHA와 영상 인식 평가 과제로 시험할 수 있어요사람도 읽기 어렵고 접근성 문제가 있어요1. 글자..
코드를 이미지로 바꿔 AI 비용을 줄이는 실험, pxpipe가 던진 질문 코드를 이미지로 바꿔 AI 비용을 줄이는 실험, pxpipe가 던진 질문AI 뉴스 썸네일AI 코딩 도구를 오래 쓰면 비용의 상당 부분이 코드 작성보다 입력 컨텍스트에서 나와요. pxpipe는 이 지점을 파고든 오픈소스 도구예요. 긴 코드와 도구 출력, 오래된 대화 흐름을 텍스트 대신 PNG 이미지로 넘겨 입력 토큰을 줄이는 방식이에요.핵심 요약구분핵심왜 볼 만한가요비용 구조pxpipe는 큰 입력 블록을 이미지로 바꿔 Fable 기준 전체 청구액을 약 59~70% 낮췄다고 밝혔어요AI 코딩 도구 비용이 커지는 팀이라면 입력 토큰 최적화가 바로 운영비 문제로 이어져요작동 원리이미지 토큰 비용은 이미지 안 글자 수보다 픽셀 크기에 더 크게 묶여요코드, JSON, 로그처럼 글자가 빽빽한 자료는 이미지 한 장에 ..

728x90