본문 바로가기

IT & AI

4B 검색 모델이 GPT-5.6 Sol을 앞선 조건

728x90

4B 검색 모델이 GPT-5.6 Sol을 앞선 조건

AI 뉴스 썸네일
AI 뉴스 썸네일

기업 문서 검색에 매번 큰 범용 모델을 호출하면 정확도보다 비용과 응답 시간이 먼저 문제가 돼요. Castform과 Neon은 Qwen3.5-4B Base를 특정 검색 작업에 맞게 학습해, 자체 평가에서 GPT-5.6 Sol보다 높은 점수를 기록했다고 밝혔어요. 1

결과는 흥미롭지만, 적용 범위를 구분해서 봐야 해요. 공개된 수치는 범용 지능 비교가 아니라 GitLab 제품 문서에서 만든 질문에 답하는 검색 작업의 평가 결과예요. 2

핵심 요약

구분확인된 내용읽을 때 주의할 점
모델Qwen3.5-4B Base를 검색 작업에 맞게 강화학습 후처리했어요모든 검색과 추론에서 GPT-5.6 Sol보다 낫다는 뜻은 아니에요
평가 결과평균 평가 보상은 맞춤 모델 1.447, GPT-5.6 Sol 1.369로 측정됐어요Castform이 만든 특정 말뭉치와 보상 함수에서 측정한 값이에요
추론 비용평가 차트의 롤아웃 비용은 0.000920달러와 0.087338달러예요약 95배 차이라서 제목의 100배는 반올림한 표현에 가까워요
공개 범위기반 모델은 Apache 2.0 라이선스로 공개돼 있어요후처리된 체크포인트의 직접 다운로드 링크는 원문에서 확인되지 않아요
인프라Postgres 저장, 검색, 학습 롤아웃, 운영 추론에 같은 검색 환경을 써요성능만큼 합성 데이터와 평가 기준 설계가 결과를 좌우해요

1. 작은 모델은 검색 방법을 따로 배웠어요

Castform은 Qwen3.5-4B Base에 기업 문서를 넣어 외우게 하는 방식만 택하지 않았어요. 문서에서 질문과 정답을 만들고, 모델이 검색 도구를 여러 번 호출하며 답을 찾게 했어요. 올바른 문서 조각을 찾았는지, 맞는 출처를 인용했는지, 최종 답이 정확한지를 보상 함수로 채점했어요. 2

평가 차트에서 후처리 전 Qwen3.5-4B Base의 평균 보상은 0.382였어요. 후처리 뒤에는 1.447로 올랐어요. 같은 차트에서 GPT-5.6 Sol은 1.369를 기록했어요. 이 비교가 보여 주는 건 작은 모델도 반복되는 검색 절차를 충분히 연습하면 특정 문서 검색에서는 큰 범용 모델과 경쟁할 수 있다는 점이에요.

728x90

비용 차이는 더 커요. 차트에 표시된 롤아웃당 추론 비용은 맞춤 모델이 0.000920달러, GPT-5.6 Sol이 0.087338달러예요. 두 값을 비교하면 약 95배 차이가 나요. 원문은 일반적인 GPT-5.6 Sol 다중 턴 검색도 요청당 10초 이상, 약 0.03달러가 든다고 설명해요. 일반 요청 수치와 평가 차트의 롤아웃 수치는 측정 단위가 다르므로 서로 섞어 해석하면 안 돼요. 2

기반 모델 Qwen3.5-4B Base는 Hugging Face에서 Apache 2.0 라이선스로 공개돼 있어요. 다만 Neon 글에는 Castform이 후처리한 체크포인트를 바로 내려받을 수 있는 모델 카드가 연결돼 있지 않아요. 그래서 공개 기반 모델을 사용했다는 사실과 완성된 맞춤 모델까지 공개됐다는 주장은 나눠서 봐야 해요. 3

검색 환경도 학습 과정의 일부예요

원본 문서는 Neon Postgres에 저장돼요. 합성 질문을 만들 때와 강화학습 롤아웃을 돌릴 때, 운영 환경에서 답을 생성할 때 모두 Lakebase Search를 사용해요. BM25 계열 텍스트 검색과 벡터 검색을 결합하는 예제 코드도 공개돼 있어요. 4

수천 개의 학습 롤아웃이 동시에 검색하면 짧은 시간에 요청이 몰려요. Neon은 동적 컴퓨팅 확장으로 이 구간을 처리하고, 유휴 시간에는 자원을 줄여요. 데이터를 변경하는 작업까지 학습하려면 롤아웃마다 격리된 데이터베이스 상태가 필요해요. Neon의 브랜칭과 시간 여행 쿼리는 한 작업이 다른 작업이나 운영 데이터를 건드리지 않도록 환경을 나누는 데 쓰여요. 2

왜 중요한가요

고객 지원 문서, 사내 규정, 제품 카탈로그처럼 질문 형태가 반복되는 서비스는 큰 모델을 매번 부를 필요가 줄어들 수 있어요. 초기 학습 비용을 감수해도 요청량이 많으면 작은 맞춤 모델의 낮은 추론 비용이 누적 운영비를 낮춰요. 검색과 재순위화는 작은 모델에 맡기고, 복잡한 판단만 큰 모델로 보내는 라우팅 구조도 현실적인 선택지가 돼요. 2

도입 전에 평가 설계를 먼저 확인해야 해요. 이번 결과는 Castform과 Neon이 함께 공개한 사례 연구이며, GitLab 제품 문서에서 합성한 질문과 자체 보상 지표를 사용했어요. BrowseComp 같은 공통 검색 벤치마크나 여러 독립 말뭉치에서 같은 차이가 재현됐다는 자료는 원문에 없어요. 실제 팀은 자사 문서의 최신성, 권한 분리, 인용 정확도, 새 문서 추가 뒤의 성능을 별도로 측정해야 해요. 1

작은 모델의 장점은 모델 크기만으로 생기지 않아요. 질문·정답 생성 품질, 검색 도구, 보상 함수, 운영 데이터와 비슷한 평가 데이터가 함께 맞아야 해요. 이 조건을 갖춘 반복 업무라면 4B 모델도 비용 절감 수단이 될 수 있어요. 조건이 자주 바뀌거나 열린 웹 전체를 다루는 검색이라면 이번 수치를 그대로 기대하기 어려워요.

참고 자료

  1. 100배 저렴한 오픈 모델로 검색에서 GPT-5.6 Sol 능가하기 — GeekNews
  2. Training 100x Cheaper Retrieval models Neon and Castform — Neon
  3. Qwen3.5-4B-Base Model Card — Hugging Face
  4. Neon RAG example in Benchmax — Castform GitHub
728x90