Inkling 공개, 975B 오픈 웨이트 모델이 성능보다 맞춤화를 택한 이유

Thinking Machines Lab이 첫 자체 모델 Inkling의 전체 가중치를 공개했어요. 가장 높은 종합 점수를 내세우기보다 긴 문맥, 멀티모달 입력, 조절할 수 있는 추론 비용과 미세조정 생태계를 한 모델에 묶은 점이 눈에 띄어요. 1
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 모델 규모 | 총 975B, 토큰당 활성 41B인 MoE 모델이에요 | 큰 전체 용량과 상대적으로 낮은 활성량을 함께 노렸어요 |
| 입력과 문맥 | 텍스트·이미지·오디오를 처리하고 최대 1M 토큰을 지원해요 | 긴 작업 기록과 여러 입력 형식을 한 흐름에서 다룰 수 있어요 |
| 비용 조절 | 추론 노력도를 0.2부터 0.99까지 설정할 수 있어요 | 호출 비용과 응답 시간을 용도별로 조절하기 쉬워요 |
| 맞춤화 | 전체 가중치와 미세조정·배포 도구를 함께 제공해요 | 기업이나 개발팀이 자체 작업에 맞춘 모델을 만들 여지가 커요 |
1. 최고 성능보다 직접 고칠 수 있는 기반 모델을 골랐어요
Inkling은 총 975B 파라미터 가운데 토큰마다 41B만 활성화하는 MoE Transformer예요. 텍스트, 이미지, 오디오, 비디오가 섞인 45조 토큰으로 사전 학습했고, 최대 문맥 길이는 1M 토큰이에요. 텍스트뿐 아니라 이미지와 오디오를 기본 입력으로 함께 추론해요. 회사는 현재 공개·비공개 모델을 통틀어 가장 강한 모델은 아니라고 직접 밝혔어요. 대신 여러 작업에 고르게 대응하고 사용자가 목적에 맞게 고칠 수 있는 기반 모델에 초점을 맞췄어요. 2
추론 비용을 작업마다 다르게 정할 수 있어요
Inkling은 추론 노력도를 0.2부터 0.99까지 조절해요. 짧고 반복적인 요청에는 적은 토큰을 쓰고, 복잡한 문제에는 더 긴 추론을 허용하는 방식이에요. 공식 측정에서 Terminal Bench 2.1 점수는 노력도에 따라 달라졌어요. 높은 설정에서는 63.8%를 기록했고, 특정 설정에서는 Nemotron 3 Ultra와 비슷한 성능을 약 3분의 1 토큰으로 냈다고 소개했어요. 대규모 서비스라면 최고 점수 하나보다 요청당 비용과 지연 시간의 곡선이 더 중요할 수 있어요. 다만 비교 모델마다 실행 환경과 자체 보고 점수가 섞여 있어 숫자를 같은 조건의 절대 순위로 읽기는 어려워요. 2
멀티모달을 별도 부가 기능처럼 붙이지 않았어요
이미지와 오디오는 별도 대형 인코더를 거치지 않고 가벼운 임베딩 계층을 통과한 뒤 텍스트 토큰과 함께 처리돼요. 오디오는 음성 전사와 녹음 질의응답, 장시간 오디오 추론을 지원해요. 비전은 이미지 설명뿐 아니라 차트와 다이어그램, 수학 문제도 다뤄요. 이미지 확대나 자르기를 Python 도구로 허용했을 때 Charxiv RQ 점수가 78.1%에서 82.0%로 올랐다는 결과도 공개했어요. 모델 자체 능력과 도구 사용 방식을 함께 설계해야 한다는 사례로 볼 수 있어요. 2
가중치 공개 뒤의 사용 경로까지 준비했어요
가중치는 Hugging Face에서 받을 수 있고, NVIDIA Blackwell용 NVFP4 체크포인트도 제공돼요. SGLang, vLLM, llama.cpp, Transformers 같은 추론 도구와의 연동도 예고했어요. 자체 서비스 Tinker에서는 64K 또는 256K 문맥으로 미세조정할 수 있어요. 미세조정한 체크포인트는 Together AI, Fireworks, Modal, Databricks, Baseten 같은 외부 서비스로 배포할 수 있어요. 파일만 공개하는 데서 끝내지 않고 학습과 배포 경로를 함께 만든 셈이에요. 3
작은 모델이 더 실용적인 선택일 수도 있어요
함께 공개한 Inkling-Small 프리뷰는 총 276B, 활성 12B 규모예요. 일부 추론·지시 수행·멀티모달 평가에서는 큰 Inkling과 비슷하거나 더 높은 점수를 냈어요. 반면 Terminal Bench 2.1, 사실 질의응답, 일부 오디오 평가에서는 큰 모델보다 낮았어요. 무조건 작은 모델이 낫다는 뜻은 아니에요. 코딩 보조나 합성 데이터 생성처럼 호출량이 많고 지연 시간이 중요한 작업에서는 비용 대비 성능을 따져볼 후보가 하나 더 생겼어요. 전체 가중치는 테스트가 끝난 뒤 공개할 예정이에요. 2
왜 중요한가요
오픈 웨이트 모델을 고를 때는 공개 벤치마크 순위만으로 결론을 내리기 어려워요. 실제 제품에서는 입력 형식, 문맥 길이, 호출 비용, 미세조정 난이도, 배포 환경이 함께 맞아야 해요. Inkling은 이 조건을 하나의 제품군으로 묶으려 해요. 특히 추론 노력도를 요청별로 조절하고, 같은 모델을 직접 미세조정한 뒤 여러 서비스에 배포할 수 있다는 점은 모델 운영팀이 시험해 볼 만해요. 2
아직 확인할 부분도 있어요. 975B 전체 규모는 로컬 운영에 큰 부담이고, 1M 토큰 지원이 모든 길이에서 같은 정확도를 보장하지는 않아요. 공식 벤치마크에는 비교 모델별 측정 조건 차이도 있어요. 도입을 검토한다면 자체 문서 검색, 코딩 작업, 오디오 질의응답처럼 실제 사용 사례를 정한 뒤 품질·지연 시간·토큰 사용량을 함께 재는 편이 안전해요.
참고 자료
- Inkling: Thinking Machines Lab의 오픈 웨이트 모델 — GeekNews
- Inkling: Our open-weights model — Thinking Machines Lab
- thinkingmachines/inkling — Hugging Face
'IT & AI' 카테고리의 다른 글
| 코딩 에이전트를 손으로 조작하는 230달러 키보드, Codex Micro (0) | 2026.07.16 |
|---|---|
| 머신러닝 독학, 자료를 더 모으기 전에 학습 순서부터 잡아야 해요 (0) | 2026.07.16 |
| ChatGPT는 어떤 출처를 읽고 인용할까, 브라우저 트래픽에서 드러난 구조 (0) | 2026.07.16 |
| Cal AI가 18개월 만에 1위 앱이 된 유통 운영법 (1) | 2026.07.16 |
| SQLite의 오래된 기본값, Rust식 에디션으로 바꿀 수 있을까요 (0) | 2026.07.16 |