67센트짜리 소형 Transformer가 ARC-AGI-1에서 44%를 기록했어요

거대한 언어 모델을 호출하지 않고도 ARC 퍼즐에서 꽤 높은 점수를 낸 실험이 공개됐어요. 연구자는 RTX 5090 한 장으로 소형 Transformer를 처음부터 1.5시간 학습했고, ARC-AGI-1 공개 평가에서 44%를 기록했다고 밝혔어요. 계산한 비용은 67센트예요. 1
핵심 요약
| 구분 | 핵심 | 왜 볼 만한가요 |
| 성능 | ARC-AGI-1 44%, ARC-AGI-2 7%를 기록했어요 | 큰 범용 LLM 없이 작은 모델과 제한된 데이터로 얻은 결과예요 |
| 비용 | RTX 5090 한 장에서 학습과 추론을 1.5시간 안에 끝냈어요 | 실험 주기가 짧아 개인 연구자도 구조를 바꿔가며 반복해 볼 수 있어요 |
| 설계 | 과제별 임베딩과 3D RoPE가 성능에 크게 기여했어요 | 둘 중 하나를 빼면 ARC-AGI-1 점수가 약 24%로 내려갔어요 |
| 주의점 | 비교 범위는 비슷한 테스트 시점 학습 방식을 쓴 모델이에요 | 범용 LLM 전체를 같은 조건에서 재평가한 결과로 읽으면 안 돼요 |
1. 작은 Transformer가 ARC 퍼즐을 푸는 방식
ARC-AGI는 몇 개의 입력·출력 격자 예시를 보고, 새로운 격자에 적용할 규칙을 찾아야 하는 벤치마크예요. 이 모델은 격자 한 칸씩을 토큰으로 바꾸고, 여러 퍼즐을 하나의 자기회귀 학습 문제로 묶어요. 퍼즐마다 별도의 학습 가능한 임베딩을 더해 어떤 과제를 풀고 있는지 구분해요. 두 개의 2차원 격자 위치는 3D RoPE로 표현해요. 2
색상 순열과 회전·반사 변환도 사용해요. 추론할 때는 입력 격자에 같은 변환을 적용한 뒤 결과를 원래 방향으로 돌려놔요. 여러 후보 가운데 가장 자주 나온 2개를 답으로 제출해요. 모델 구조에는 8개 계층, SwiGLU, RMSNorm, 가변 길이 FlashAttention이 들어갔어요. 옵티마이저는 AdamW 대신 NorMuon 중심 구성으로 바꿨어요.
이번 버전에서 눈에 띄는 선택은 손실을 출력 토큰에만 적용한 부분이에요. 입력 토큰까지 학습한 설정은 약 39%였지만, 출력만 학습하자 44%까지 올랐어요. 연구자도 왜 이 차이가 생겼는지는 아직 설명하지 못했어요. 제한된 모델 용량이 한 원인일 수 있다고 적었어요. 검증 손실은 오히려 나빠졌는데 실제 퍼즐 점수와 실행 안정성은 좋아졌다는 점도 흥미로워요. 작은 데이터셋에서는 가장 낮은 검증 손실이 최종 과제 점수와 바로 이어지지 않을 수 있어요. 2
절제 실험이 보여준 부분
3D RoPE를 일반 1D RoPE로 바꾸면 점수가 약 24%로 떨어졌어요. 과제별 임베딩을 제거했을 때도 약 24%였어요. 반면 ARC-AGI-2에서 겹치지 않는 퍼즐을 제외해도 약 40%를 냈어요. 추가 데이터는 점수보다 계산량을 줄이는 데 더 크게 작용한 셈이에요.
코드는 mdlARC 저장소에 공개돼 있어요. 학습 설정과 모델 구현을 직접 확인하거나 비용과 점수의 균형을 바꿔 볼 수 있어요. 3
점수를 읽을 때 확인할 조건
44%는 ARC-AGI-1 공개 평가 점수예요. 연구자가 올린 비교 그림도 비슷한 테스트 시점 학습 방식을 쓰는 모델로 범위를 좁혔어요. 모든 상용 LLM을 동일한 예산과 평가 절차로 다시 측정한 표는 아니에요.
평가 퍼즐의 예제 쌍과 입력은 학습에 사용하지만 숨겨진 정답 출력은 사용하지 않아요. 연구자는 이를 정답 유출이 아니라 전이적 추론을 포함한 메타학습 절차로 설명해요. ARC-AGI-2 데이터를 더할 때도 ARC-AGI-1과 겹치는 773개 퍼즐을 제거했다고 밝혔어요. 결과를 재현할 때는 이 중복 제거와 공개 평가 조건을 함께 맞춰야 해요. 2
왜 중요한가요
이 결과의 실용적인 장점은 44%라는 숫자보다 실험 비용에 있어요. 한 번의 학습과 추론이 1.5시간 안에 끝나면 위치 표현, 옵티마이저, 증강 방식을 바꾼 절제 실험을 빠르게 반복할 수 있어요. 대형 모델 API 비용이나 대규모 GPU 클러스터 없이도 연구 가설을 확인할 여지가 생겨요. 3
성능을 만든 요소도 비교적 구체적이에요. 과제별 임베딩과 3D RoPE를 제거했을 때 점수가 각각 약 20%포인트 내려갔어요. 모델 크기를 키운 사실만으로 결과를 설명하기 어렵다는 뜻이에요. 격자 구조와 과제 구분을 모델에 어떻게 전달했는지가 더 직접적인 차이를 만들었어요.
그래도 67센트와 44%만 떼어내 범용 AI 성능으로 받아들이면 곤란해요. 비용 계산에는 사용한 하드웨어와 전력·대여 조건이 영향을 줘요. ARC 공개 평가 한 종류에서 얻은 결과이기도 해요. 공개 코드를 같은 조건으로 재실행하고, 여러 시드의 분산과 실제 비용을 함께 확인해야 비교가 선명해져요. 2
참고 자료
- 67센트로 1.5시간 학습한 소형 Transformer, ARC-AGI-1에서 여러 LLM을 앞서다 — GeekNews
- 44% on ARC-AGI-1 in 67 cents — Mithil Vakde
- mdlARC — GitHub
'IT & AI' 카테고리의 다른 글
| Uber는 PR 70% 이상을 AI로 처리하며 비용을 어떻게 줄였나 (0) | 2026.09.02 |
|---|---|
| AI 코딩이 빨라질수록 개발자의 반복 경험은 더 중요해져요 (0) | 2026.09.02 |
| Darling이 다시 움직여요, Linux에서 macOS 도구를 실행하는 호환 계층 (0) | 2026.09.02 |
| Grok Bot 팀은 200개 넘는 코딩 작업을 어떻게 관리할까요 (0) | 2026.09.02 |
| AI 시대 데이터 스택, 답보다 회사의 기준을 설계해요 (0) | 2026.09.02 |