본문 바로가기

IT & AI

AGI 벤치마크 우승작, 점수보다 재현성이 먼저였어요

728x90

AGI 벤치마크 우승작, 점수보다 재현성이 먼저였어요

AGI 벤치마크 평가 논란 썸네일
AGI 벤치마크 평가 논란 썸네일

Kaggle과 Google DeepMind가 공동 개최한 AGI 벤치마크 대회에서 수상작의 점수 계산과 재현성을 둘러싼 논란이 나왔어요. 참가자들은 대상 1위 MEDLEY-BENCH의 공개 코드와 결과 해석을 검토한 뒤, 제출작별 점수와 심사 근거를 공개해 달라고 요구했어요. 1

핵심 요약

구분확인된 내용남은 질문
대회1,000개가 넘는 팀이 5개 인지 트랙에 벤치마크를 냈어요수상작 밖 제출물은 어떤 점수를 받았는지 공개되지 않았어요
우승작MEDLEY-BENCH가 모델의 불확실성 인식과 믿음 수정 능력을 평가했어요기본 측정치가 서로 다른 능력을 실제로 분리하는지 논쟁이 남았어요
점수 계산비판 측은 33개 수작업 가중치와 30개 LLM 심사 기준을 지적했어요가중치 근거와 절제 연구를 확인할 자료가 부족해요
재현성공개 화면에서 실행 추적보다 단일 점수를 주로 확인할 수 있어요같은 결과를 다시 계산할 수 있는 중간 산출물이 더 필요해요
심사Kaggle은 약 20명의 인간 심사위원이 복수로 평가했다고 밝혔어요제출작별 점수와 기준별 판단은 공개하지 않았어요

1. AGI 평가 대회가 평가 방식의 시험대에 올랐어요

Kaggle과 Google DeepMind는 ‘Measuring Progress Toward AGI: Cognitive Abilities’ 대회를 열었어요. 암기한 지식을 다시 내놓는 능력보다 추론과 학습, 메타인지, 사회적 판단, 주의력을 측정하는 벤치마크를 찾는 대회였어요. 1,000개가 넘는 팀이 참여했고, 대상 4개에는 각각 25,000달러가 배정됐어요. 2

대상 1위 MEDLEY-BENCH는 사회적 압력 속에서 모델이 자신의 불확실성을 알아차리는지 살펴봐요. 틀린 압력에는 기존의 올바른 믿음을 지키고, 타당한 반증에는 믿음을 고치는지도 측정해요. 정답률 하나로는 보기 어려운 행동을 다룬다는 점에서 문제 설정은 흥미로워요.

728x90

논란은 수상 발표 뒤 공개 자료를 다시 검토하면서 커졌어요. 참가자들은 MEDLEY-BENCH가 내세운 결론과 실제 측정치가 맞지 않는다고 주장했어요. 모델 규모가 커질수록 ‘평가’ 능력만 좋아지고 ‘통제’ 능력은 정체된다는 해석과 달리, 그래프의 두 지표가 비슷하게 움직인다는 반박이에요. 보충 논문에 실린 기본 측정치 사이 상관계수도 ρ=0.79~0.94로 높아, 서로 다른 능력을 분리해 측정했는지 확인이 필요하다는 지적이 나왔어요. 1

수작업 가중치가 결론에 얼마나 영향을 줬는지 알기 어려워요

비판 측의 코드 검토에서는 점수를 조합하는 데 33개 수작업 가중치가 쓰였다고 해요. 각 가중치를 왜 그 값으로 정했는지 보여주는 근거나, 값을 바꿨을 때 결론이 얼마나 달라지는지 확인하는 절제 연구는 공개 자료에서 찾기 어려웠어요. 지표를 여러 단계로 합칠수록 최종 점수는 간단해 보이지만, 어떤 선택이 순위와 결론을 바꿨는지는 더 흐려져요. 1

LLM 심사에는 10개 범주별 3개씩, 모두 30개의 짧은 인지 기준이 쓰였다는 지적도 나왔어요. 낮은 확신을 해당 주장에 대한 반대로 처리하는 논리도 논쟁거리예요. 어떤 주장을 잠정적으로 옳다고 보면서도 확신이 낮을 수 있기 때문이에요. 불확실성과 반대 입장을 같은 값으로 다루면 모델의 믿음 수정 능력을 잘못 읽을 수 있어요.

같은 ID가 서로 다른 주장을 가리키는 데이터 문제도 나왔어요

각 모델이 스스로 1번부터 5번까지 주장을 만들면서 같은 ID가 모델마다 다른 문장을 가리키는 사례가 확인됐다고 해요. 그런데 계산 단계에서는 서로 다른 주장의 신뢰도를 같은 ID로 묶어 중앙값과 다수 입장을 만들었어요. 이후 모델은 자신이 처음 작성한 내용과 다른 집계 의견을 받아 기존 주장을 수정할 수 있어요. 1

이 문제는 단순한 라벨 오타로 끝나지 않아요. 평가 대상이 중간에 바뀌면 최종 점수가 무엇을 측정했는지 설명하기 어려워져요. 점수 산식이 실행돼도 의미가 같은 실험을 재현했다고 보기 힘들어요. 코드 실행 가능성과 측정 타당성을 따로 확인해야 하는 이유예요.

참가자들은 리더보드와 기준별 점수를 요청했어요

공개된 Kaggle 벤치마크 화면에서는 실행 과정과 중간 결과보다 단일 점수를 주로 확인할 수 있어요. MEDLEY-BENCH의 재현 문서는 저장소에 없는 결과 폴더를 가리킨다는 지적도 나왔어요. 다른 대상 수상작도 개별 사례를 검증하는 데 시간이 오래 걸리거나 전체 실행 추적을 보기 어렵다는 의견이 이어졌어요. 1

참가자들이 요구한 자료는 전체 제출작의 점수 리더보드, 수상작의 기준별 점수, 심사에서 중요하게 본 요소, 동점 처리와 기술적 실격 기준이에요. 이 자료가 있어야 우승작의 약점을 지적하는 데서 그치지 않고 다른 제출물과 같은 기준으로 비교할 수 있어요.

Kaggle은 양측 조직에서 약 20명의 인간 심사위원이 참여했다고 답했어요. 모든 수상작을 최소 2명이 검토했고 일부는 3~4명이 독립적으로 채점했다고 설명했어요. 심사 기간도 당초 1.5개월에서 3개월로 늘렸다고 밝혔어요. 다만 참가자들이 요청한 제출작별 점수와 상세 선정 과정은 이 답변에 포함되지 않았어요. 2

왜 중요한가요

AI 벤치마크는 모델 순위를 만드는 표보다 측정 도구에 가까워요. 이름이 다른 능력을 각각 측정한다고 주장하려면 지표가 실제로 분리되는지 보여줘야 해요. 가중치와 LLM 심사 기준이 들어간다면 각 선택의 근거와 결과 민감도도 함께 공개해야 해요. 이번 논란은 높은 점수보다 그 점수가 만들어진 경로를 확인할 수 있어야 한다는 요구를 보여줘요. 1

평가를 제품 선택이나 연구 방향에 쓰는 팀도 최종 순위만 보면 안 돼요. 원시 응답, 채점 기준, 중간 산출물, 실패 사례, 재실행 방법을 함께 살펴야 해요. 특히 여러 지표를 하나로 합친 점수는 가중치를 조금만 바꿔도 순위가 달라질 수 있어요. 단일 점수 뒤의 산식과 데이터 계보를 확인해야 모델 비교가 실제 의사결정에 도움이 돼요.

주최 측 설명대로 복수의 인간 심사위원이 참여했더라도 투명성 요구는 남아요. 사람이 심사했다는 사실은 점수 산출의 재현성과 제출물 간 비교 근거를 대신하지 못해요. 기준별 점수와 최소한의 피드백을 공개하면 참가자는 자신의 약점을 고칠 수 있고, 주최 측도 수상 결과에 대한 신뢰를 지킬 수 있어요. 2

참고 자료

  1. AGI 평가 과정과 수상자 선정에서 드러난 불일치 — GeekNews
  2. Announcing the Measuring Progress Toward AGI: Cognitive Abilities Hackathon Winners — Kaggle
728x90