본문 바로가기

IT & AI

AI 코드 리뷰, 결정은 빨라져도 품질은 따라오지 않았어요

728x90

AI 코드 리뷰, 결정은 빨라져도 품질은 따라오지 않았어요

AI 뉴스 썸네일
AI 뉴스 썸네일

AI 리뷰어가 먼저 코드를 훑으면 리뷰 결론까지 걸리는 시간은 줄어들 수 있어요. 하지만 207개 GitHub 프로젝트의 풀 리퀘스트 102만 건을 분석한 연구에서는 빠른 결정이 더 나은 리뷰로 이어지지 않았어요. 1

핵심 요약

구분핵심왜 볼 만한가요
조사 범위2022년 5월부터 2026년 2월까지 207개 오픈소스 프로젝트의 리뷰 완료 PR 102만 건을 분석했어요소수 팀의 사용 후기가 아니라 여러 프로젝트의 장기 변화를 비교했어요
리뷰 속도AI를 점진적으로 도입했거나 에이전트 단계에서 빠르게 확대한 프로젝트는 결정 시간이 줄었어요도구 자체보다 도입 순서와 협업 방식이 속도에 영향을 줬어요
리뷰 품질AI가 참여한 리뷰에서 반복적인 리뷰어 배정과 큰 변경 묶음 같은 안티패턴이 더 자주 나타났어요처리 시간만으로 리뷰 자동화의 성과를 판단하면 품질 위험을 놓칠 수 있어요
연구 한계품질은 실제 결함률이 아니라 리뷰 안티패턴으로 측정했어요AI 도입이 결과의 직접 원인이라고 단정할 수 없는 관찰 연구예요

1. AI 코드 리뷰는 어디서 빨라지고 어디서 막혔나요

연구진은 코드 리뷰 과정을 인간 중심, 초기 LLM 보조, 저장소 탐색과 도구 실행이 가능한 AI 에이전트 참여의 세 시기로 나눴어요. 프로젝트별 도입 방식도 점진적 도입 46%, 초기 LLM 집중 도입 22%, 에이전트 집중 도입 32%로 구분했어요. 2

속도 차이는 AI 리뷰어의 사용량만으로 설명되지 않았어요. 점진적 도입 그룹과 에이전트 집중 도입 그룹에서는 에이전트가 먼저 변경 내용을 확인하거나 여러 에이전트가 참여한 리뷰가 사람만 참여한 리뷰보다 빨리 끝났어요. 해당 협업 패턴의 75~95%는 AI가 변경을 검사하고 요약한 뒤 사람이 판단하는 순서였어요.

728x90

초기 LLM 단계부터 대부분의 PR에 AI 리뷰어를 붙인 그룹은 달랐어요. LLM 시기와 에이전트 시기 모두 뚜렷한 속도 개선이 나타나지 않았어요. 같은 AI 리뷰어 계정에 반복적으로 의존하면서 리뷰 관점이 좁아진 점이 한 원인 후보로 제시됐어요.

속도가 줄어든 그룹에서도 품질 지표는 함께 좋아지지 않았어요. 사람만 참여한 리뷰의 안티패턴 비율은 69~76%였고, AI가 참여한 협업 패턴은 78~94%였어요. 특히 같은 리뷰어 조합에 반복적으로 의존하는 패턴은 사람만 참여했을 때 약 16%였지만 LLM 참여 리뷰에서는 평균 약 60%, 에이전트 참여 리뷰에서는 평균 약 53%로 집계됐어요. 2

이 수치는 AI 리뷰가 실제 결함을 더 많이 만들었다는 뜻은 아니에요. 연구진은 장애나 결함 발생률 대신 반복 리뷰어 배정, 오래 멈춘 리뷰, 지나치게 큰 변경 묶음이라는 세 가지 안티패턴을 품질의 대리 지표로 사용했어요. 관찰된 연관성만으로 AI 도입이 속도나 품질 변화를 직접 일으켰다고 볼 수도 없어요.

왜 중요한가요

개발팀이 AI 코드 리뷰를 평가할 때 평균 처리 시간 하나만 보면 도입 효과를 잘못 읽을 수 있어요. 변경 종류와 크기, 작성자의 프로젝트 경험, 논의량에 따라 필요한 검토 수준이 달라져요. 연구 결과에서도 커밋과 논의가 많은 PR은 AI 참여 여부와 관계없이 멈출 가능성이 컸어요. 2

가벼운 유지보수에는 자동 검사와 요약을 먼저 붙이고, 저장소 맥락을 확인해야 하는 변경에는 탐색 가능한 에이전트를 배치하는 방식이 더 현실적이에요. 큰 기능 변경이나 위험도가 높은 코드는 사람이 리뷰를 이끌고 AI 결과를 보조 자료로 쓰는 편이 안전해요. 같은 AI 리뷰어를 모든 PR에 고정하면 관점이 한쪽으로 쏠릴 수 있으므로 인간 리뷰어 구성과 배정 규칙도 함께 관리해야 해요.

성과 지표도 나눠서 봐야 해요. 첫 응답 시간과 최종 결정 시간 외에 재작업 횟수, 리뷰에서 발견한 결함, 배포 뒤 장애, 변경 크기, 반복 리뷰어 비율을 함께 기록하면 속도 개선이 품질 저하를 가리고 있는지 확인할 수 있어요. 이번 연구는 AI 리뷰어를 많이 붙이는 것보다 어떤 변경에 누구를 언제 참여시키는지가 더 중요하다는 근거를 보여줘요.

참고 자료

  1. 인간 중심에서 에이전틱 코드 리뷰로 - 더 빠른 결정이 더 나은 리뷰를 뜻하지는 않는다 — GeekNews
  2. From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality — arXiv
728x90