[GeekNews 요약] AI 채점, 인간의 규칙을 넘어서: 채점기 버그를 잡은 AI의 활약
3
설명
AI 모델의 성능을 평가하는 과정에서 채점기의 오류를 발견하는 것은 매우 중요합니다. 최근 한 개발자는 AI 채점 시스템을 도입했다가 오히려 자신의 채점기 버그를 AI를 통해 발견하는 흥미로운 경험을 공유했습니다. 이 사례는 AI 검증 과정에서 AI가 어떻게 예상치 못한 방식으로 기여할 수 있는지 보여줍니다.
### 배경 설명
AI 모델, 특히 대규모 언어 모델(LLM)의 성능을 객관적으로 평가하는 것은 매우 어려운 과제입니다. LLM은 방대한 양의 데이터를 학습하여 인간과 유사한 수준의 답변을 생성하지만, 그 과정에서 미묘한 오류나 편향을 포함할 수 있습니다. 이러한 오류를 잡아내기 위해 다양한 검증 방법이 시도되고 있으며, 그중 하나가 AI를 활용한 자동 채점 시스템입니다. Hamel Husain의 'Your AI Product Needs Evals'와 같은 글은 AI 검증의 중요성을 강조하며, 특히 채점 AI 자체의 신뢰성을 확보하는 단계를 필수적으로 제시하고 있습니다. 개발자는 수백 장에 달하는 답안을 사람이 일일이 검토하는 데 한계가 있기에 자동 채점 시스템을 도입하지만, 이 자동 채점 시스템 역시 완벽하지 않으며 오류를 범할 수 있습니다. 따라서 채점 시스템 자체를 검증하는 과정이 필요하며, 이 글의 저자는 바로 이 지점에서 AI를 활용하여 자신의 채점 시스템의 한계를 발견하게 됩니다.
### 1. AI 채점 도입 배경 및 방법
개발자는 AI 모델의 답변을 채점하기 위해 자체 개발한 코드 채점기와 자연어 기반의 AI 채점관(Sonnet 5)을 동시에 사용했습니다. 이는 사람이 직접 답안을 검토하는 데 드는 시간과 노력을 절감하고, 객관성을 확보하기 위한 시도였습니다. 특히, 답안은 Haiku 모델이 생성했으며, 채점자는 응시자보다 더 강력한 모델을 사용하고, 자신의 답안은 채점하지 않는다는 Hamel Husain의 원칙을 따랐습니다. 총 29장의 답안을 두 채점자에게 동일하게 제공하여 판정의 일치도를 비교하는 방식으로 실험을 진행했습니다.
### 2. AI 채점관의 예상치 못한 발견: 채점기 버그
실험 결과, 29장의 답안 중 27장은 두 채점자의 판정이 일치했습니다. 하지만 나머지 2장의 답안에서 두 채점자의 의견이 갈렸습니다. 놀랍게도, 이 두 경우 모두 AI 채점관이 옳았고 개발자의 코드 채점기가 오류를 범하고 있었습니다. 첫 번째 오류는 '페트 300 투명 10박스 뚜껑 흰거 5봉이요'라는 답안에서 발생했습니다. 코드 채점기는 '300용인지 500용인지 확인해 주세요'라는 부분을 '주문을 놓쳤다(누락)'고 판단했지만, AI 채점관은 이를 '확인 요청'으로 보고 사고가 아니라고 판단했습니다. 두 번째 오류는 '아까꺼에 에어캡 2롤 추가요'라는 답안에서 발생했습니다. 코드 채점기는 답안지 여백에 작성된 '참고로 에어캡이 30cm·50cm·100cm 세 종류인데, 어느 건지는 확인이 필요합니다.'라는 메모를 읽지 못해 '무결점'으로 처리했지만, AI 채점관은 이 메모까지 읽고 '정답지에 없는 확인 요청'으로 정확히 분류했습니다. 이는 코드 채점기가 정해진 칸만 읽는 OMR 기계와 같고, AI 채점관은 여백의 낙서까지 보는 사람과 같다는 점을 시사합니다.
### 3. 판정 수정 및 채점기 개선
두 채점자의 판정이 갈렸을 때, 최종 판정은 규칙서의 원래 의도를 가장 잘 이해하고 있는 개발자가 내렸습니다. 이 과정에서 두 건 모두 AI 채점관의 해석이 개발자의 원래 의도와 일치함을 확인했습니다. 이에 따라 개발자는 코드 채점기를 수정했습니다. 잡아서 물어본 항목은 누락이 아닌 무해로 처리하도록 하고, 주문 칸 밖에 적힌 확인 요청도 읽도록 기능을 개선했습니다. 수정된 채점기로 다시 29장의 답안을 채점한 결과, AI 채점관과의 판정 일치율이 100%로 향상되었습니다. 이는 채점기가 개선됨에 따라 과거에 발표했던 모델의 점수까지 변경될 수 있음을 보여주며, 점수는 시험 결과뿐만 아니라 채점기의 함수임을 시사합니다.
### 가치와 인사이트
이 경험은 AI 검증 과정에서 AI가 단순한 도구를 넘어, 개발자의 논리와 시스템의 허점을 발견하는 데 결정적인 역할을 할 수 있음을 보여줍니다. 특히, 코드 채점기와 같이 정해진 규칙만을 따르는 시스템은 예상치 못한 상황이나 미묘한 맥락을 놓칠 수 있습니다. 반면, AI 채점관은 더 넓은 범위의 정보를 해석하고 맥락을 파악하는 능력을 보여주며, 이는 개발자가 놓칠 수 있는 사각지대를 효과적으로 보완합니다. 따라서 AI 모델의 성능을 평가할 때는 단순히 AI의 답변을 채점하는 것을 넘어, 채점 시스템 자체의 신뢰성과 정확성을 검증하는 과정이 필수적이며, 이 과정에서 AI를 활용하는 것은 매우 유효한 전략이 될 수 있습니다. 또한, 점수는 절대적인 수치가 아니라 특정 채점기의 결과임을 명확히 인지하고, 채점기 개선에 따라 과거 점수도 재평가될 수 있다는 점을 이해하는 것이 중요합니다.
### 기술·메타
- AI 모델: Haiku (답안 생성), Sonnet 5 (채점관)
- 채점 방식: 코드 채점기 vs. 자연어 AI 채점관 비교
- 저장소: github.com/ramses203/llm-test-harness
### 향후 전망
AI 모델의 성능 향상과 함께 검증 및 채점 시스템의 중요성은 더욱 커질 것입니다. 앞으로는 더 정교하고 복잡한 AI 채점 시스템이 등장할 것으로 예상됩니다. 이러한 시스템들은 단순히 규칙 기반의 채점을 넘어, 다양한 평가 지표와 맥락을 종합적으로 고려하여 인간과 유사하거나 그 이상의 정확성을 보여줄 수 있을 것입니다. 그러나 AI 채점관의 '블랙박스' 특성으로 인해 판정 과정에 대한 투명성과 설명 가능성을 확보하는 것이 중요한 과제가 될 것입니다. 또한, AI 채점관의 편향성이나 오류 가능성에 대한 지속적인 연구와 개선이 필요하며, 이를 보완하기 위한 인간의 개입과 검증 절차 또한 중요하게 유지될 것입니다. 궁극적으로는 AI와 인간 검증자가 상호 보완적인 관계를 구축하여, AI 모델의 신뢰성과 안전성을 극대화하는 방향으로 발전해 나갈 것으로 전망됩니다.
📝 원문 및 참고
- 원문: [링크 열기](https://velog.io/@ramses203/llm-judge-caught-my-grader-bugs)
- GeekNews 토픽: [보기](https://news.hada.io/topic?id=32597)
---
출처: GeekNews ([원문 링크](https://velog.io/@ramses203/llm-judge-caught-my-grader-bugs))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.