[Hacker News 요약] arXiv 논문 12,750건 분석: AI 작성 글 비율, ChatGPT 출시 후 급증
4
설명
2023년 1월부터 2026년 7월까지 arXiv에 제출된 12,750건의 논문을 분석한 결과, 약 3분의 1이 기계 작성으로 판독되었습니다.
이 연구는 ChatGPT 출시 이후 AI가 작성한 논문의 비율이 어떻게 변화하는지 측정했으며, 특히 컴퓨터 과학 분야에서 이러한 경향이 두드러졌습니다.
하지만 분석 방법론의 한계점과 특정 분야에서의 낮은 판독률에 대한 해석도 함께 제시되었습니다.
### 배경 설명
생성형 AI, 특히 대규모 언어 모델(LLM)의 발전은 학술 연구 분야에도 지대한 영향을 미치고 있습니다. 2022년 말 ChatGPT의 등장 이후, 연구자들이 AI를 활용하여 논문을 작성하거나 편집하는 사례가 급증할 것으로 예상되었습니다. 이에 따라 학술 논문의 진위성을 판별하고 AI가 작성한 콘텐츠의 확산을 측정하는 기술의 중요성이 부각되었습니다. arXiv는 물리학, 수학, 컴퓨터 과학 등 다양한 과학 분야의 사전 인쇄본을 공유하는 대표적인 플랫폼으로, 이곳에 제출되는 논문의 양과 다양성은 AI 글쓰기 확산 추세를 파악하는 데 중요한 지표가 됩니다. 본 연구는 이러한 배경 속에서 arXiv 논문에 대한 AI 작성 비율을 객관적으로 측정하고, 그 결과를 분석하여 학계 및 연구 커뮤니티에 시사점을 제공하고자 합니다.
### 측정 방법론: 오탐률 0.4% 기반의 탐지기
연구팀은 AI 작성 텍스트 탐지기의 오탐률(false-positive rate)을 0.4%로 설정하여 연구를 진행했습니다. 이는 ChatGPT 이전 시기(2021-2022년)의 논문 중 0.4%만이 기계 작성으로 판독되도록 탐지기의 임계값을 조정했음을 의미합니다. 이 임계값은 실제 인간이 작성한 논문이 오탐될 확률을 최소화하면서 AI 작성 텍스트를 효과적으로 식별하기 위한 기준이 됩니다. 총 12,750건의 논문을 대상으로 분석했으며, 각 논문의 PDF 버전 1을 사용하고 초록이 아닌 본문 전체 텍스트를 분석 대상으로 삼았습니다. 이는 초록만으로는 AI 작성 신호를 제대로 파악하기 어렵다는 경험적 사실에 기반합니다. 각 분야별로 2023년 1월부터 2026년 7월까지의 논문을 샘플링했으며, 2021년과 2022년의 논문은 AI 글쓰기 확산 이전의 기준선(baseline)으로 활용되었습니다. 모든 수치에는 95% 부트스트랩 신뢰 구간이 포함되어 결과의 통계적 신뢰도를 높였습니다.
### 주요 결과: AI 작성 논문 비율의 급증
분석 결과, ChatGPT 출시 이후 arXiv 논문에서 AI가 작성된 것으로 판독되는 비율이 눈에 띄게 증가했습니다. 2021년과 2022년에는 AI 작성 비율이 0.4% 수준으로 매우 낮았으나, 2023년 초부터 급격히 상승하기 시작하여 2026년 가장 최근 분기에는 약 32%에 달했습니다. 분야별 편차도 컸는데, 컴퓨터 과학 분야가 약 65.0%로 가장 높은 AI 작성 비율을 보였습니다. 뒤이어 양적 생물학(56.3%), 전기 공학 및 시스템(51.3%), 경제 및 금융(47.0%) 순으로 높은 비율을 기록했습니다. 반면, 수학 분야는 약 0.7%로 가장 낮은 비율을 나타냈는데, 이는 수학 논문의 특성상 기호와 수식이 많고 문장이 간결하여 탐지기가 학습한 일반적인 과학 영어와 다르기 때문일 수 있다고 연구팀은 설명합니다. 이러한 결과는 AI 글쓰기 도구가 학술 연구 생산성에 미치는 영향이 상당하며, 특히 특정 분야에서 그 확산 속도가 빠르다는 것을 시사합니다.
### 한계점: 통제 표본 크기 및 탐지기 민감도
본 연구는 몇 가지 한계점을 가지고 있습니다. 첫째, 각 분야별 사전 LLM(Large Language Model) 통제 표본의 크기가 200건으로 작다는 점입니다. 0.4%의 낮은 오탐률을 고려할 때, 각 분야별로 유의미한 통제 수준을 설정하기에는 표본 수가 부족할 수 있습니다. 이는 분야별 통제 수준이 근사치에 불과하며, 더 정확한 분석을 위해서는 각 분야별로 수천 건의 통제 논문이 필요함을 시사합니다. 둘째, 수학 분야와 같이 탐지기의 민감도가 낮을 수 있는 분야가 존재합니다. 수학 논문은 기호, 수식, 정리 및 증명 구조가 주를 이루며, AI의 도움을 받아 작성된 논문이라도 탐지기가 학습한 일반적인 과학 영어와 다른 특성을 보일 경우 낮은 점수를 받을 수 있습니다. 따라서 수학 분야의 낮은 판독률은 AI 채택률이 낮다는 것인지, 아니면 탐지기의 성능 한계 때문인지 명확히 구분하기 어렵습니다. 셋째, 탐지기가 모든 AI 생성 모델 및 프롬프트 조합에 대해 동일한 성능을 발휘하지 못할 수 있습니다. 특정 생성기에는 더 민감하고 다른 생성기에는 덜 민감할 수 있으며, 이는 보고된 비율이 실제보다 낮을 수 있음을 의미합니다. 즉, 보고된 수치는 AI 작성 논문 비율의 하한선으로 해석해야 합니다.
### 가치와 인사이트
본 연구는 2026년까지 arXiv에 제출된 논문을 대상으로 AI 작성 비율을 객관적으로 측정하고 분석했다는 점에서 학술 연구 분야의 AI 활용 현황을 파악하는 데 중요한 가치를 지닙니다. 특히 ChatGPT 출시 이후 AI 글쓰기 도구의 확산이 학술 논문 작성에 미치는 영향을 구체적인 수치로 제시하며, 컴퓨터 과학 분야에서 그 영향력이 가장 크다는 점을 명확히 했습니다. 또한, 탐지기의 오탐률을 엄격하게 관리하고 사전 LLM 시기를 통제군으로 설정하여 결과의 신뢰도를 높였습니다. 이러한 결과는 학술 출판사, 연구 기관, 그리고 연구자들에게 AI 글쓰기 도구의 윤리적 사용, 표절 방지, 그리고 논문 심사 과정에서의 새로운 과제에 대한 경각심을 일깨워줍니다. 특히, 수학 분야와 같이 특정 분야에서 낮은 판독률이 나타나는 한계점을 명확히 제시함으로써, AI 탐지 기술의 발전 방향과 함께 다양한 학문 분야의 특성을 고려한 접근 방식의 필요성을 시사합니다. 연구자들은 본 연구 결과를 바탕으로 AI를 보조 도구로 활용하되, 결과물의 진위성과 독창성을 확보하기 위한 노력을 강화해야 할 것입니다.
### 기술·메타
- 탐지기: unslop
- 분석 대상: arXiv 논문 (PDF 버전 1)
- 분석 기간: 2021년 1월 - 2026년 7월
- 샘플 수: 12,750건
- 오탐률(False-positive rate): 0.4%
- 신뢰 구간: 95% 부트스트랩
### 향후 전망
AI 글쓰기 도구의 발전은 앞으로도 가속화될 것이며, 이는 학술 연구 분야에 지속적인 영향을 미칠 것입니다. 향후에는 더욱 정교하고 다양한 AI 모델들이 등장하여 논문 작성 및 편집 과정에 활용될 가능성이 높습니다. 이에 따라 AI 작성 텍스트를 탐지하는 기술 역시 끊임없이 발전해야 할 것입니다. 연구팀이 개발한 탐지기는 현재 널리 사용되는 AI 모델에 대한 성능을 기반으로 하지만, 미래의 새로운 모델이나 미묘하게 편집된 텍스트를 탐지하는 데는 한계가 있을 수 있습니다. 따라서 AI 탐지 기술은 특정 모델에 국한되지 않고, 텍스트의 통계적 특성, 문체, 논리 구조 등 다양한 측면을 종합적으로 분석하는 방향으로 진화할 필요가 있습니다. 또한, 학술 커뮤니티는 AI 글쓰기 도구의 윤리적 사용에 대한 명확한 가이드라인을 마련하고, 연구 부정 행위를 방지하기 위한 제도적 장치를 강화해야 할 것입니다. AI 탐지 기술의 발전과 함께 학술 윤리 규범의 정립이 병행될 때, AI가 학술 연구의 발전에 긍정적으로 기여하는 방향으로 나아갈 수 있을 것입니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=48981206)
- 원문: [링크 열기](https://unslop.run/blog/measuring-ai-writing-on-arxiv)
---
출처: Hacker News · [원문 링크](https://unslop.run/blog/measuring-ai-writing-on-arxiv)
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠


댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.