[Techmeme 요약] 오픈AI, 챗GPT 대화 내용 검토 통해 모델 개선…개인정보 유출 가능성 제기
25
설명
오픈AI(OpenAI)가 챗GPT(ChatGPT) 모델 성능 향상을 위해 수백 명의 계약직 직원을 고용해 사용자의 대화 내용을 검토하고 있다는 사실이 드러났습니다. 이 과정에서 민감한 개인 정보가 포함된 대화가 노출될 수 있다는 우려가 제기되었습니다.
이러한 인력 검토는 챗GPT의 응답 품질을 높이는 데 중요한 역할을 하지만, 사용자들은 자신의 대화가 실제 사람에게 읽힐 수 있다는 사실을 인지하지 못하고 있는 것으로 보입니다.
이 보도는 2026년 9월 14일 404 Media의 조셉 콕스(Joseph Cox) 기자가 보도했으며, 오픈AI의 모델 학습 방식과 개인정보 보호에 대한 중요한 질문을 던지고 있습니다.
### 배경 설명
오픈AI는 인공지능(AI) 챗봇인 챗GPT의 성능을 지속적으로 개선하기 위해 다양한 방법을 사용하고 있습니다. 그중 하나가 바로 '프로젝트 릴리(Project Lily)'로 알려진 내부 프로젝트입니다. 이 프로젝트를 통해 오픈AI는 수백 명의 계약직 직원(contractors)을 고용하여 사용자들이 챗GPT와 나눈 실제 대화 내용을 검토하고 평가하도록 합니다.
이 계약직 직원들은 사용자의 질문(prompt)을 읽고, 챗GPT가 생성한 답변을 평가하며, 모델이 더 나은 응답을 하도록 훈련하는 역할을 수행합니다. 예를 들어, 챗GPT가 지나치게 인간적인 반응을 보이거나 과도하게 칭찬하는 것을 방지하기 위해 이러한 검토가 이루어집니다. 이는 챗GPT의 응답을 더 자연스럽고, 유용하며, 덜 과장되게 만들기 위한 노력의 일환입니다.
하지만 이 과정에서 사용자들이 입력한 대화 내용에 민감한 개인 정보가 포함될 수 있다는 점이 문제입니다. 오픈AI는 개인 정보 필터링 모델(Privacy Filter model)을 사용하여 정보를 제거하려 하지만, 완벽하지 않아 일부 민감한 정보가 계약직 직원에게 노출될 가능성이 있습니다. 특히 사용자들이 챗GPT를 개인적인 상담이나 업무 보조 도구로 사용하면서 자신도 모르게 깊은 사생활이나 기밀 정보를 공유할 수 있습니다.
### 챗GPT 대화 내용, 누가 어떻게 검토하나?
오픈AI는 '프로젝트 릴리'라는 이름 아래, 수백 명의 외부 계약직 직원을 고용하여 사용자들이 챗GPT와 나눈 실제 대화 내용을 검토하게 합니다. 이들은 사용자의 질문(prompt)을 읽고, 챗GPT가 생성한 여러 답변을 비교하며 가장 적절하고 유용한 답변을 선택하고 그 이유를 설명합니다. 또한, 챗GPT가 지나치게 인간적인 말투를 사용하거나, 과도하게 칭찬하는 등의 부적절한 응답을 하지 않도록 평가하고 피드백을 제공합니다. 이 과정은 챗GPT의 응답을 더 정확하고, 자연스러우며, 신뢰할 수 있게 만드는 데 목적이 있습니다. 404 Media는 이와 관련된 내부 지침 문서, 슬랙 채널, 실제 사용자 질문 등을 입수하여 보도했습니다.
### 개인정보 노출 위험과 오픈AI의 해명
이러한 인력 검토 과정에서 사용자의 민감한 개인 정보가 노출될 수 있다는 점이 가장 큰 우려 사항입니다. 계약직 직원들은 사용자의 이름과 같은 직접적인 식별 정보는 볼 수 없도록 처리된다고 오픈AI는 밝혔습니다. 또한, 대화 내용이 계약직 직원에게 전달되기 전에 개인 정보 필터링 모델(Privacy Filter model)을 통해 민감한 정보가 제거된다고 설명합니다. 하지만 이 필터링 모델도 완벽하지 않아, 특히 맥락이 제한적이거나 흔하지 않은 개인 식별 정보는 놓칠 수 있다고 오픈AI는 인정했습니다. 404 Media는 오픈AI가 사용자들에게 이러한 인력 검토 사실을 명확히 알렸는지에 대한 질문에 직접적인 답변을 회피했다고 지적했습니다.
### 모델 학습 설정, 기본값은 '활성화'
오픈AI는 챗GPT의 '모든 사용자를 위한 모델 개선(improve the model for everyone)' 설정이 무료, 플러스, 프로 요금제에서 기본적으로 활성화되어 있다고 밝혔습니다. 이는 사용자의 새로운 대화 내용이 모델 학습에 사용될 수 있음을 의미합니다. 사용자가 이 설정을 비활성화하면 자신의 대화 내용이 모델 개선에 사용되지 않습니다. 하지만 이 설정은 이미 진행된 대화에는 소급 적용되지 않습니다. 엔터프라이즈, 비즈니스, 교육용 고객의 경우 이 설정은 기본적으로 비활성화되어 있습니다. 404 Media의 보도 이후 오픈AI는 해당 설정에 대한 도움말 페이지를 업데이트하여 사용자가 옵트아웃(opt-out)하는 방법을 더 자세히 안내했습니다.
### 다른 AI 기업들의 유사한 방식
오픈AI뿐만 아니라 다른 주요 AI 기업들도 모델 성능 향상을 위해 인간의 검토 과정을 활용하고 있습니다. 앤트로픽(Anthropic)은 자체 챗봇인 클로드(Claude)의 응답 개선을 위해 사용자의 대화 내용을 검토하며, 구글(Google) 역시 제미나이(Gemini) 모델의 일부 대화를 인간이 검토하여 개선한다고 명시하고 있습니다. 이러한 방식은 AI 모델이 복잡한 인간의 언어와 의도를 더 잘 이해하고, 안전하며, 유용한 응답을 생성하도록 돕는 데 필수적인 요소로 여겨지고 있습니다.
### 가치와 인사이트
이 보도는 AI 모델이 단순히 방대한 데이터를 학습하는 것을 넘어, 실제 인간의 피드백을 통해 정교화된다는 점을 명확히 보여줍니다. 특히 챗GPT와 같은 대화형 AI는 사용자와의 상호작용을 통해 학습하는데, 이 과정에서 개인정보 보호와 투명성 문제가 중요하게 대두됩니다. 오픈AI의 '프로젝트 릴리'는 AI 발전의 이면에 숨겨진 인간 노동의 중요성을 드러내지만, 동시에 사용자들이 자신의 데이터가 어떻게 활용되는지에 대한 충분한 정보를 얻지 못하고 있다는 점을 시사합니다. 이는 AI 기술 발전과 개인의 프라이버시 권리 사이의 균형점을 찾는 것이 얼마나 어려운 과제인지를 보여줍니다.
### 향후 전망
이번 보도는 향후 AI 서비스 제공업체들에게 더 높은 수준의 투명성과 사용자 동의 절차를 요구하게 될 것입니다. 사용자는 자신의 데이터가 어떻게 수집되고 활용되는지에 대해 더 명확하게 인지하고 통제할 수 있는 권리를 요구할 가능성이 높습니다. 또한, AI 모델 학습 과정에서 인간의 개입이 필수적이라면, 이러한 인간 노동에 대한 윤리적 고려와 공정한 보상 체계에 대한 논의도 더욱 활발해질 것입니다.
정부와 규제 기관은 AI 학습 데이터의 개인정보 보호 및 투명성 확보를 위한 새로운 규제를 마련하거나 기존 규제를 강화할 수 있습니다. 이는 AI 산업 전반에 걸쳐 데이터 처리 방식과 사용자 동의 메커니즘에 대한 근본적인 변화를 가져올 수 있습니다. 궁극적으로, AI 기술의 발전은 기술 자체의 성능뿐만 아니라, 그것이 사회와 개인에게 미치는 영향에 대한 깊이 있는 성찰을 통해 이루어질 것입니다.
📝 원문 및 참고
- Source: Techmeme
- Techmeme 리버: [techmeme.com](https://www.techmeme.com/260914/p26#a260914p26)
- 원문 기사: [링크 열기](https://www.404media.co/inside-project-lily-the-humans-reading-your-chatgpt-chats/)
---
출처: Techmeme ([Original Article](https://www.404media.co/inside-project-lily-the-humans-reading-your-chatgpt-chats/))
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.