[GeekNews 요약] 넷플릭스, LLM 기반 추천 시스템 GenRec 공개: 개인화 추천의 새로운 지평
1
설명
넷플릭스는 LLM(거대 언어 모델)을 활용한 새로운 추천 시스템 'GenRec'을 공개하며 개인화 추천의 패러다임을 전환하고 있습니다. 기존의 복잡하고 수작업으로 설계된 추천 모델에서 벗어나, LLM의 강력한 언어 이해 및 생성 능력을 기반으로 사용자 경험을 혁신하려는 시도입니다.
GenRec은 2026년 7월에 발표된 넷플릭스 기술 블로그의 내용을 바탕으로 하며, LLM 네이티브 추천 시스템 구축을 향한 넷플릭스의 전략적 방향을 제시합니다.
이 시스템은 LLM의 잠재력을 극대화하여 기존 모델 대비 효율성과 성능을 동시에 향상시키는 것을 목표로 합니다.
### 배경 설명
넷플릭스의 추천 시스템은 사용자 경험의 핵심이며, 수년간 수천 개의 수작업 특징(feature)과 전문화된 아키텍처를 통해 발전해왔습니다. 영화, 시리즈, 게임, 라이브 콘텐츠 등 다양한 콘텐츠 유형과 여러 서비스 표면을 지원하기 위해 복잡성이 증가했지만, 이는 새로운 사용 사례를 통합하는 데 상당한 비용과 노력을 요구했습니다.
최근 PLUM, GLIDE, OneRec-Think와 같은 연구에서 보듯, LLM은 추천 시스템 분야에 큰 변화를 가져오고 있습니다. LLM은 방대한 세계 지식과 뛰어난 언어 이해 능력을 바탕으로 사용자 기록과 아이템 메타데이터를 텍스트로 직접 표현하고, 자연어 프롬프트를 통해 추천을 제어할 수 있는 가능성을 열었습니다. 그러나 기존 LLM은 과도하게 인기 있는 콘텐츠를 추천하거나, 카탈로그에 없는 항목을 생성(hallucination)하거나, 비즈니스 제약을 무시하는 등 실제 서비스 환경에 바로 적용하기에는 한계가 있었습니다.
이러한 배경 속에서 넷플릭스는 자체 개발한 내부 파운데이션 LLM을 넷플릭스 데이터와 목표에 맞게 추가 학습시킨 'GenRec'을 개발했습니다. GenRec은 LLM 기반 랭커가 성숙한 기존 프로덕션 시스템과 동등하거나 그 이상의 성능을 보이면서도 훨씬 적은 수의 레이블링된 예제와 입력 신호만으로도 가능하다는 것을 보여줍니다. 이는 2026년 7월에 발표된 넷플릭스 기술 블로그의 핵심 내용입니다.
### 1. GenRec의 작동 방식 및 목표
GenRec은 사용자 기록, 아이템 메타데이터, 현재 컨텍스트를 자연어 텍스트로 변환하는 '구체화(Verbalization)' 과정을 거칩니다. 이후 넷플릭스에 맞게 조정된 파운데이션 LLM을 랭킹 작업에 맞게 추가 학습시키고, 넷플릭스 카탈로그 내 아이템에 대한 점수를 매기는 '카탈로그 인식 스코어링 헤드'를 추가합니다. 또한, 장기적인 회원 가치와 비즈니스 목표에 부합하도록 '보상 신호(Reward Signals)'를 활용하여 모델을 정렬합니다. 최종적으로는 효율적인 비용으로 넷플릭스의 LLM 서빙 스택에서 '프리필(Prefill)-온리 모드'로 실행됩니다. 이는 대규모 A/B 테스트에서 기존 프로덕션 랭커 대비 단기 및 장기 온라인 지표에서 통계적으로 유의미한 개선을 달성했으며, 적은 양의 레이블링 데이터와 입력 신호만으로도 높은 성능을 보였습니다. 이러한 접근 방식은 수작업 특징 공학(Feature Engineering)에 대한 의존도를 줄이고, '컨텍스트 공학(Context Engineering)'으로 초점을 전환합니다.
### 2. GenRec의 두 단계 학습 프레임워크
GenRec은 두 단계의 학습 프레임워크를 따릅니다. 첫 번째 단계인 '넷플릭스 맞춤형 파운데이션 LLM'에서는 오픈소스 LLM을 기반으로 넷플릭스 고유 데이터를 학습시켜, 넷플릭스 콘텐츠 이해, 회원 행동 및 선호 패턴, 일반 언어 이해 및 생성 능력을 갖춘 파운데이션 모델을 구축합니다. 이 단계는 비교적 드물게 업데이트되며 여러 애플리케이션의 공유 백본 역할을 합니다.
두 번째 단계인 'GenRec'에서는 이 파운데이션 모델을 랭킹 품질에 특화된 데이터와 목표를 사용하여 추가 학습(post-training)시킵니다. 이 단계는 랭킹 품질 향상에 집중하며, 보상 가중치 손실(Reward-Weighted Losses)을 통해 여러 보상 신호를 통합합니다. 또한, 새로운 콘텐츠와 변화하는 취향을 반영하기 위해 더 자주 업데이트되며, 서빙 비용 제약 하에서 명시적으로 최적화됩니다. 이 두 단계의 접근 방식은 LLM의 일반적인 능력과 추천 시스템의 특정 요구사항을 효과적으로 결합합니다.
### 3. 데이터, 모델, 컨텍스트 최적화 및 LLM 네이티브 추천으로의 전환
GenRec의 성능 향상은 데이터 및 모델 스케일링, 그리고 넷플릭스 맞춤형 파운데이션 모델 사용에서 비롯됩니다. 약 10억에서 100억 개의 파라미터를 가진 백본 모델에서 Phase-2 추가 학습 데이터가 증가함에 따라 오프라인 MRR(Mean Reciprocal Rank)이 향상되었으며, 더 큰 모델이 더 높은 절대 MRR을 달성했습니다. 또한, Phase-1 넷플릭스 맞춤형 파운데이션 LLM을 사용하면 오프라인 랭킹 지표가 약 10-20% 향상되었고, Phase-2 추가 학습은 약 35-50%의 추가적인 이득을 가져왔습니다.
컨텍스트 길이 최적화는 품질과 비용 사이의 균형을 맞추는 데 중요했습니다. 낮은 신호의 상호작용을 제거하고 반복적인 행동을 압축하는 등 컨텍스트 엔지니어링을 통해 토큰 수를 약 1/3로 줄이면서도 오프라인 랭킹 지표의 저하를 최소화하여 서빙 비용을 절감했습니다. 이러한 변화는 '특징 공학에서 컨텍스트 공학으로', '맞춤형 아키텍처에서 파운데이션 백본으로', '확장 법칙을 설계 지침으로', 'RecSys 인프라에서 LLM 인프라로'의 전환을 의미하며, 넷플릭스 추천 시스템이 LLM 네이티브 방식으로 진화하고 있음을 시사합니다.
### 가치와 인사이트
GenRec의 등장은 추천 시스템 분야에서 LLM의 실질적인 가치를 입증하는 중요한 사례입니다. 기존의 복잡한 특징 공학 및 맞춤형 아키텍처 중심의 접근 방식에서 벗어나, LLM의 강력한 언어 이해 능력을 활용하여 사용자 행동과 콘텐츠 메타데이터를 풍부한 텍스트 컨텍스트로 변환하는 '컨텍스트 공학'으로의 전환은 실무자들에게 새로운 방향을 제시합니다. 이는 모델 개발 및 유지보수 비용을 절감하는 동시에, 더 적은 데이터로도 높은 성능을 달성할 수 있음을 보여주며, 특히 새로운 콘텐츠나 사용자 취향 변화에 대한 빠른 적응력을 갖추게 합니다.
또한, GenRec은 '보상 가중치 손실'과 같은 기법을 통해 단순히 단기적인 참여율을 넘어 장기적인 회원 만족도와 비즈니스 목표를 고려한 추천이 가능하다는 점을 보여줍니다. 이는 추천 시스템이 비즈니스 성과와 직접적으로 연결될 수 있음을 시사하며, 실무에서 추천 모델 설계 시 고려해야 할 중요한 요소입니다. LLM 기반 추천 시스템은 향후 개인화 추천의 복잡성을 줄이고, 사용자 경험을 더욱 풍부하게 만드는 데 핵심적인 역할을 할 것으로 기대됩니다.
### 기술·메타
- **모델 아키텍처**: Decoder-only Transformer 기반 LLM, 카탈로그 인식 스코어링 헤드
- **서빙 스택**: vLLM 기반 넷플릭스 내부 LLM 서빙 스택
- **추론 모드**: Prefill-only inference
- **학습 데이터**: 사용자 기록, 아이템 메타데이터, 컨텍스트를 텍스트로 변환 (Conversational format)
- **주요 기술**: LLM (Large Language Models), GenAI (Generative AI), Recommendation System
- **발표 시점**: 2026년 7월 (Netflix Technology Blog)
### 향후 전망
GenRec의 성공은 넷플릭스가 LLM을 추천 시스템의 핵심으로 삼는 'LLM 네이티브 추천' 시대로 나아가고 있음을 명확히 보여줍니다. 향후 넷플릭스는 GenRec의 파운데이션 LLM을 더욱 발전시키고, 다양한 추천 시나리오에 적용하며, LLM의 자연어 이해 능력을 활용한 추천 설명 생성 등 새로운 기능들을 탐구할 가능성이 높습니다.
경쟁 구도 측면에서는, 다른 스트리밍 서비스 및 기술 기업들도 LLM 기반 추천 시스템 개발에 박차를 가할 것으로 예상됩니다. 이는 LLM 기술의 발전과 함께 추천 시스템 분야의 경쟁을 더욱 심화시킬 것입니다. 또한, LLM의 발전 속도와 함께 추천 시스템의 성능 또한 지속적으로 향상될 것이며, 사용자들은 더욱 정교하고 개인화된 추천 경험을 기대할 수 있게 될 것입니다.
다만, LLM 기반 시스템은 여전히 비용 효율성, 모델의 편향성, 그리고 잠재적인 '환각(hallucination)' 문제와 같은 리스크를 안고 있습니다. 넷플릭스는 GenRec의 '프리필-온리 모드'와 같은 비용 최적화 전략을 지속적으로 발전시키고, 보상 모델링을 통해 모델의 정렬을 강화하는 노력을 병행해야 할 것입니다. 이러한 과제들을 성공적으로 해결한다면, GenRec은 넷플릭스의 추천 시스템을 한 단계 더 발전시키는 중요한 이정표가 될 것입니다.
📝 원문 및 참고
- 원문: [링크 열기](https://netflixtechblog.com/genrec-towards-llm-native-recommendation-at-netflix-f20be6f643e3)
- GeekNews 토픽: [보기](https://news.hada.io/topic?id=32010)
---
출처: GeekNews ([원문 링크](https://netflixtechblog.com/genrec-towards-llm-native-recommendation-at-netflix-f20be6f643e3))
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.