[Lobsters 요약] LLM을 단순한 다음 토큰 예측기로 보는 관점의 한계
190
설명
대규모 언어 모델(LLM)이 단순히 다음 토큰을 예측하는 존재라는 설명은 기술적으로는 틀리지 않으나, 그 본질을 완전히 담아내지 못합니다.
LLM의 학습 과정은 사전 훈련과 후속 훈련(post-training)으로 나뉘며, 특히 강화학습 기반의 후속 훈련은 모델의 행동 양식을 근본적으로 변화시킵니다.
이는 LLM이 기존 데이터에 없는 새로운 시퀀스를 탐색하고 학습하는 능력을 부여하며, 단순 예측 모델 이상의 가치를 지닙니다.
### 배경 설명
대규모 언어 모델(LLM)은 최근 몇 년간 인공지능 분야에서 가장 주목받는 기술 중 하나로 부상했습니다. 2017년 구글의 'Attention Is All You Need' 논문을 통해 소개된 트랜스포머 아키텍처는 LLM의 발전을 가속화했습니다. 초기 LLM들은 주로 방대한 텍스트 데이터를 기반으로 다음 단어를 예측하는 방식으로 훈련되었습니다. 이러한 '다음 토큰 예측(next-token prediction)'은 모델이 언어의 통계적 패턴을 학습하고 문장을 생성하는 기본적인 메커니즘을 설명합니다. 그러나 GPT-3, LaMDA 등 최신 LLM들은 단순한 사전 훈련을 넘어 인간의 피드백이나 검증 가능한 보상을 활용하는 강화학습 기반의 후속 훈련(post-training) 과정을 거칩니다. 이러한 후속 훈련은 모델이 단순히 기존 데이터에 존재하는 텍스트를 모방하는 것을 넘어, 새로운 아이디어를 탐색하고 특정 목표를 달성하도록 유도합니다. 따라서 LLM을 '다음 토큰 예측기'라는 협소한 틀에 가두는 것은 모델의 진화된 능력과 잠재력을 간과하는 것입니다.
### LLM의 기본 작동 방식: 다음 토큰 예측
엄밀히 말해, LLM이 다음 토큰 예측기라는 명제는 틀리지 않습니다. 트랜스포머 기반 언어 모델은 토큰을 순차적으로 생성하는 자기회귀적(autoregressive) 방식으로 작동합니다. 이는 `tokens.append(model.sample_next_token(tokens))`와 같은 코드 형태로 표현될 수 있습니다. 사전 훈련 단계에서 모델은 주어진 이전 토큰들을 바탕으로 실제 다음에 오는 토큰을 예측하고, 해당 토큰이 샘플링될 확률을 높이는 방식으로 학습합니다. 훈련 루프는 다음과 같은 개념으로 요약될 수 있습니다: `for tokens in training_data: for position in range(1, len(tokens)): prior_tokens = tokens[:position]; actual_next_token = tokens[position]; model.make_more_likely(actual_next_token, after=prior_tokens)`. 여기서 `make_more_likely` 함수는 손실 함수, 기울기, 매개변수 업데이트 등 복잡한 과정을 내포하지만, 핵심은 실제 다음에 온 토큰을 더 가능성 있게 만드는 것입니다. 중요한 점은 이 과정에서 사용되는 모든 `actual_next_token`은 훈련 데이터에 존재하는 시퀀스에서 추출된다는 것입니다. 기본 모델은 훈련 데이터에 나타나는 대로 다음 토큰을 예측하도록 훈련되므로, 다음 토큰 예측기로 간주될 수 있습니다.
### 후속 훈련(Post-training)의 역할: RLVR과 탐색
우리가 실제로 사용하는 LLM은 단순한 기본 모델이 아닙니다. 이들은 후속 훈련 과정을 거치며, 특히 검증 가능한 보상을 이용한 강화학습(Reinforcement Learning with Verifiable Rewards, RLVR)이 핵심적인 역할을 합니다. 사전 훈련 단계에서는 모델이 기존 훈련 데이터 시퀀스만을 학습하는 반면, RLVR 과정에서는 모델이 새로운 시퀀스를 생성하며 탐색하고 그 결과로부터 학습합니다. RLVR 훈련 루프는 다음과 같이 개념화될 수 있습니다: `for task in training_tasks: for explored_tokens in model.explore(task): reward = evaluate_outcome(task, explored_tokens); for position in range(len(explored_tokens)): prior_tokens = task + explored_tokens[:position]; explored_next_token = explored_tokens[position]; model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)`. `make_more_likely` 함수는 두 루프에서 동일한 작업을 수행하지만, 그 이유는 근본적으로 다릅니다. 사전 훈련에서는 실제 훈련 데이터에 나타났기 때문에 다음 토큰을 더 가능성 있게 만들지만, RLVR에서는 탐색된 시퀀스가 높은 보상을 받았기 때문에 해당 시퀀스에 포함된 토큰을 더 가능성 있게 만듭니다. 따라서 후속 훈련된 LLM은 여전히 토큰을 하나씩 생성하는 다음 토큰 예측기의 형태를 띠지만, 더 이상 기존 텍스트를 예측하는 것만으로 학습하지 않습니다. 또한 자체 탐색을 통해 생성된 새로운 시퀀스로부터도 학습합니다.
### 체스 엔진 비유: 예측과 최적화의 차이
체스 엔진의 비유를 통해 이 차이를 더 명확하게 이해할 수 있습니다. 첫 번째 체스 시스템은 방대한 그랜드마스터 게임 데이터베이스로 훈련됩니다. 이 시스템은 다양한 보드 포지션에 대한 그랜드마스터들의 대응 패턴을 학습하며, 새로운 포지션이 주어졌을 때 그랜드마스터가 가장 가능성 있게 둘 다음 수를 예측합니다. 이것이 바로 '다음 수 예측기(next-move predictor)'입니다. 반면, 두 번째 시스템은 가능한 모든 게임을 탐색한 이상적인 체스 엔진입니다. 이 엔진은 철저한 탐색을 통해 모든 가능한 보드 포지션에서의 승률을 알고 있습니다. 주어진 포지션에서 이 시스템은 승률이 가장 높은 수를 선택합니다. 첫 번째 시스템과 달리, 이 두 번째 시스템은 그랜드마스터가 이미 둔 게임에만 훈련되는 것이 아닙니다. 자체 탐색으로 생성된 게임에서도 학습합니다. 두 번째 시스템을 '다음 수 예측기'라고 부르는 것은 어색할 것입니다. 이 시스템은 데이터셋에 나타난 다음 수를 예측하려 하지 않고, 이기는 수를 선택하려 합니다.
### 가치와 인사이트
LLM을 단순히 '다음 토큰 예측기'로 이해하는 것은 모델의 진정한 능력을 간과하는 것입니다. 특히 RLVR과 같은 후속 훈련 기법은 LLM이 기존 데이터셋에 존재하지 않는 새로운 아이디어를 탐색하고 학습할 수 있게 합니다. 이는 모델이 단순히 텍스트를 모방하는 것을 넘어, 특정 목표를 달성하기 위한 전략을 개발하거나 창의적인 결과물을 생성하는 능력을 갖추게 됨을 의미합니다. 이러한 관점의 전환은 LLM의 응용 범위를 확장하고, 보다 지능적이고 자율적인 AI 시스템 개발의 가능성을 열어줍니다. 예를 들어, 2023년 11월 공개된 다양한 LLM들은 이러한 탐색 및 최적화 능력을 바탕으로 더욱 복잡한 문제 해결 능력을 보여주고 있습니다.
### 향후 전망
LLM의 발전은 단순한 예측 모델을 넘어선 방향으로 나아가고 있습니다. RLHF(Reinforcement Learning from Human Feedback)와 같은 기법은 모델을 인간에게 유용한 조력자를 시뮬레이션하는 방향으로 전환시키고 있습니다. RLVR은 여기서 더 나아가, LLM이 훈련 데이터에서 한 번도 보지 못한 아이디어를 탐색하고 학습할 수 있도록 합니다. 이러한 능력은 향후 LLM이 더욱 복잡한 과학적 발견, 예술 창작, 또는 새로운 비즈니스 모델 개발에 기여할 수 있는 잠재력을 시사합니다. 경쟁 측면에서는, 이러한 탐색 및 학습 능력을 얼마나 효과적으로 제어하고 특정 목표에 부합하도록 유도하는지가 중요한 과제가 될 것입니다. 또한, 모델이 생성하는 새로운 아이디어의 검증 및 윤리적 문제에 대한 논의도 더욱 중요해질 것입니다. 2024년 이후에는 이러한 탐색 기반 학습이 더욱 정교화되어 다양한 분야에서 혁신을 주도할 것으로 예상됩니다.
📝 원문 및 참고
- Source: Lobsters
- 토론(Lobsters): [lobste.rs](https://lobste.rs/s/fiirrs/stop_thinking_llms_as_next_token)
- 원문: [링크 열기](https://gmcgoldr.github.io/2026/09/04/llm-next-token-predictors.html)
---
출처: Lobsters · [원문 링크](https://gmcgoldr.github.io/2026/09/04/llm-next-token-predictors.html)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.