[Hacker News 요약] 역전파 없이 트랜스포머 사전 학습하는 'Dust' 알고리즘 공개
1
설명
2026년 10월, Q Labs Research에서 발표한 'Dust'는 역전파(backpropagation) 없이도 트랜스포머 언어 모델 사전 학습에 경쟁력 있는 최초의 제로-오더(zeroth-order) 최적화 방법론을 제시합니다.
이 방법론은 활성화 함수(activation)를 직접 교란하여 각 토큰을 독립적인 탐색 단위로 활용하며, 이는 기존의 가중치 기반 진화 전략(Evolution Strategies, ES)보다 훨씬 효율적입니다.
Dust는 대규모 연산 환경에서 역전파를 능가할 잠재력을 보여주며, 특히 모델 크기가 커질수록 효율성이 증가하는 흥미로운 특성을 보입니다.
### 배경 설명
딥러닝의 근간을 이루는 역전파 알고리즘은 신경망의 학습을 가능하게 했지만, 미분 가능성이라는 제약 조건 하에서 아키텍처, 옵티마이저, 하드웨어 등이 발전해왔습니다. 그러나 컴퓨팅 자원이 기하급수적으로 증가함에 따라, 미분 가능성에 의존하지 않는 보다 일반적이고 계산 집약적인 학습 알고리즘에 대한 탐구가 중요해지고 있습니다. 'The Bitter Lesson'에서 주장하듯, 컴퓨팅 파워와 함께 확장되는 일반적인 방법론이 결국 우위를 점할 것이라는 관점은 AlphaGo Zero와 같은 사례에서 입증되었습니다. 역전파는 저연산 환경에서는 효율적인 귀납적 편향(inductive bias) 역할을 하지만, 고연산 환경에서는 학습 가능한 아키텍처의 범위를 제한할 수 있습니다. 또한, 경사 하강법(SGD) 기반의 그래디언트 방법론은 손실 함수의 최적 지점을 탐색하는 데 한계가 있을 수 있으며, 이는 현재 신경망이 방대한 데이터를 필요로 하는 이유 중 하나로 추측됩니다. 따라서, 탐색에 기반한 보다 유연한 신용 할당(credit assignment) 알고리즘은 모델의 일반화 성능 향상을 위한 중요한 단계가 될 수 있습니다.
### Dust 방법론: 활성화 공간 교란 및 신용 할당
Dust는 각 선형 레이어의 출력을 모든 토큰에 대해 독립적으로 가우시안 노이즈로 교란하고, 순방향 전파(forward pass)를 수행한 후 각 토큰의 손실 감소량을 보상으로 사용합니다. 이 보상 가중치 노이즈를 여러 번의 시도(draw)에 대해 평균내어 그래디언트를 추정합니다. 이는 기존의 가중치 공간에서 노이즈를 주입하는 진화 전략(예: EGGROLL)과 달리, 각 토큰을 가상 개체로 간주하여 하나의 순방향 전파로 여러 개체를 평가할 수 있게 합니다. 이러한 활성화 공간에서의 탐색은 잠재적 추론 과정을 탐색하는 것으로 해석될 수 있으며, 이는 기계적 해석 가능성(mechanistic interpretability) 연구에서 추론이 활성화 공간에 존재한다는 발견과 맥을 같이 합니다. 또한, 트랜스포머 블록 내의 다양한 레이어 타입에 대해 서로 다른 신용 할당 규칙을 적용하여 효율성을 높입니다. 예를 들어, 어텐션 내부(attention internals)는 토큰 손실보다는 추정된 어텐션 출력 그래디언트와의 정렬을 통해 보상받습니다. 이러한 활성화 공간 교란과 토큰별 보상 규칙의 조합은 기존의 가중치 기반 ES 방법론보다 계산 효율성을 수천 배 이상 향상시킵니다. Dust는 100만 토큰 이상에서 EGGROLL 대비 $10^3$에서 $10^4$배의 효율성을 보입니다.
### 역전파 없는 사전 학습 실험 결과
연구진은 GPT 스타일의 트랜스포머 모델을 FineWeb 데이터셋으로 사전 학습시키며 Dust와 역전파 기반의 SGD 옵티마이저를 비교했습니다. 100만 토큰 및 1000만 토큰 예산에서 Dust는 역전파보다 낮은 테스트 손실을 달성했으며, 특히 1000만 및 2000만 토큰 예산에서는 대규모 연산(population)을 사용할 때 역전파와의 격차를 줄였습니다. 흥미롭게도, Dust는 모델 크기가 커질수록(200만에서 2억 4300만 파라미터까지) 더 높은 연산 효율성을 보였으며, 이는 기존의 제로-오더 방법론이 대규모 네트워크 학습에 부적합하다는 통념에 반하는 결과입니다. 2억 4300만 파라미터 모델은 120배 작은 모델보다 대부분의 연산 크기에서 더 나은 성능을 보였습니다. 이는 모델 크기가 단순히 파라미터 수 증가를 넘어 탐색 공간의 크기와 기하학적 구조를 결정하는 중요한 요소임을 시사합니다. 또한, Dust의 그래디언트 추정치는 연산 크기가 증가함에 따라 역전파 그래디언트와 더 잘 정렬되었으며, 이는 10억 토큰까지의 규모에서도 일관되게 관찰되었습니다.
### 대규모 탐색 공간에서의 학습 및 그래디언트 특성
Dust는 대규모 모델에서 더 높은 연산 효율성을 보이며, 이는 모델 크기가 탐색 공간의 크기와 기하학적 구조를 결정한다는 관점을 뒷받침합니다. 2억 4300만 파라미터 모델은 200만 파라미터 모델보다 더 큰 연산 규모를 효과적으로 활용하여 더 나은 성능을 달성했습니다. 또한, Dust의 그래디언트 추정치와 역전파 그래디언트 간의 코사인 유사도를 측정한 결과, 연산 크기가 증가함에 따라 모든 레이어 타입에서 유사도가 꾸준히 증가하는 것을 확인했습니다. 이 유사도는 10억 토큰까지의 학습 과정에서도 일관되게 유지되었으며, 이는 Dust가 대규모 연산 환경에서 역전파와 유사한 방향으로 학습을 진행할 수 있음을 시사합니다. 흥미로운 점은 Dust의 그래디언트가 역전파와 완전히 일치하지 않으면서도 유사한 방향을 가리킨다는 사실입니다. 이는 역전파와는 다른 최적화 궤적을 탐색하게 하며, 실험 결과에서 때로는 역전파보다 더 나은 성능을 보이기도 했습니다. 이는 Dust가 손실 함수의 곡률(curvature)과 같은 고차원 정보를 암묵적으로 탐색하여 더 나은 방향을 찾을 수 있음을 시사합니다.
### 가치와 인사이트
Dust는 역전파의 제약을 벗어나 대규모 언어 모델 사전 학습에 대한 새로운 가능성을 열었습니다. 특히, 모델 크기가 커질수록 연산 효율성이 증가한다는 발견은 기존의 통념을 뒤집으며, 대규모 모델을 활용한 탐색 기반 학습의 잠재력을 보여줍니다. 또한, Dust의 그래디언트 추정치가 역전파와 유사하면서도 다른 최적화 궤적을 탐색할 수 있다는 점은, 손실 함수 공간의 복잡성을 더 잘 탐색할 수 있는 가능성을 제시합니다. 이는 향후 더 나은 일반화 성능을 가진 모델 개발에 기여할 수 있습니다. 계산 효율성 측면에서는 아직 역전파를 대체할 수준은 아니지만, 수천 배의 효율성 향상은 중요한 진전입니다.
### 기술·메타
- 언어 모델: GPT-style Transformers
- 데이터셋: FineWeb
- 토크나이저: 4096-token BPE
- 옵티마이저: SGD with momentum (주로), Adam
- 평가 지표: Test loss
- 방법론: Zeroth-order optimization, Activation-space perturbation, Virtual population, Token-level rewards
### 향후 전망
Dust는 역전파가 필요 없는 새로운 아키텍처 탐색의 길을 열었습니다. 예를 들어, 순환 계산이나 역전파를 통한 시간 역전파(backpropagation through time)가 학습에 어려움을 겪는 경우에 Dust가 더 효과적일 수 있습니다. 또한, Dust의 그래디언트 추정치가 역전파와 완전히 일치하지 않는다는 점은, 손실 함수의 고차원 곡률 정보를 활용하여 더 나은 탐색 방향을 찾을 가능성을 시사합니다. 그러나 현재 단계에서는 계산 효율성이 실용적인 수준에 도달하기까지 상당한 개선이 필요합니다. 향후 연구는 Dust의 계산 효율성을 수백 배 이상 향상시키는 데 초점을 맞출 것으로 예상되며, 이는 대규모 언어 모델 학습 패러다임의 변화를 가져올 수 있습니다. 또한, Dust와 같은 탐색 기반 학습 방법론이 현대적인 옵티마이저와 결합될 때 어떤 시너지를 낼 수 있는지에 대한 연구도 기대됩니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49970871)
- 원문: [링크 열기](https://qlabs.sh/research/dust)
---
출처: Hacker News · [원문 링크](https://qlabs.sh/research/dust)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.