[Hacker News 요약] Transformer 모델, 67센트로 ARC-AGI-1 벤치마크 44% 달성
39
설명
MIT 공대 출신 개발자 Mithil Vakde는 67센트의 저렴한 비용으로 ARC-AGI-1 벤치마크에서 44%의 정확도를 달성한 소형 트랜스포머 모델을 개발했습니다.
이 모델은 기존의 많은 대규모 언어 모델(LLM)보다 뛰어난 성능을 보이며, 특히 샘플 효율성 측면에서 주목받고 있습니다.
이번 성과는 2024년 1월 15일에 공개된 연구 결과로, AI 연구의 비용 효율성과 접근성을 높이는 데 기여할 것으로 기대됩니다.
### 배경 설명
ARC(Abstraction and Reasoning Corpus)는 인간에게는 매우 쉬우나 AI에게는 어려운 추상적 추론 능력을 측정하기 위해 2019년 François Chollet에 의해 개발된 벤치마크입니다. ARC는 매우 적은 수의 샘플(1000개의 퍼즐)과 고차원 공간을 특징으로 하며, 각 퍼즐은 고유한 규칙을 가지지만 공통적인 개념을 공유합니다. 이는 메타 학습 벤치마크로서, AI가 새로운 규칙을 빠르게 학습하고 일반화하는 능력을 평가하는 데 이상적입니다. 특히, ARC는 적은 사전 지식으로도 해결할 수 있으며, AI 연구자들이 접근하기 쉬운 환경을 제공합니다. 지난 6년간 ARC는 많은 연구자들의 관심을 받았지만, 데이터 효율성 측면에서는 여전히 포화되지 않은 상태로 남아있었습니다. 특히 최근 LLM의 발전에도 불구하고, ARC-1 및 ARC-2 벤치마크에서 LLM의 성능은 초기에는 저조했으며, 이는 사전 학습만으로는 일반적인 추론 능력을 획득하기 어렵다는 것을 시사했습니다. Mithil Vakde의 연구는 이러한 ARC 벤치마크에서 샘플 효율성을 극대화하는 것을 목표로 하며, 이는 현재 AI 분야에서 가장 중요한 문제 중 하나로 간주됩니다. 저비용으로 반복 실험이 가능한 환경을 구축함으로써, 더 많은 연구자들이 이 문제에 기여할 수 있도록 하는 것이 이 연구의 핵심 동기입니다.
### 소형 트랜스포머 모델의 아키텍처 및 학습 방식
Mithil Vakde가 개발한 소형 트랜스포머 모델은 이전 연구를 기반으로 개선되었습니다. 핵심 접근 방식은 각 입력-출력 쌍을 토큰 시퀀스로 변환하고, 이를 소형 트랜스포머가 자기회귀적으로 학습하는 것입니다. 이 과정은 테스트 시점에서 학습 및 평가 퍼즐에 대해 처음부터 수행되며, 테스트 레이블은 숨겨져 있습니다. 작업 간 학습을 가능하게 하기 위해 각 퍼즐에는 별도의 가산 임베딩이 적용됩니다. 2차원 그리드를 다루기 위해 3차원 RoPE(Rotary Positional Embedding) 임베딩이 사용되며, 색상 및 회전 변환(dihedral permutations)을 통한 데이터 증강이 적용됩니다. 추론 시에는 테스트 입력에 변환을 적용하고, 생성된 출력에 역변환을 적용하여 가장 빈번한 두 개의 출력을 제출하는 AAIVR(All-Augmented-Inference-Validation-Retrieval) 방식을 사용합니다. 특히, 이번 모델에서는 입력 토큰에 대한 학습을 제거하여 손실 함수가 출력 토큰만을 포함하는 지도 학습 방식으로 변경되었습니다. 이는 40%에서 44%로 성능을 소폭 향상시켰으며, 저자는 이 현상에 대해 아직 명확히 이해하지 못하고 있다고 언급했습니다. 또한, ARC-2의 비중복 작업 데이터를 추가하여 학습 데이터를 확장했으며, 이는 약 40%의 성능을 유지하면서도 약 2배의 컴퓨팅 비용을 요구합니다. ARC-2는 773개의 ARC-1 퍼즐과 347개의 새로운 퍼즐을 포함하며, 데이터 유출을 방지하기 위해 반복되는 퍼즐을 신중하게 필터링했습니다.
### 성능 향상을 위한 주요 변경 사항
이전 모델 대비 성능 향상을 위해 여러 아키텍처 및 알고리즘 개선이 이루어졌습니다. 가장 큰 점수 증가는 다음과 같은 현대적인 아키텍처 요소 도입에서 비롯되었습니다: GELU 대신 SwiGLU 활성화 함수, LayerNorm 대신 RMSNorm, 그리고 8개 레이어로 확장된 모델 깊이(이전 4개 레이어). 데이터 다양성 증대와 더 나은 데이터 셔플링도 성능 향상에 기여했습니다. 비용 절감을 위한 주요 변경 사항으로는 데이터 증강 횟수 대폭 축소, AdamW 옵티마이저 대신 NorMuon 사용, 그리고 Flash Attention과 Varlen Training 및 Flex Attention 커널을 활용한 추론 최적화가 있습니다. 특히, 입력 토큰 학습을 제거한 것은 성능을 40%에서 44%로 소폭 향상시켰으며, 이는 지도 학습 방식이 더 효과적일 수 있음을 시사합니다. 또한, ARC-2의 773개 ARC-1 퍼즐과 347개의 새로운 퍼즐을 포함하여 학습 데이터를 확장했습니다. 이 데이터 확장은 신중하게 수행되어 데이터 유출을 방지했으며, 이를 제거해도 약 40%의 성능을 유지할 수 있습니다.
### 비용 효율성과 오픈 소스 기여
이 연구의 가장 큰 특징 중 하나는 극도로 낮은 컴퓨팅 비용입니다. 모델 학습에 총 1.5시간이 소요되었으며, 전체 비용은 단 67센트에 불과합니다. 이는 2024년 1월 15일 기준, 5090 GPU를 Vast.ai에서 2시간 동안 사용하는 비용을 기준으로 산출되었습니다. 이러한 저비용은 AI 연구의 접근성을 크게 높이며, 더 많은 연구자들이 실험하고 기여할 수 있는 환경을 조성합니다. 저자는 코드를 오픈 소스로 공개하여 다른 연구자들이 모델을 수정하고 성능을 개선하거나 비용을 절감할 수 있도록 장려하고 있습니다. 특히, 65%의 정확도를 달성하기 위한 수정은 많지 않을 것이라고 언급하며, RoPE와 per-task 임베딩의 중요성을 강조했습니다. 또한, 비용을 10배 더 절감할 수 있는 GPU 코드 최적화 및 데이터 증강 제거와 같은 추가적인 개선 가능성을 제시했습니다. 이러한 오픈 소스 접근 방식은 커뮤니티의 집단 지성을 활용하여 AI 연구의 발전을 가속화하는 데 기여할 것으로 기대됩니다.
### 가치와 인사이트
Mithil Vakde의 연구는 AI 모델 개발에서 샘플 효율성과 비용 효율성의 중요성을 다시 한번 강조합니다. 67센트라는 극히 낮은 비용으로 ARC-AGI-1 벤치마크에서 44%의 성능을 달성한 것은, 고가의 컴퓨팅 자원 없이도 상당한 연구 성과를 낼 수 있음을 보여줍니다. 이는 특히 자원이 제한적인 연구자나 개발도상국의 연구자들에게 큰 영감을 줄 수 있습니다. 또한, 지도 학습 방식이 샘플 효율성 측면에서 예상치 못한 이점을 제공할 수 있다는 점은 기존의 연구 패러다임에 대한 새로운 질문을 던집니다. 이 결과는 AI 연구의 민주화와 접근성 향상에 기여할 뿐만 아니라, 샘플 효율성이라는 AI의 근본적인 난제를 해결하기 위한 새로운 방향을 제시합니다. LLM 시대에 오히려 소형 모델의 효율성을 극대화하는 접근 방식이 주목받는다는 점은 흥미로운 지점입니다.
### 기술·메타
- Python
- PyTorch
- Transformer
- RoPE (Rotary Positional Embedding)
- RMSNorm
- SwiGLU
- NorMuon
- Flash Attention
- Vast.ai (GPU 클라우드)
### 향후 전망
Mithil Vakde의 모델은 ARC-AGI-1 벤치마크에서 44%의 성능을 달성했지만, 65% 이상의 성능을 목표로 하는 추가적인 연구가 진행될 가능성이 높습니다. 저자는 RoPE와 per-task 임베딩의 중요성을 강조하며, 이러한 구성 요소의 개선이나 새로운 위치 임베딩 방식의 도입이 성능 향상으로 이어질 수 있다고 언급했습니다. 또한, GPU 코드 최적화를 통해 현재 비용의 10배 절감 가능성을 제시하며, 이는 AI 연구의 경제성을 더욱 높일 것입니다. 경쟁 측면에서는, LLM 기반 접근 방식들이 ARC 벤치마크에서 계속해서 발전할 것이지만, 이 연구는 소형 모델의 샘플 효율성이 여전히 강력한 경쟁력이 될 수 있음을 보여줍니다. 오픈 소스 커뮤니티의 기여를 통해 모델의 아키텍처와 학습 방식이 더욱 발전할 것으로 예상되며, 이는 AI 연구의 전반적인 발전 속도를 가속화할 것입니다. 데이터 증강 제거와 같은 '반-비터 레슨' 원칙을 따르는 연구는 장기적으로 AI의 근본적인 문제 해결에 더 큰 기여를 할 것으로 보입니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49519939)
- 원문: [링크 열기](https://mvakde.github.io/blog/44-on-arc-1/)
---
출처: Hacker News · [원문 링크](https://mvakde.github.io/blog/44-on-arc-1/)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.