[Hacker News 요약] OpenTPU: AI가 개발한 오픈소스 AI 가속기, 하드웨어 설계부터 컴파일러까지 통합
0
설명
FeSens에서 개발한 OpenTPU는 AI 에이전트가 하드웨어 설계를 수행하고, 자체 추론을 실행하는 칩을 구축할 수 있는지 탐구하는 오픈소스 AI 가속기입니다.
이 프로젝트는 RTL, ISA, 시뮬레이터, 컴파일러, 프로파일러를 단일 리포지토리에서 제공하며, Kintex-7 PCIe 카드에서 Qwen3, LFM2.5, Qwen3.5와 같은 모델을 실행합니다.
OpenTPU는 AI 하드웨어 설계의 새로운 가능성을 제시하며, 개발자들에게 AI 가속기의 작동 방식을 깊이 이해할 수 있는 기회를 제공합니다.
### 배경 설명
최근 몇 년간 AI 모델의 규모와 복잡성이 기하급수적으로 증가하면서, 이러한 모델을 효율적으로 실행하기 위한 전용 하드웨어 가속기의 중요성이 부각되고 있습니다. NVIDIA의 GPU가 시장을 주도하고 있지만, 특정 워크로드에 최적화된 맞춤형 가속기에 대한 수요도 꾸준히 존재합니다. 이러한 배경 속에서 OpenTPU는 AI 에이전트가 직접 하드웨어를 설계하고 최적화하는 'AI for AI hardware'라는 접근 방식을 채택하여 주목받고 있습니다. 이는 기존의 하드웨어 설계 방식에 대한 근본적인 질문을 던지며, 미래의 AI 하드웨어 개발 패러다임을 바꿀 잠재력을 가지고 있습니다.
OpenTPU는 단순히 하드웨어 설계만을 제공하는 것이 아니라, Instruction Set Architecture (ISA), 비트 단위의 정확한 시뮬레이터, 커널 언어 및 컴파일러, 그리고 실제 PCIe 카드와 상호 작용하는 호스트 소프트웨어까지 포함하는 포괄적인 개발 환경을 제공합니다. 이는 개발자가 Python 코드로 작성된 행렬 곱셈 연산이 실제 하드웨어의 전선까지 어떻게 구현되는지 전체 과정을 추적하고 이해할 수 있도록 돕습니다. 이러한 통합적인 접근 방식은 AI 가속기의 내부 작동 원리를 학습하고자 하는 연구자 및 개발자들에게 매우 유용한 자원이 될 것입니다.
### OpenTPU의 구성 요소 및 기능
OpenTPU는 하드웨어 설계(SystemVerilog RTL), 명령어 집합 아키텍처(ISA), 비트 단위 정확도 시뮬레이터, 커널 언어 및 컴파일러, 그리고 호스트 소프트웨어를 포함하는 단일 모노리포로 구성됩니다. 이 프로젝트는 Xilinx Kintex-7 xc7k480t FPGA가 탑재된 Inspur YPCB-00338 PCIe 카드에서 LFM2.5-230M, Qwen3-0.6B, Qwen3.5-0.8B 등 다양한 최신 AI 모델을 실행합니다. 실제 카드에서 측정된 성능은 시뮬레이터 결과와 비트 단위로 일치하며, 특히 LFM2.5-230M 모델의 경우 int8 정밀도에서 초당 59.0 토큰의 디코드 속도를 기록했습니다. 4비트 양자화된 모델은 디코드 속도를 약 40-45% 향상시키면서도 정확도 손실을 최소화합니다. 또한, Gemma 4 E2B 및 E4B와 같은 모델의 경우, 카드 자체 메모리에 임베딩 테이블을 유지하거나 호스트에서 스트리밍하는 방식으로 4GB 이상의 모델도 효율적으로 처리할 수 있습니다. LiteDRAM 컨트롤러는 내장된 소형 CPU에 의해 12초 내에 자동으로 보정되며, 이는 이전 버전의 Xilinx MIG 기반 설계보다 사전 준비 시간을 단축시킵니다.
### 성능 측정 및 최적화 결과
OpenTPU는 다양한 모델과 양자화 기법에 대한 상세한 성능 측정 결과를 제공합니다. 예를 들어, LFM2.5-230M 모델은 int8 정밀도에서 초당 59.0 토큰의 디코드 속도와 14.5 GB/s의 DRAM 대역폭을 달성했습니다. 4비트 양자화 시에는 초당 85.8 토큰까지 속도가 향상되었습니다. Qwen3.5-4B 모델의 경우 4비트 양자화 및 int8 헤드를 사용하여 초당 5.88 토큰의 디코드 속도를 보였습니다. 이러한 성능은 2026년 9월 29일부터 10월 1일까지 다양한 빌드와 배포 이미지(예: deploy_champ_e698dcd7, deploy_fused133c_79c5707a)를 사용하여 측정되었습니다. 새로운 빌드 B는 이전 버전(se-cand3) 대비 디코드 성능에서 2.3% 이내의 편차를 보이며, 특히 사전 채우기(prefill) 성능은 1.3배에서 2.0배까지 향상되었습니다. 이는 4열 시스톨릭 행렬 유닛과 최적화된 스트림 엔진 덕분입니다. 또한, Mixture-of-Experts(MoE) 모델의 경우, 카드 메모리 용량을 초과하는 전문가(expert)는 호스트 스토리지에서 스트리밍하여 처리하며, LFM2.5-8B-A1B 모델은 초당 10.6 토큰, Qwen3.5-35B-A3B 모델은 초당 3.95 토큰의 성능을 기록했습니다.
### 개발 및 학습 환경
OpenTPU는 개발자가 AI 가속기의 전체 스택을 쉽게 이해하고 실험할 수 있도록 설계되었습니다. 모든 구성 요소가 단일 리포지토리에 포함되어 있어, RTL 코드부터 시뮬레이터, 컴파일러, 그리고 실제 하드웨어까지의 흐름을 추적하기 용이합니다. `pip install -e .` 명령어를 통해 로컬 환경에 설치할 수 있으며, `pytest`를 이용한 테스트 실행도 지원합니다. 특히, `otpu-chat` 명령어를 통해 다양한 모델과 상호작용하며 추론 과정을 실시간으로 확인할 수 있습니다. `otpu-smi`는 카드 상태를 모니터링하고, `otpu-lens`는 실행 과정을 시각화하여 성능 병목 지점을 파악하는 데 도움을 줍니다. 문서화 또한 잘 되어 있어, `docs/isa.md`는 명령어 집합을, `docs/compiler.md`는 컴파일 과정을, `rtl/top/otpu_top.sv`는 하드웨어 최상위 모듈을 설명합니다. 이러한 풍부한 자료와 도구들은 AI 하드웨어 설계 및 최적화에 관심 있는 개발자들에게 훌륭한 학습 자료가 될 것입니다.
### 가치와 인사이트
OpenTPU는 AI 하드웨어 설계의 자동화 및 최적화 가능성을 보여주는 중요한 사례입니다. AI 에이전트가 직접 하드웨어를 설계하고, 그 하드웨어에서 AI 모델을 실행하는 'AI for AI hardware' 패러다임은 향후 AI 칩 개발의 효율성을 극대화할 잠재력을 지닙니다. 이는 특정 워크로드에 최적화된 맞춤형 가속기 개발 비용과 시간을 크게 단축시킬 수 있습니다. 또한, OpenTPU는 RTL부터 컴파일러, 시뮬레이터까지 통합된 개발 환경을 제공함으로써, AI 가속기의 작동 원리를 깊이 이해하고자 하는 연구자 및 개발자들에게 귀중한 학습 리소스를 제공합니다. 실제 하드웨어에서의 성능 측정 결과와 시뮬레이터와의 비트 단위 일치는 프로젝트의 신뢰성을 높이며, 다양한 최신 AI 모델을 지원하는 유연성을 보여줍니다. 이는 AI 하드웨어 분야의 진입 장벽을 낮추고 혁신을 가속화하는 데 기여할 것입니다.
### 기술·메타
- RTL (SystemVerilog)
- ISA (Instruction Set Architecture)
- Simulator (Python)
- Compiler (Python)
- Profiler (Python)
- FPGA: Xilinx Kintex-7 xc7k480t
- PCIe Card: Inspur YPCB-00338
- Programming Languages: Python, SystemVerilog
- AI Models: Qwen3, LFM2.5, Qwen3.5, Gemma 4, LFM2-2.6B, SmolLM3-3B, Phi-4-mini, LFM2.5-8B-A1B, Qwen3.5-35B-A3B
- Quantization: 4-bit weights, int8 head
- License: Apache-2.0
### 향후 전망
OpenTPU의 향후 발전은 AI 에이전트의 하드웨어 설계 능력 향상, 지원 모델의 확장, 그리고 성능 최적화에 달려있습니다. 현재는 Kintex-7 FPGA 기반이지만, 더 높은 성능을 위해 차세대 FPGA 또는 ASIC으로의 포팅 가능성도 열려 있습니다. 또한, 현재 지원하는 모델 외에 더 크고 복잡한 최신 LLM(Large Language Model)들을 효율적으로 지원하기 위한 아키텍처 개선 및 컴파일러 최적화가 중요해질 것입니다. 경쟁 측면에서는 NVIDIA와 같은 기존 강자들과의 직접적인 경쟁보다는, 특정 엣지 디바이스나 특수 목적 AI 가속기 시장에서 틈새를 공략할 가능성이 높습니다. 커뮤니티의 참여 또한 OpenTPU의 성장에 중요한 역할을 할 것이며, 오픈소스 생태계를 통해 다양한 기여와 아이디어가 발전할 것으로 기대됩니다. 특히, AI 에이전트가 스스로 하드웨어를 설계하고 최적화하는 과정이 더욱 정교해진다면, AI 하드웨어 개발의 새로운 지평을 열 수 있을 것입니다.
📝 원문 및 참고
- Source: Hacker News
- 토론(HN): [news.ycombinator.com](https://news.ycombinator.com/item?id=49980715)
- 원문: [링크 열기](https://github.com/FeSens/openTPU)
---
출처: Hacker News · [원문 링크](https://github.com/FeSens/openTPU)
이 글에 대한 한 줄 의견
신고 · 불법·유해·아동 안전(CSAE) 관련 콘텐츠

댓글 0
아직 댓글이 없습니다. 로그인하면 바로 의견을 남길 수 있습니다.