퓨리오사AI RNGD 핵심 스펙 요약
퓨리오사AI의 2세대 NPU 칩 RNGD 레니게이드는 150W 저전력 환경에서 48GB HBM3 메모리를 탑재하여, 데이터센터의 대규모 언어모델 추론 비용과 전력 소비를 엔비디아 GPU 대비 50% 이상 절감하도록 설계된 국산 AI 가속기입니다.
퓨리오사AI 2세대 NPU RNGD 레니게이드 아키텍처 분석
퓨리오사AI FuriosaAI는 1세대 추론 칩 워보이 WARBOY의 성공적인 상용화에 이어, 차세대 트랜스포머 언어모델 전용 가속 칩 RNGD 레니게이드를 공개했습니다. RNGD는 TSMC 5나노미터 최선단 공정으로 생산되며, 텐서 수축 엔진 아키텍처를 도입하여 대규모 LLM 및 멀티모달 모델의 서빙 지연 시간을 극적으로 단축시켰습니다.
RNGD와 엔비디아 엔터프라이즈 GPU 스펙 비교
| 비교 항목 | 퓨리오사AI RNGD | 엔비디아 L40S | 엔비디아 A100 PCIe |
|---|---|---|---|
| 주요 용도 | LLM 언어모델 초고속 추론 서빙 | AI 추론 및 그래픽 렌더링 | 대규모 딥러닝 학습 및 추론 |
| 소비 전력 TDP | 150W 초저전력 | 350W 고전력 | 250W 중고전력 |
| 메모리 규격 | 48GB HBM3 1.5TB/s 대역폭 | 48GB GDDR6 864GB/s | 80GB HBM2e 1.9TB/s |
| 서버 폼팩터 | 표준 PCIe Gen 5 듀얼 슬롯 | PCIe Gen 4 듀얼 슬롯 | PCIe Gen 4 듀얼 슬롯 |
| 전력당 토큰 처리량 | L40S 대비 최대 2.2배 고효율 | 기준치 1.0배 | 기준치 0.9배 |
| 총소유비용 TCO 절감 | 전력 및 냉각비용 40% 이상 절감 | 표준 유지비용 | 고비용 유지보수 |
데이터센터 LLM 추론 비용 절감 효과
1. 와트당 토큰 처리 성능 극대화
데이터센터 운영에서 가장 큰 지출 항목인 전기 요금과 냉각 비용을 해결하기 위해, RNGD는 공랭식 서버 랙에서도 발열 없이 안정적으로 150W 전력으로 동작합니다.
2. HBM3 초고대역폭 메모리 통합
메모리 대역폭 병목으로 인해 GPU 성능이 저하되는 LLM 디코딩 단계에서, 1.5TB/s의 초고속 HBM3 메모리가 끊김 없는 토큰 생성을 보장합니다.
소프트웨어 스택 및 오픈소스 모델 지원 현황
하드웨어 성능을 소프트웨어에서 온전히 이끌어내기 위해, 퓨리오사AI는 PyTorch 및 Hugging Face와 완벽히 호환되는 Furiosa SDK 컴파일러를 제공합니다. Llama 3, Mistral, BGE 등 글로벌 오픈소스 모델을 코드 수정 없이 원클릭으로 컴파일하여 즉시 서빙할 수 있습니다.
자주 묻는 질문과 답변
Q. 퓨리오사AI RNGD 칩은 어떤 오픈소스 AI 모델을 지원하나요?
Llama 3, Mistral, BGE 등 최신 언어모델과 임베딩 모델을 풀스택 컴파일러를 통해 기본 지원합니다.
Q. 데이터센터 전력 소모 측면에서 엔비디아 GPU 대비 어떤 장점이 있나요?
RNGD는 TDP 150W 수준의 저전력으로 구동되어 엔비디아 동급 GPU 대비 최대 2배 이상의 와트당 토큰 처리 효율을 발휘합니다.
Q. 기존 클라우드 인프라에 바로 도입하여 장착할 수 있나요?
표준 PCIe Gen 5 규격을 준수하여 별도의 서버 랙 구조 변경 없이 기존 x86 및 ARM 서버에 플러그 앤 플레이로 즉시 장착할 수 있습니다.
