아티클 목록으로
AI하드웨어2026-10-06

퓨리오사AI Furiosa NPU RNGD 스펙과 엔비디아 비교

하
하드웨어 아키텍처 랩
퓨리오사AI Furiosa NPU RNGD 스펙과 엔비디아 비교

퓨리오사AI RNGD 핵심 스펙 요약

퓨리오사AI의 2세대 NPU 칩 RNGD 레니게이드는 150W 저전력 환경에서 48GB HBM3 메모리를 탑재하여, 데이터센터의 대규모 언어모델 추론 비용과 전력 소비를 엔비디아 GPU 대비 50% 이상 절감하도록 설계된 국산 AI 가속기입니다.

퓨리오사AI 2세대 NPU RNGD 레니게이드 아키텍처 분석

퓨리오사AI FuriosaAI는 1세대 추론 칩 워보이 WARBOY의 성공적인 상용화에 이어, 차세대 트랜스포머 언어모델 전용 가속 칩 RNGD 레니게이드를 공개했습니다. RNGD는 TSMC 5나노미터 최선단 공정으로 생산되며, 텐서 수축 엔진 아키텍처를 도입하여 대규모 LLM 및 멀티모달 모델의 서빙 지연 시간을 극적으로 단축시켰습니다.

RNGD와 엔비디아 엔터프라이즈 GPU 스펙 비교

비교 항목퓨리오사AI RNGD엔비디아 L40S엔비디아 A100 PCIe
주요 용도LLM 언어모델 초고속 추론 서빙AI 추론 및 그래픽 렌더링대규모 딥러닝 학습 및 추론
소비 전력 TDP150W 초저전력350W 고전력250W 중고전력
메모리 규격48GB HBM3 1.5TB/s 대역폭48GB GDDR6 864GB/s80GB HBM2e 1.9TB/s
서버 폼팩터표준 PCIe Gen 5 듀얼 슬롯PCIe Gen 4 듀얼 슬롯PCIe Gen 4 듀얼 슬롯
전력당 토큰 처리량L40S 대비 최대 2.2배 고효율기준치 1.0배기준치 0.9배
총소유비용 TCO 절감전력 및 냉각비용 40% 이상 절감표준 유지비용고비용 유지보수

데이터센터 LLM 추론 비용 절감 효과

1. 와트당 토큰 처리 성능 극대화

데이터센터 운영에서 가장 큰 지출 항목인 전기 요금과 냉각 비용을 해결하기 위해, RNGD는 공랭식 서버 랙에서도 발열 없이 안정적으로 150W 전력으로 동작합니다.

2. HBM3 초고대역폭 메모리 통합

메모리 대역폭 병목으로 인해 GPU 성능이 저하되는 LLM 디코딩 단계에서, 1.5TB/s의 초고속 HBM3 메모리가 끊김 없는 토큰 생성을 보장합니다.

소프트웨어 스택 및 오픈소스 모델 지원 현황

하드웨어 성능을 소프트웨어에서 온전히 이끌어내기 위해, 퓨리오사AI는 PyTorch 및 Hugging Face와 완벽히 호환되는 Furiosa SDK 컴파일러를 제공합니다. Llama 3, Mistral, BGE 등 글로벌 오픈소스 모델을 코드 수정 없이 원클릭으로 컴파일하여 즉시 서빙할 수 있습니다.

자주 묻는 질문과 답변

Q. 퓨리오사AI RNGD 칩은 어떤 오픈소스 AI 모델을 지원하나요?
Llama 3, Mistral, BGE 등 최신 언어모델과 임베딩 모델을 풀스택 컴파일러를 통해 기본 지원합니다.

Q. 데이터센터 전력 소모 측면에서 엔비디아 GPU 대비 어떤 장점이 있나요?
RNGD는 TDP 150W 수준의 저전력으로 구동되어 엔비디아 동급 GPU 대비 최대 2배 이상의 와트당 토큰 처리 효율을 발휘합니다.

Q. 기존 클라우드 인프라에 바로 도입하여 장착할 수 있나요?
표준 PCIe Gen 5 규격을 준수하여 별도의 서버 랙 구조 변경 없이 기존 x86 및 ARM 서버에 플러그 앤 플레이로 즉시 장착할 수 있습니다.

관련 키워드 태그

#퓨리오사ai#furiosaai#퓨리오사 NPU#RNGD#AI 반도체 팹리스#NPU GPU 비교

아티클 속 AI 서비스