[창간기획]AI 추론 시장 대응…'S램'이 뜬다

대용량 S램이 탑재된 엔비디아 그록 3 LPU 추론 가속기
대용량 S램이 탑재된 엔비디아 그록 3 LPU 추론 가속기

S램이 인공지능(AI) 메모리 산업의 '라이징 스타'로 급부상했다. AI가 '학습' 단계에서 '추론'으로 넘어가면서 이에 최적화한 새로운 메모리가 필요해졌기 때문이다. 기존 고대역폭메모리(HBM)가 주도했던 AI 메모리 시장 저변이 한층 넓어질 전망이다.

S램은 전원이 공급되는 동안 데이터를 유지하는 정적 메모리다. D램처럼 주기적으로 정보를 재충전할 필요가 없어 접근 속도가 빠르다. 중앙처리장치(CPU)·그래픽처리장치(GPU)·신경망처리장치(NPU)의 캐시와 공유 메모리, 스크래치패드 등에 주로 들어간다.

반면 셀 면적이 크고 집적도가 낮아 대용량 저장에는 불리하다. 이 때문에 HBM·D램과 경쟁하기 보다는 이들 메모리에서 가져온 데이터를 연산기 가까이에 임시 저장해 처리 효율을 높이는 보완재 역할을 담당하고 있다.

거대언어모델(LLM) 추론이 S램 성장 발판을 마련했다. AI가 문장 한 토큰을 생성할 때마다 방대한 모델 가중치와 이전 대화 정보인 KV 캐시를 반복적으로 불러와야 한다. 이 과정에서 외부 메모리 왕복이 늘어나면 연산기는 데이터를 기다리는 시간이 길어진다. 응답 지연과 전력 소모가 커진다는 의미다.

자주 쓰는 데이터를 온칩 S램에 머물게 하면 대역폭 병목을 줄이고 처리량과 전력 효율을 함께 끌어올릴 수 있다. S램은 HBM보다 용량은 작지만, AI 가속기 내에서는 가장 빠른 메모리 계층으로 기능한다. 엔비디아가 인수한 그록이 대규모 S램을 내장한 LLM 추론칩 '그록 LPU'를 내놓은 것이 대표 사례다.

S램은 D램처럼 독립적인 메모리 칩 형태와, CPU·GPU·NPU 등 프로세서 내부에 설계자산(IP)으로 적용하는 방식으로 나뉜다. 업계에서는 단독 S램 칩보다는 임베디드나 IP 형태 S램 성장을 더 높게 보고 있다.

엔비디아 그록 3 LPU 내부 구조 이미지. 가운데 'MEM' 슬라이스 2개가 S램 영역이다.
엔비디아 그록 3 LPU 내부 구조 이미지. 가운데 'MEM' 슬라이스 2개가 S램 영역이다.

시장조사업체 스카이퀘스트는 S램 및 롬 IP 시장이 2024년 25억5000만달러에서 2033년 44억2000만달러로 성장할 것으로 예상했다. AI 가속기와 엣지 AI, 자동차용 시스템온칩(SoC)에서 고밀도·저전력 온칩 메모리 수요가 늘어날 것으로 전망했다.

AI 특화 시장은 더 가파른 성장세가 예고된다. 모르도르 인텔리전스는 AI 가속기 캐시 통합이 2025년 S램 근접 메모리·캐시·연산 시장의 43.17%를 차지했으며, 2031년까지 연평균 25.43% 성장할 것으로 내다봤다.

S램 성장은 D램 제조사만의 경쟁에서 AI칩 설계·파운드리·EDA·첨단 패키징의 협업으로 넓힌다. AI칩 기업은 공정별 특성에 맞춘 S램 매크로와 메모리 컴파일러 IP를 확보해야 하고, 파운드리는 미세공정에서 전력·성능·면적(PPA)과 수율을 동시에 만족시키는 S램 구현 능력을 확보해야 하기 때문이다. Arm, 시놉시스, 케이던스, 지멘스 EDA 등이 S램 설계 IP 시장의 주요 사업자로 꼽힌다.

업계 관계자는 “향후 AI 연산을 뒷받침할 S램이 더욱 커질 경우 프로세서 외부와 맞닿는 단독 칩으로 활용될 가능성도 제기된다”며 “이 경우 연결 성능을 확보하기 위한 근접 패키징 등 후공정 산업에도 영향을 미칠 것”이라고 말했다.

권동준 기자 djkwon@etnews.com

  • ET Events