AI 낸드 수요가 커지는 이유, HBM·SSD 메모리 계층 쉽게 정리
AI가 커질수록 계산 칩만큼이나 데이터를 담아둘 저장장치가 중요해지고, 그 중심에 낸드플래시가 있다. 이 글은 AI 낸드 수요가 왜 늘어나는지, 기업용 SSD 매출과 신제품 수치가 무엇을 보여주는지, HBM·DRAM·낸드가 어떻게 역할을 나누는지를 반도체를 모르는 사람도 따라올 수 있게 정리했다.

AI 반도체 다음 화두, 낸드 저장 수요
지난 몇 년간 AI 반도체 논의는 GPU 연산 속도와 HBM 공급 속도에 쏠려 있었다. GPU는 AI 계산을 한꺼번에 병렬로 처리하는 칩이다. HBM(고대역폭 메모리)은 메모리 칩을 여러 층 쌓아 GPU 바로 옆에 붙인, 아주 빠른 메모리다.
그런데 AI가 커지면서 같이 커지는 게 하나 더 있다. 저장해야 하는 데이터의 양이다. 여기서 등장하는 것이 낸드플래시다. 낸드플래시는 전원이 꺼져도 데이터가 지워지지 않는 저장용 메모리 칩으로, USB 메모리나 SSD(하드디스크 대신 쓰는 반도체 저장장치) 안에 들어간다.
낸드플래시 저장 수요라는 이 화두는 화자가 이전에 다뤄온 여러 소재를 하나로 모은다. 기업용 SSD(eSSD, 서버와 데이터센터에 들어가는 SSD) 수요, 애플 AFM3, CMX, HBF, 삼성 Z-NAND(자막 표기 "지진오")가 그것이다. 각각 다른 이야기처럼 보였던 것들이 결국 하나의 질문으로 좁혀진다. AI는 대체 뭘 그렇게 많이 저장하는가.
AI 모델이 저장을 필요로 하는 이유
AI 모델은 단순하게 보면 수십억에서 수천억 개 파라미터로 이뤄진 거대한 숫자 데이터다. 파라미터(가중치라고도 한다)는 모델이 학습하면서 조정해 둔 숫자 하나하나를 말한다. 이 숫자들이 모여 모델의 "지식"이 된다.
HBM은 GPU 바로 옆에서 연산에 필요한 데이터를 빠르게 공급한다. 그만큼 용량당 가격이 높고, 전원이 꺼지면 데이터가 사라진다. 모델 전체를 HBM에 계속 올려둘 수 없는 이유다. 그래서 모델 파일 자체는 낸드 기반 SSD에 저장해두고, 실제 연산에 필요한 가중치만 빠른 메모리로 옮긴다.
MoE(전문가 혼합 모델) 구조를 보면 이 차이가 더 잘 드러난다. MoE는 모델 안을 여러 개의 작은 "전문가" 묶음으로 나눠 두고, 질문에 맞는 전문가만 골라 계산하는 방식이다. 질문마다 일부 전문가만 실행하지만, 어떤 전문가가 필요할지는 입력마다 달라진다. "일부만 실행한다"가 "일부만 저장해두면 된다"는 뜻은 아니다. 전체 가중치는 어딘가에 항상 보관돼 있어야 한다.
낸드 저장 수요를 키우는 세 방향
- 모델이 커질수록 저장할 가중치가 늘어난다.
- 사용자와 컨텍스트(AI가 한 번에 참고하는 대화·문서의 분량)가 늘면서 캐시도 커진다. 캐시는 다시 쓸 데이터를 가까운 곳에 잠시 붙들어 두는 임시 저장 공간이다.
- 텍스트에서 이미지·영상·에이전트(스스로 여러 단계 작업을 수행하는 AI)로 영역이 넓어지며 입출력 데이터 자체가 무거워진다.
여기에 학습 데이터, 체크포인트(학습 도중 중간 상태를 저장해 둔 파일), RAG 문서(AI가 답하기 전에 찾아보는 외부 자료), 벡터DB(문서를 숫자 목록으로 바꿔 비슷한 내용을 빨리 찾게 해주는 데이터베이스)까지 붙는다. 다만 이 데이터가 전부 영구 보관되는 건 아니다. 짧게 쓰고 사라지거나 잠시 보관 후 폐기되는 데이터도 많다.
기업용 SSD 시장 수치로 보는 변화
기업용 SSD 매출 86.1% 증가
2026년 1분기 상위 5개 기업용 SSD 업체 매출은 184억 6천만 달러. 전분기보다 86.1% 늘었다. AI 에이전트 서비스가 확대되면서 클라우드 사업자(아마존·마이크로소프트·구글처럼 서버를 빌려주는 회사)들의 조달 수요가 몰린 결과다.
마이크론 245TB, 그리고 비트 출하량
마이크론은 2026년 5월 245TB 데이터센터 SSD 출하를 시작했다. 용도는 AI 데이터 레이크(가공 전 데이터를 한곳에 대량으로 모아두는 저장소), 클라우드, 대규모 오브젝트 스토리지(사진·영상 같은 파일을 통째로 대량 보관하는 저장 방식)다.
여기서 "비트 출하량"이라는 개념이 중요해진다. 제품 개수가 아니라 실제로 팔려 나간 저장 용량의 총합을 말한다. 8TB SSD 100만 개와 30TB SSD 100만 개는 판매 대수는 같아도 실제 소비되는 낸드 양은 전혀 다르다. 기업용 SSD의 평균 용량이 오르기만 해도 필요한 낸드 총량이 커질 수 있다.
데이터센터의 랙(서버를 층층이 꽂는 철제 선반) 공간과 전력, 냉각은 제한돼 있다. SSD 슬롯을 늘리기보다 장치당 저장 밀도를 높이는 쪽이 선호되는 이유다.
삼성 PM1763, 속도도 문제다
삼성 PM1763(PCIe 6.0 기반 기업용 SSD, 2026년 7월 양산 시작)은 16TB 모델 기준 최대 순차읽기 28.4GB/s급을 낸다. PCIe는 SSD 같은 장치를 컴퓨터에 연결하는 고속 통로 규격이고, 숫자가 클수록 최신·고속이다. 순차읽기는 큰 파일을 처음부터 끝까지 이어서 읽는 속도를 말한다.
삼성 설명대로면 40GB 크기 LLM(챗GPT 같은 대규모 언어 모델)을 약 1.4초에 전송할 수 있는 속도다. 원문 표기가 일부 중복돼 있어 정확한 수치는 초당 28GB대로만 이해하면 된다. 실제 AI 서비스 성능이 순차읽기 속도 하나로 결정되는 건 아니다.
KV캐시·HBF·Z-NAND, 낸드가 연산 쪽으로 가까워진다
여기서 KV캐시는 모델이 앞서 읽은 문맥을 매번 다시 계산하지 않으려고 붙들어 두는 중간 결과다. 대화가 길어질수록, 동시 사용자가 늘어날수록 이 캐시가 비싼 GPU 메모리를 차지한다. 저장 계층을 넓히려는 시도가 여기서 나온다.
- CMX: (문맥상 엔비디아로 추정) CMX는 LLM의 KV캐시를 NVMe SSD(PCIe 통로로 연결되는 고속 SSD) 기반 플래시 계층까지 확장해 저장하고 재활용한다. 비싼 GPU 메모리에만 의존하지 않도록 메모리 범위를 넓히는 방식이다.
- HBF: HBF(High Bandwidth Flash, SK하이닉스·샌디스크)는 낸드 기반이면서 기존 SSD보다 높은 대역폭을 노린다. 대역폭은 한 번에 주고받을 수 있는 데이터의 양, 즉 통로의 폭이다. HBM과 SSD 사이에 새로운 메모리 계층을 만드는 접근이다.
- Z-NAND: 삼성 Z-NAND도 또 하나의 방향이다. 원문은 이름만 스치고 지나가는데, Z-NAND는 셀 하나에 1비트만 담는 SLC 방식과 전용 컨트롤러 설계로 읽기 지연을 일반 낸드보다 크게 줄인 제품군이다. 셀은 데이터를 담는 가장 작은 칸이고, 한 칸에 적게 담을수록 읽고 쓰기가 빠르고 튼튼하지만 같은 칩에 담을 수 있는 용량은 줄어든다. 컨트롤러는 SSD 안에서 데이터 읽기·쓰기를 지휘하는 칩이다. 용량당 가격이 비싸지므로 대용량 저장이 아니라 DRAM과 일반 SSD 사이의 빠른 계층, 즉 캐시나 자주 읽는 데이터를 두는 자리를 노린다.
공통점은 하나다. 낸드를 멀리 떨어진 저장 창고로만 두지 않고, AI가 필요할 때 빠르게 꺼낼 수 있는 위치까지 끌어올리는 것.
개인 기기에서도 같은 흐름 — 애플 AFM3
2026년 6월 공개된 애플의 AI 모델 AFM3 중 AFM3 Core Advanced는 총 200억 파라미터 규모다. 요청 1건당 활성화되는 파라미터는 약 10억에서 40억 개뿐이다. 활성화되는 전문가가 입력마다 달라지기 때문에 일부만 기기에 저장해두는 방식은 통하지 않는다. 그래서 애플은 전체 모델 가중치를 기기 플래시 스토리지에 저장하고, 프롬프트(사용자가 AI에 넣는 요청문)가 들어오면 필요한 전문가 가중치만 메모리로 불러온다.
AI는 답을 토큰(글자 조각) 단위로 하나씩 만들어 낸다. 매 토큰마다 전문가를 바꾸면 플래시 접근이 잦아진다. 애플은 프롬프트 단위로 필요한 전문가 집합을 고르고, 생성 기간 동안 그 구성을 유지하는 방식으로 가중치 이동 자체를 줄였다. 여기에 적용된 것이 IFP(Instruction Following Pruning)다. 프루닝은 모델에서 당장 필요 없는 부분을 잘라내 가볍게 쓰는 기법이다. 낸드의 물리적 한계에 맞춰 모델 동작 방식 자체를 조정한 사례다.
스마트폰 저장장치 UFS 5.0도 같은 방향
삼성 UFS 5.0은 순차읽기 속도를 끌어올렸다. UFS는 스마트폰에 들어가는 낸드 저장장치 규격이다. 원문 자막에는 수치가 "10.8GB/s"와 "8GB/s"로 혼재돼 있어 정확한 확정값은 확인하기 어렵다. 다만 온디바이스 AI(인터넷 서버를 거치지 않고 기기 안에서 바로 돌아가는 AI)에서 모델과 데이터를 메모리로 빠르게 옮기는 용도를 전면에 내세운다는 방향성은 분명하다. 애플 AFM3가 삼성 UFS 5.0을 쓴다는 뜻은 아니다. 화자는 둘을 명시적으로 별개 사례로 구분한다.
HBM·DRAM·낸드, AI 메모리 계층 한눈에 보기
| 계층 | 맡는 일 | 특징 |
|---|---|---|
| HBM | GPU가 당장 계산할 데이터 | 가장 빠르다 |
| DRAM | 넓은 작업 공간 | 컴퓨터의 일반 메모리(램), 전원이 꺼지면 지워진다 |
| NAND(낸드) | 크고 오래 보관해야 하는 모델과 데이터 | 전원이 꺼져도 남는다 |
GPU가 당장 계산할 데이터는 HBM이 맡는다. 가장 빠르다. 넓은 작업 공간은 DRAM이 맡는다. 크고 오래 보관해야 하는 모델과 데이터는 NAND의 몫이다. 낸드가 HBM을 대체하는 게 아니라, HBM·DRAM·NAND가 서로 다른 역할을 맡는 계층 구조 자체가 중요해지고 있다.
앞으로 AI 메모리를 볼 때는 HBM 증설과 가격만 볼 게 아니다. 계속 커지는 모델과 데이터를 받아주는 낸드, 기업용 SSD 쪽 사이클도 함께 봐야 한다.
자주 묻는 질문
AI 때문에 낸드 수요가 왜 늘어나나요?
AI 모델과 그 주변 데이터를 담아둘 곳이 낸드이기 때문이다. 모델이 커질수록 저장할 가중치가 늘고, 사용자가 많아질수록 캐시가 커지며, 이미지·영상으로 영역이 넓어질수록 데이터 자체가 무거워진다. 다만 모든 데이터가 영구 보관되는 것은 아니어서, 수요가 데이터 증가량만큼 그대로 늘어난다고 보기는 어렵다.
낸드플래시와 HBM은 뭐가 다른가요?
HBM은 GPU 옆에서 계산할 데이터를 아주 빠르게 공급하는 메모리이고, 전원이 꺼지면 내용이 사라진다. 낸드플래시는 속도는 느리지만 값이 싸고 전원이 꺼져도 데이터가 남는 저장용 메모리다. 그래서 모델 전체는 낸드에 보관하고, 당장 계산할 부분만 HBM으로 옮겨 쓴다.
낸드가 HBM을 대체하게 되나요?
대체하는 관계가 아니다. HBM은 속도, DRAM은 작업 공간, 낸드는 대용량 보관을 맡는 식으로 역할이 나뉜다. HBF나 Z-NAND처럼 낸드를 더 빠르게 만들려는 시도도 HBM 자리를 빼앗기보다 HBM과 SSD 사이에 새 계층을 만드는 쪽에 가깝다.
KV캐시는 무엇인가요?
AI가 대화에서 앞서 읽은 내용을 매번 다시 계산하지 않도록 저장해 두는 중간 결과다. 대화가 길어지고 동시 사용자가 늘수록 커져서 비싼 GPU 메모리를 많이 차지한다. CMX처럼 이 캐시를 SSD까지 넓혀 저장하려는 방식이 나오는 이유다.
기업용 SSD는 일반 SSD와 어떻게 다른가요?
기업용 SSD(eSSD)는 서버와 데이터센터에서 쉬지 않고 돌아가도록 만든 SSD다. 일반 PC용보다 용량이 훨씬 크고 속도와 내구성을 높인 제품이 많다. 이 글에 나온 마이크론 245TB 제품이나 삼성 PM1763이 여기에 속한다. 가격과 세부 사양은 제조사 공식 자료로 확인하는 것이 정확하다.
이 글은 자막 기반(빠른 모드)으로 정리했다. 화면 판독 없이 발화 내용만 근거로 삼았다.
원본 영상: youtu.be/…