
“GPU가 AI 인프라의 중심이던 시절일 때 AI-NIC(네트워크 인터페이스 카드), DPU(데이터 처리 장치)의 핵심 역량은 여러 GPU가 동시에 학습을 수행할 때 발생하는 전체 데이터 병합(All-Reduce)과 결과 배포(Broadcast), 집계 통신(Collective Communication)을 얼마나 가속화하는가에 달려있었다. 하지만 장문맥과 다단계 추론을 반복하는 에이전틱 AI가 확산하면서 지금은 GPU, 네트워크로 연결된 대규모 공유 저장장치를 얼마나 가속할 수 있는지, CPU에 가해지는 부담을 얼마나 DPU로 잘 분산, 적재하는지가 새로운 경쟁의 축으로 부상하고 있다”에이전틱 AI와 장문맥 추론은 AI 인프라 시장에서 새로운 인터페이스 수요를 만들어내고 있다. 대형언어모델(LLM) 추론 작업은 단순한 요청 및 응답 중심이라면 AI 에이전트는 여러 차례 모델을 호출하고, 도구를 사용하며 과거 문맥을 다시 참조한다. 이에 따라 KV캐시(Key Value)가 GPU 메