AI 서버라고 하면 거대한 GPU부터 떠올리기 쉽습니다.
그러나 에이전트 AI(Agentic AI, 목표를 받아 여러 모델·도구·데이터를 순차적으로 활용하는 인공지능)는 한 번의 행렬 연산으로 끝나지 않습니다.
사용자의 요청을 해석하고, 필요한 데이터를 저장장치에서 읽고, 검색이나 외부 도구를 호출한 뒤, 여러 추론 결과를 다음 단계로 넘겨야 합니다.
이때 GPU가 대규모 병렬 연산을 수행한다면 CPU는 데이터 준비, 작업 배분, 분기 판단, 네트워크·저장장치 입출력을 조정합니다.
에이전트가 많아질수록 이런 작고 서로 다른 작업도 동시에 늘어납니다.
CPU가 다시 주목받는 이유는 GPU를 밀어내기 때문이 아니라, GPU가 쉬지 않고 계산하도록 앞뒤의 흐름을 정리하는 일이 커졌기 때문입니다.
에이전트 AI가 CPU를 다시 부르는 이유
인텔은 2026년 6월 2일 립부 탄 CEO의 기조연설을 통해 AI PC, 엣지, 데이터센터, 클라우드를 잇는 통합 AI 컴퓨팅 전략과 개방형 생태계를 강조했습니다.(1) 이 맥락에서 소개된 Xeon 6+는 288개 E코어와 576MB L3 캐시를 탑재한 서버 프로세서입니다.(2) 숫자의 핵심은 단일 작업의 최고 속도보다 '많은 요청을 얼마나 촘촘하게 처리할 것인가'에 있습니다.
288개 E코어와 576MB L3 캐시
E코어(Efficient Core, 면적과 전력 효율을 중시한 처리 코어)는 상대적으로 작은 코어를 많이 배치해 동시 처리 밀도를 높이는 설계입니다.
288개라는 구성은 에이전트별 세션 관리, 데이터 전처리, API 호출, 컨테이너 운영처럼 수많은 독립 작업을 병렬로 소화하려는 방향을 보여줍니다.
식당으로 비유하면 한 명의 초대형 조리사에게 모든 주문을 맡기기보다, 여러 조리대가 각기 다른 주문을 동시에 처리하는 방식에 가깝습니다.
인텔은 Xeon 6+의 이 구성을 AI 워크플로에 필요한 컴퓨팅 밀도와 효율을 높이는 사양으로 제시했습니다.(2)
L3 캐시(Level 3 Cache, 여러 코어가 공유하는 고속 임시 저장공간)는 주메모리보다 CPU 가까이에 자주 쓰는 데이터를 보관합니다.
576MB L3 캐시는 많은 코어가 공통 코드와 작업 상태를 반복해서 읽을 때 먼 주메모리까지 왕복하는 부담을 줄이려는 장치입니다.(2) 다만 큰 창고가 있다고 물류가 자동으로 빨라지는 것은 아닙니다.
코어 수, 캐시 용량, 메모리 대역폭, 소프트웨어 스케줄링이 함께 맞아야 실제 처리량이 나옵니다.
따라서 288개와 576MB는 고밀도 동시 처리를 겨냥한 '설계 방향'을 알려주지만, 실제 성능이나 전력 효율의 우위를 곧바로 증명하지는 않습니다.
한 랙에서 나뉘는 CPU와 GPU의 일
랙스케일(Rack-scale, 서버 한 대가 아니라 랙 전체의 CPU·GPU·메모리·네트워크를 하나의 시스템처럼 설계하는 방식)에서는 부품별 역할 분담이 중요합니다.
GPU는 대규모 행렬 계산과 모델 추론처럼 같은 연산을 대량으로 반복하는 데 강합니다.
CPU는 운영체제와 애플리케이션을 실행하고, 입력을 정리하며, GPU에 작업을 전달하고, 결과를 후처리합니다.
에이전트 AI에서는 오케스트레이션(Orchestration, 모델·도구·데이터의 실행 순서와 자원을 조율하는 과정)과 입출력이 빈번해져 CPU 측 처리량도 병목이 될 수 있습니다.
예를 들어 고객 문의 에이전트가 주문 데이터베이스를 조회하고, 문서를 검색한 뒤, GPU에서 답변을 생성하고, 결제 도구 호출 여부를 판단한다고 가정할 수 있습니다.
GPU는 답변 생성의 핵심 연산을 맡지만 CPU는 인증, 검색 결과 정리, 네트워크 통신, 도구 실행, 로그 기록을 이어 붙입니다.
관련 발표 자료에는 에이전트 AI 확산으로 CPU와 GPU 구성비가 기존 1대8에서 1대1 수준으로 변할 수 있다는 전망도 담겼습니다.(2) 다만 이는 특정 발표에서 제시된 방향성이지 업계 전체의 확정 평균이나 표준은 아닙니다.
중요한 변화는 비율 자체가 아니라, GPU 수만 늘리는 설계로는 전체 워크플로의 지연시간과 처리량을 해결하기 어렵다는 점입니다.
Falcon Shores 이후 달라진 경쟁 축
인텔은 2025년 출시를 계획했던 GPU 기반 AI 가속기 Falcon Shores(팰콘 쇼어)를 외부 판매 제품이 아닌 내부 테스트용으로 전환했습니다.(3) 이 사건을 가속기 사업의 완전 철수로 확대해석할 수는 없습니다.
다만 2026년 발표가 Xeon 6+와 개방형 생태계, 시스템 전반의 연결을 강조했다는 점을 함께 보면, 인텔의 경쟁 무게중심이 독립 GPU 한 제품의 정면 승부에서 CPU와 서버 플랫폼의 기반 역할로 이동했다고 해석할 수 있습니다.(1)(2)
여기서 NVIDIA와 AMD는 단순히 제거해야 할 상대가 아닙니다.
데이터센터 고객은 가속기만 구매하는 것이 아니라 CPU, GPU, 메모리, 네트워크, 저장장치와 소프트웨어를 묶어 랙 전체를 운영합니다.
Xeon 6+의 산업적 승부처는 NVIDIA·AMD 가속기를 대체하는 것이 아니라, 어떤 가속기와 연결되더라도 데이터 준비와 제어, 입출력, 추론 보조를 높은 밀도로 맡는 플랫폼 층입니다.
즉 AI 반도체 경쟁은 'CPU 대 GPU'의 한 줄짜리 대결이 아니라, 계산을 맡는 가속기와 시스템을 움직이는 호스트 CPU를 누가 더 효율적으로 결합하느냐의 경쟁으로 넓어지고 있습니다.
발표 사양과 실제 성능을 가르는 기준
Xeon 6+ 발표에서 확실히 읽을 수 있는 것은 세 가지입니다.
첫째, 288개 E코어는 다수의 동시 작업을 수용하는 처리 밀도를 지향합니다.
둘째, 576MB L3 캐시는 여러 코어가 자주 쓰는 데이터에 더 가깝게 접근하도록 설계됐습니다.
셋째, 인텔은 이를 에이전트 AI와 랙스케일 시스템에서 CPU의 역할을 키우는 전략으로 제시했습니다.(2)
반대로 실제 구매와 경쟁력을 판단하려면 독립 벤치마크가 필요합니다.
확인할 항목은 에이전트 동시 접속 수에 따른 처리량, 요청당 지연시간, 서버 전체 소비전력, 메모리·네트워크 병목, NVIDIA·AMD 가속기와 결합했을 때의 안정성입니다.
코어가 많아도 소프트웨어가 작업을 고르게 나누지 못하면 자원이 놀 수 있고, 캐시가 커도 데이터 패턴이 맞지 않으면 효과가 제한됩니다.
정식 판매 시점, 가격, 세부 SKU와 고객 공급 일정도 공개된 사양만으로 판단할 수 없습니다.
결국 Xeon 6+는 CPU가 GPU를 대신한다는 선언이 아닙니다.
에이전트 AI가 모델 계산뿐 아니라 검색, 도구 호출, 데이터 이동, 제어를 대량으로 발생시키면서 서버의 '조정 능력'이 새로운 병목으로 떠올랐다는 신호에 가깝습니다.
288개 E코어와 576MB L3 캐시는 그 문제를 고밀도 CPU로 풀겠다는 인텔의 설계 답안입니다.
이 답안이 NVIDIA·AMD 생태계와 결합된 실제 랙에서 성능과 전력 효율로 이어지는지는 독립 측정 결과가 말해줄 부분입니다.
