로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
中유학생 살해 피의자, 피해자 시신 일부 훼손해 유기(종합)
N
[실시간뉴스]
청년·1주택자 세금 낮추고 초고가 주택은 더 '주거안정 총력전'(종합)
N
[실시간뉴스]
안철수 "당원, 쓰고 버리는 휴지 아냐" vs 한지아 "국민 향해야"(종합)
N
[IT뉴스]
SK AX, SAP와 AI 협력 강화…“기업 운영 전반에 에이전틱 AI 활용”
N
[IT뉴스]
경기도, 판교에서 국내 최초 '도심지 공유차량 배송·회수형 원격운전 서비스' 실증
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스][AI는 지금] GPU만 빠르면 끝?…AI 에이전트 시대, '추론 SW'가 판 바꾼다
온카뱅크관리자
조회:
8
2026-08-26 09:27:25
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">엔비디아 루빈·GB300, 에이전틱 AI서 성능 격차…KV 캐시·라우팅 등 SW 최적화 중요성 부각</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="p43EYYx2kC"> <p contents-hash="788ed19e47fe5dd6aecd44ce4f87d280bcf7885976142d9800e6527b7bdffc0e" dmcf-pid="UWE2LLZvcI" dmcf-ptype="general">(지디넷코리아=장유미 기자)인공지능(AI) 에이전트 확산으로 AI 인프라 경쟁의 무게중심이 그래픽처리장치(GPU) 연산 성능에서 추론 소프트웨어와 서빙 시스템 전반으로 넓어지고 있다. 대화형 AI보다 훨씬 긴 컨텍스트를 유지하고 도구 호출과 반복 추론을 수행하는 AI 에이전트가 늘면서 KV 캐시 관리와 요청 스케줄링, 모델 병렬화 같은 소프트웨어 기술이 실제 서비스 성능과 비용을 좌우하는 요소로 떠오르고 있다.</p> <p contents-hash="7c74e9b5e87c51c4af9e73683fcae850199b9f5c65eb5d238bd58e24762a6604" dmcf-pid="uYDVoo5ToO" dmcf-ptype="general">26일 엔비디아에 따르면 차세대 AI 시스템 '베라 루빈 NVL72'는 세미애널리시스의 에이전틱 AI 벤치마크 '에이전트X'를 이용한 자체 시험에서 GB300 NVL72보다 메가와트당 AI 처리량이 최대 30배 높았다. 이번 수치는 엔비디아가 측정한 프리뷰 결과로, 현재 세미애널리시스의 검토를 기다리고 있다.</p> <p contents-hash="efe9153dff6e667387a26e60727ec4436d7e7474dbf8b9c67b53f9d750559358" dmcf-pid="7Gwfgg1yks" dmcf-ptype="general">현재 세대인 GB300 NVL72에서도 성능 격차가 확인됐다. 딥시크 V4 프로 1.6T를 구동했을 때 H200 NVL8 대비 메가와트당 처리량이 최대 15배 높았으며, 키미 K3 2.8T에서는 비슷한 인터랙티브 성능을 기준으로 최대 80배까지 격차가 벌어졌다. 엔비디아는 GB300 NVL72를 사용할 경우 일부 조건에서 H200 NVL8보다 100만 토큰당 비용도 최대 10분의 1 수준으로 낮출 수 있다고 설명했다.</p> <figure class="figure_frm origin_fig" contents-hash="20ab00e7130ca92890f1340eab8289c00f71393b5890366dad566ce793df9ec2" dmcf-pid="zHr4aatWam" dmcf-ptype="figure"> <p class="link_figure"><img alt="(이미지=엔비디아)" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/26/ZDNetKorea/20260826091952572llqr.jpg" data-org-width="640" dmcf-mid="VGpwHHRfau" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/26/ZDNetKorea/20260826091952572llqr.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> (이미지=엔비디아) </figcaption> </figure> <p contents-hash="451c57df2cd2fc6721bbb241515530e6c2efa62a8ee1a3ce2462040ce76ab0e0" dmcf-pid="qXm8NNFYNr" dmcf-ptype="general">이번 결과에서 주목할 부분은 GPU 세대별 연산 성능 차이만은 아니다. 에이전트X가 기존 AI 벤치마크와 달리 실제 코딩 에이전트가 작동하는 방식을 재현하면서 AI 소프트웨어의 역할을 성능 평가에 본격적으로 끌어들였기 때문이다.</p> <p contents-hash="ff431ba753bdda034fa4241e79cb033a39cb206390ebd21bc85f9a5a494d4f7f" dmcf-pid="BZs6jj3GAw" dmcf-ptype="general">기존 추론 벤치마크는 8K 입력과 1K 출력처럼 길이가 정해진 요청을 반복해 GPU의 처리 성능을 측정하는 경우가 많았다. AI 에이전트는 이전 작업을 기억하면서 컨텍스트가 계속 길어지고 추론 도중 외부 도구를 호출하거나 다른 에이전트에 작업을 넘기기도 한다. </p> <p contents-hash="9cf8a5799d9c9f3b5edb33b1c82e6394b7ed723945cfb00c52b4e0bf050c60d0" dmcf-pid="b5OPAA0HND" dmcf-ptype="general">이를 두고 세미애널리시스는 "장문·멀티턴·높은 프리픽스 재사용과 서브에이전트 실행이 실제 AI 서비스 트래픽에서 중요해졌다"며 "그러면서 고정 길이 평가만으로 하드웨어와 소프트웨어 성능을 측정하기 어려워졌다"고 설명했다.</p> <p contents-hash="9ddbd9f8ad3eb2883b2c200b118e71da097e4c01ae62238a36693bd5161ab514" dmcf-pid="K1IQccpXkE" dmcf-ptype="general">에이전트X는 이를 반영해 실제 클로드 코드 세션에서 발생한 요청 패턴을 재생한다. 턴이 진행될수록 컨텍스트가 누적되는 과정뿐 아니라 도구 호출로 모델이 대기하는 시간까지 반영하고 여러 에이전트가 동시에 작동할 때 처리량과 응답 속도가 어떻게 변하는지도 측정한다.</p> <p contents-hash="00545b009fea8a44e6823bf4e2a755a3402c3cc9f972de13638cb974f7f38673" dmcf-pid="9cxZ99rNok" dmcf-ptype="general">이에 따라 GPU 자체의 연산 속도뿐 아니라 추론 엔진과 캐시, 라우터가 얼마나 효율적으로 움직이는지가 결과에 영향을 미친다. 세미애널리시스는 에이전트X를 이용한 최적화 과정에서 vLLM의 프리픽스 캐시 적중률이 일부 조건에서 95%를 넘었으며 CPU로 KV 캐시를 오프로딩하는 방식에서는 재연산 대비 출력 처리량이 81.7% 높아진 사례도 공개했다.</p> <p contents-hash="1a3a691187058eb18986007d97585922e48ba8d2f42e546afe80d2f3034d0add" dmcf-pid="2kM522mjAc" dmcf-ptype="general">세미애널리시스는 "실제 환경은 멀티턴·긴 컨텍스트와 높은 프리필 재사용, 서브에이전트 실행과 수많은 도구 호출로 구성된다"고 설명했다.</p> <p contents-hash="7544d1b808030d57e5319f716143705a105027f9c59542a57424a8d587d6e0fc" dmcf-pid="VER1VVsAgA" dmcf-ptype="general">이번 일로 AI 소프트웨어 업체에도 향후 변화가 예상된다. 기존에는 쿠다(CUDA) 같은 GPU 프로그래밍 플랫폼과 vLLM·SGLang·텐서RT-LLM 등 추론 엔진의 연산 최적화가 주요 경쟁 영역이었다면, 에이전틱 AI에선 여러 소프트웨어 계층을 하나의 시스템으로 묶어 운영하는 능력이 중요해지고 있어서다.</p> <p contents-hash="f8636403c5802b7d8d6dfd563d58b600c9c70fbb7cb914665ab9ef89c4ecde26" dmcf-pid="fDetffOcaj" dmcf-ptype="general">특히 KV 캐시 관리가 핵심으로 부상하고 있다는 점은 눈여겨 볼 요소다. AI 에이전트가 작업을 수행할 때 이전 컨텍스트를 반복해서 다시 계산하지 않고 캐시에 저장된 데이터를 활용하면 GPU 연산량과 응답 시간을 줄일 수 있어서다. 반대로 동시에 많은 에이전트가 움직이면서 캐시를 제대로 관리하지 못하면 필요한 정보를 삭제하거나 같은 내용을 다시 계산하면서 GPU를 추가해도 성능이 충분히 나오지 않을 수 있다.</p> <p contents-hash="e5eed9fd6996611a4f55ca42657bf5d03a2c8304d3dfcb4625618908a91cc195" dmcf-pid="4wdF44IkNN" dmcf-ptype="general">요청을 적절한 GPU로 배분하는 라우터와 스케줄러의 역할도 커지고 있다. 세미애널리시스의 에이전트X 시험에서는 엔비디아 추론 오케스트레이션 소프트웨어 '다이나모'의 라우팅 방식을 개선한 뒤 일부 조건에서 출력 처리량이 22.2% 증가했다. 다른 최적화에선 에이전트 세션 재생 시간이 20% 이상 단축됐다. 이는 하드웨어 교체 없이 소프트웨어 최적화만으로도 에이전틱 AI 추론 효율을 끌어올릴 수 있다는 점이 확인된 것으로 평가된다.</p> <figure class="figure_frm origin_fig" contents-hash="75fbd6ac09951e09a77fcbc58c15682595e607bcb44a93f3e4b6a65f7a0b4b01" dmcf-pid="8rJ388CENa" dmcf-ptype="figure"> <p class="link_figure"><img alt="GB300 NVL72는 8K ISL / 1K OSL 딥시크 R1 0528 테스트에서 더 넓은 인터랙티브 성능 범위에 걸쳐 H200 대비 전체 유틸리티 전력 기준 메가와트당 더 높은 토큰 처리량을 제공한다. (그래프=엔비디아)" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/26/ZDNetKorea/20260826091954098gyxr.png" data-org-width="639" dmcf-mid="YyQXKKwaAX" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/26/ZDNetKorea/20260826091954098gyxr.png" width="658"></p> <figcaption class="txt_caption default_figure"> GB300 NVL72는 8K ISL / 1K OSL 딥시크 R1 0528 테스트에서 더 넓은 인터랙티브 성능 범위에 걸쳐 H200 대비 전체 유틸리티 전력 기준 메가와트당 더 높은 토큰 처리량을 제공한다. (그래프=엔비디아) </figcaption> </figure> <p contents-hash="7387c0ef028aabd1fa3f547c6f227461ba2f3408b837397a0e4e3bae702b6e69" dmcf-pid="6mi066hDgg" dmcf-ptype="general">엔비디아도 이런 변화에 맞춰 하드웨어와 소프트웨어를 함께 묶는 전략을 강화하고 있다. GB300 NVL72의 72개 GPU를 NV링크로 연결하고 다이나모를 통해 프리필과 디코드 작업을 나누는 동시에 KV 캐시 상태와 서버 부하를 고려해 요청을 배분하는 방식이다. 이를 통해 엔비디아는 SGLang·vLLM·텐서RT-LLM과 MoE 최적화 기술까지 결합해 GPU 한 장의 성능보다 랙 단위 추론 효율을 높이는 데 초점을 두고 있다.</p> <p contents-hash="6d236f530ad5c028d5b66491fdc8a6fb8d91c041ed8929716c1d0f5c7267ec4d" dmcf-pid="PsnpPPlwao" dmcf-ptype="general">이에 따라 클라우드와 AI 서비스 사업자의 인프라 투자 기준도 달라질 가능성이 있다. 에이전트가 일반 챗봇보다 더 많은 토큰과 컴퓨팅 자원을 사용하는 만큼, GPU 도입 가격뿐 아니라 동일한 전력에서 얼마나 많은 사용자와 에이전트를 동시에 처리할 수 있는지가 서비스 비용을 좌우할 수 있어서다. 에이전트X도 초당 토큰 수에 더해 첫 토큰 생성 시간과 전체 지연시간, 사용자당 인터랙티브 성능, 메가와트당 처리량을 함께 평가하도록 설계됐다.</p> <p contents-hash="2c662d421f3ab4831308e3ae041cc43957fd58511b8e1ce130c1d92d6cfe0e84" dmcf-pid="QOLUQQSroL" dmcf-ptype="general">세미애널리시스는 추론 엔진과 라우터, KV 캐시 관리자, 데이터 전송 라이브러리, 클러스터 제어기가 서로 연동되는 구조를 새로운 AI 추론 환경의 핵심으로 보고 있다. 엔비디아 다이나모뿐 아니라 레드햇의 llm-d, AMD 인페라 등도 여러 추론 소프트웨어를 묶어 분산형 AI 시스템을 운영하는 방향으로 개발되고 있다.</p> <p contents-hash="3ed17c8c7c226a051da1051db48152a509a187a22d02f6ddfb20fb23d88f25db" dmcf-pid="xIouxxvmjn" dmcf-ptype="general">세미애널리시스는 "에이전틱 추론은 칩이나 커널 수준의 문제가 아니라 시스템 전체의 문제"라고 강조했다.</p> <p contents-hash="1f24b25836fc4bd80790aff5e0c6051828509d9eebd0492bd48e82651117f87c" dmcf-pid="yzYLII9Uai" dmcf-ptype="general">장유미 기자(sweet@zdnet.co.kr)</p> </section> </div> <p class="" data-translation="true">Copyright © 지디넷코리아. 무단전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기