로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
히로시마 평화기념식 참석한 다카이치 "비핵 3원칙 견지 중"(종합)
N
[실시간뉴스]
서울 ‘37.9도’ 올 들어 최고…강원 첫 폭염중대경보
N
[실시간뉴스]
[경제 포커스] 기록적 폭염에 ‘히트 플레이션’… 오이·시금치 값 2배 가까이로 뛰었다
N
[실시간뉴스]
[시대리포트]27년째 미뤄진 '조건부 석방', 검찰개혁에 또 밀려
N
[IT뉴스]
삼성 상위 7%의 비밀 '특별인센'…하이닉스 블랙홀 막을까
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스]독자 AI 파운데이션 2차 평가 임박··· 각 모델 별 기술로 살펴본 승부수는?
온카뱅크관리자
조회:
5
2026-08-06 16:37:31
<div id="layerTranslateNotice" style="display:none;"></div> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="bQjx5TyOrf"> <p contents-hash="0eb7d66496a1e92b77ef8291178d781b50da1afff17b96a6159a7e2f38d9957b" dmcf-pid="KxAM1yWIIV" dmcf-ptype="general">[IT동아 남시현 기자] 2025년 8월 시작된 ‘독자 AI 파운데이션(이하 독파모)’ 사업이 2차 평가를 눈앞에 두고 있다. 독파모 사업은 해외 거대 AI 모델 의존에서 벗어나 한국만의 AI 주권을 확보하고, 국내 산업 인프라 및 AI 생태계 지원을 목표로 시작했다. 1차 평가에서는 모델의 독자성과 언어모델의 구성을 집중적으로 검증했으며 업스테이지, LG AI 연구원, NC AI, 네이버클라우드, SK텔레콤 중 NC AI, 네이버클라우드 두 개 기업이 고배를 마셨다. 이후 2차 평가에서는 모티프테크놀로지가 기술 독자성을 인정받아 새롭게 합류했으며 6개월 간의 여정을 마치고 이제 막 평가를 기다리는 상황이다. </p> <figure class="figure_frm origin_fig" contents-hash="76d7acc8b524982752c74d6326a843690a6732c21805ba6007d2e3aeb545c923" dmcf-pid="9McRtWYCD2" dmcf-ptype="figure"> <p class="link_figure"><img alt="독자 AI 파운데이션 사업은 5개 컨소시엄으로 시작해 2개가 탈락하고, 다시 1개 컨소시엄이 합류해 현재 4파전을 벌이고 있다. 8월 중에 1개 컨소시엄이 탈락하고 올해 12월 중 추가로 탈락해 2개만 남는다 / 출처=제미나이 이미지 생성" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162701698qvym.jpg" data-org-width="1000" dmcf-mid="XJ4FEogRro" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162701698qvym.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 독자 AI 파운데이션 사업은 5개 컨소시엄으로 시작해 2개가 탈락하고, 다시 1개 컨소시엄이 합류해 현재 4파전을 벌이고 있다. 8월 중에 1개 컨소시엄이 탈락하고 올해 12월 중 추가로 탈락해 2개만 남는다 / 출처=제미나이 이미지 생성 </figcaption> </figure> <p contents-hash="d4f62476b9bdaf208d9c94b88b73e895006f69a86176416db56e68fc5d5a0f29" dmcf-pid="2RkeFYGhs9" dmcf-ptype="general">우리 정부는 글로벌 프런티어 모델의 95%에 가까운 성능을 달성할 것을 목표로 설정했으며, 1차 평가에서 언어 모델 2차 평가에서 멀티모달 모델, 3차 평가에서 액션 모델로 구체적인 모델 구성을 잡았다. 이에 따라 2차 평가는 대형언어모델의 성능뿐만 아니라 산업 현장에서 에이전트 AI 활용 방안, 그리고 텍스트, 이미지, 비디오 등 다양한 형태의 데이터를 동시에 인식하고 결합하는 멀티모달 기술의 성능 평가를 집중적으로 진행할 예정이다. 보고서 및 제출이 완료된 현재 시점에서 공개된 기술 보고서와 정보를 조합해 각 모델 구성을 살펴봤다.</p> <h3 contents-hash="4e6d41f8e336de4ff7599fa2891bae21a96ee982c48a460313d7e1c61de302b0" dmcf-pid="VeEd3GHlIK" dmcf-ptype="h3">업스테이지 솔라 오픈 2, AI 에이전트 성능 대폭 강화</h3> <figure class="figure_frm origin_fig" contents-hash="91c233ac0a9e2862246ba8b99fa3a0b32bc0677f3a21f41a2f4eea82ccca4af0" dmcf-pid="fdDJ0HXSEb" dmcf-ptype="figure"> <p class="link_figure"><img alt="업스테이지의 솔라 오픈 2, 총 2500억 개의 매개변수가 적용됐다 / 출처=업스테이지" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162702923vlzy.jpg" data-org-width="1000" dmcf-mid="ZYxusAcnwL" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162702923vlzy.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 업스테이지의 솔라 오픈 2, 총 2500억 개의 매개변수가 적용됐다 / 출처=업스테이지 </figcaption> </figure> <p contents-hash="5f9f7a7fb3c6a3d10133871381c2fc37dd3c2b1f1cca29844beb4f3fdb6226d1" dmcf-pid="4JwipXZvmB" dmcf-ptype="general">업스테이지 솔라 오픈 2는 전작의 1020억 개 매개변수를 두 배 이상인 총 2500억 개(250B)로 구성한 모델이다. 실제 연산 시에는 150억 개 수준의 연산량만 활용하며, 한 번에 100만 개의 토큰을 처리할 수 있어 길고 복잡한 AI 에이전트도 맥락을 벗어나지 않고 한 번에 다룬다. 또한 이전 모델에서 약 2.3%에 해당하는 핵심 가중치를 재사용해 학습 시간을 크게 줄었고, 한국어 입력 시 토큰 효율성을 더 끌어올렸다. 아울러 2차 평가 기준인 에이전트 성능 확보를 위해 대화형 도구 사용, 코딩 및 사무 업무를 포괄하는 에이전트 시나리오를 학습했다.</p> <figure class="figure_frm origin_fig" contents-hash="6b1ac7fc7c346570d5088f14510dc8358eafef80ac598c07555ef4db0709cc60" dmcf-pid="8uP7OckLwq" dmcf-ptype="figure"> <p class="link_figure"><img alt="솔라 오픈 2와 오픈 1, 딥시크 V4 플래시 및 미모-V4, GPT 5.4 미니와의 성능 비교 / 출처=업스테이지" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162704148tzla.jpg" data-org-width="1000" dmcf-mid="5FQUmjAisn" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162704148tzla.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 솔라 오픈 2와 오픈 1, 딥시크 V4 플래시 및 미모-V4, GPT 5.4 미니와의 성능 비교 / 출처=업스테이지 </figcaption> </figure> <p contents-hash="1310875a624a1d4194bac95c10320cbf39366cc066a965abc75cc7d7fe04cb92" dmcf-pid="67QzIkEoEz" dmcf-ptype="general">성능 측면에서는 지식 및 과학 추론, 수학, 코딩, 지시 이행, 한국어 종합 성능이 전반적으로 크게 향상됐다. 기존에 솔라 오픈 100B에서 축적된 자료와 학습 경험을 바탕으로 새로운 아키텍처를 구성한 덕분이다. 박사 급 과학분야 추론 문제 198개로 구성된 GPQA-다이아몬드 테스트에서는 1세대 정확성이 66.2%이었는데 86.3%로 크게 올랐다. 라이브 벤치 v6 성능도 56.5%에서 92.4%로 대폭 향상됐으며, 올림피아드 급 수학 문제로 구성된 AIME2026도 87.7%에서 95.7%로 정확도를 높였다. 전반적인 성능은 글로벌 프론티어 급인 딥시크-V4 플래시 284-A13B 모델 수준이다.</p> <p contents-hash="2ccf81eb5a90cc19de80fcb0ceff64a82a16741b23baf2a324928735df23fb08" dmcf-pid="PzxqCEDgI7" dmcf-ptype="general">특히 전 세대에서 부족했던 AI 에이전트 성능은 괄목할 만큼 성장했다. 사실 이전 모델에서 AI 에이전트는 평가 기준이 아니어서 상대적으로 소홀한 면이 있었다. 자율소프트웨어 역량 벤치마크인 SWE-벤치는 전세대가 15.4%였는데 이번에 70.4%로 크게 올랐고, 격리된 가상의 터미널 환경에서 작업 역량을 확인하는 터미널 벤치 하드 테스트도 2.3%에서 28.3%으로 올랐다. 총 45가지 주제에 걸쳐 3만 5030개의 전문가 질문이 다지선다형으로 구성된 한국어 AI 성능 평가 지표인 KMMLU-프로는 78.4점으로 전작의 64.02점보다 높아졌다.</p> <figure class="figure_frm origin_fig" contents-hash="6ca80039cd303c5c528cd18c76a3dc0255f7d4e4b610eeca917467f99155e6a6" dmcf-pid="QqMBhDwaOu" dmcf-ptype="figure"> <p class="link_figure"><img alt="AI 양자화 기술 기업 노타가 솔라 오픈 2를 양자화해 요구 메모리를 160GB 이하로 줄여 활용성을 크게 높였다 / 출처=노타" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162705354kdpt.jpg" data-org-width="1000" dmcf-mid="1vCr8Bb0Di" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162705354kdpt.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> AI 양자화 기술 기업 노타가 솔라 오픈 2를 양자화해 요구 메모리를 160GB 이하로 줄여 활용성을 크게 높였다 / 출처=노타 </figcaption> </figure> <p contents-hash="9cb9c13f9c8ff61963b4f83ff567ceb1056a6b328f850889d0c315fcf640a6d7" dmcf-pid="xBRblwrNsU" dmcf-ptype="general">주목할만한 부분은 하드웨어 요구사항이다. 최소 사양은 엔비디아 H200 4장, 권장 사양은 8장으로 온프레미스 조건은 중견기업은 되어야 할 만 하다. 업스테이지는 AI 모델 양자화 기술 기업 노타와의 협업으로 4비트 양자화에 전역 가지치기를 적용한 경우 모델 규모를 H100 2 장에서 구동 가능한 137.8GB로 크게 줄였다. 엔비디아 블랙웰 이상에서 지원하는 NVFP4 조건에서는 블랙웰 B200 1장으로도 구동할 수 있다. 덕분에 데이터서버용 그래픽 카드 수급이 어려운 조건은 물론 온프레미스 환경, 폐쇄망에서까지도 솔라 오픈 2를 무난하게 쓸 수 있다.</p> <h3 contents-hash="38fca747b0c27b538eefe45559b7abc24d01527ae34501a6502ea538b98a2b94" dmcf-pid="ywYr8Bb0Ep" dmcf-ptype="h3">SK텔레콤, 고성능 에이전트에 688B 결합한 A.X K2 공개</h3> <figure class="figure_frm origin_fig" contents-hash="fd73a5519d329320c16f662f436912708c87ab35d05a7c4717179e029c7a1b26" dmcf-pid="WrGm6bKpI0" dmcf-ptype="figure"> <p class="link_figure"><img alt="SK텔레콤의 A.X K2 로고. 전작 대비 매개변수는 1690억 개 늘리면서 학습 방식을 바꿔 성능과 효율을 높였다 / 출처=SK텔레콤" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162706570jdpi.jpg" data-org-width="1000" dmcf-mid="tzUtkLoMOJ" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162706570jdpi.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> SK텔레콤의 A.X K2 로고. 전작 대비 매개변수는 1690억 개 늘리면서 학습 방식을 바꿔 성능과 효율을 높였다 / 출처=SK텔레콤 </figcaption> </figure> <p contents-hash="81689b87b0812957b5b66400af91a61c534eeb01b48194257933085b3e1faefa" dmcf-pid="YmHsPK9Um3" dmcf-ptype="general">A.X K2는 5190억 개 매개변수가 적용된 A.X K1의 후속 모델로 총 6880억 개 매개변수가 적용됐다. 멀티모달 부분을 고려해 A.X K2 메인 모델 이외에도 이미지를 분석하는 A.X K2 VE, 음향 부분에 대응하는 A.X K2 ALM, 음성 모델인 A.X K2 Raon-Speech가 함께 출시됐다.</p> <p contents-hash="00df6e85a14e6d59b4310264f789cc005ff8a4995af02b246ef4b09f8082f4c1" dmcf-pid="GsXOQ92umF" dmcf-ptype="general">전작과 동일하게 전문가 모델 활성 매개변수는 330억 개지만 전문가 구조가 192명 전문가 및 주력 1명 구조에서 256명 및 1명으로 업그레이드됐다. 콘텍스트 길이는 13만 토큰 수준에서 26만 토큰으로 두 배 가량 늘었다. A.X K1의 아키텍처는 추론 시 발생하는 KV 캐시를 저 차원 잠재 영역으로 압축해서 저장하는 멀티 헤드 잠재 어텐션(MLA)으로 요구 메모리를 효율화했는데, A.X K2는 MLA에 불필요한 토큰 집중 연산을 줄이는 희소 어텐션과 정보 필터링 및 안정성을 끌어올린 게이티드 어텐션을 결합한 희소 게이티드 어텐션을 추가로 적용해 AI 에이전트 실행을 위한 문맥 추론 길이는 늘리고 속도와 안정성을 확보했다. </p> <figure class="figure_frm origin_fig" contents-hash="e2c91672d282d8384b0cd4d51048091fc1e34c553e7b4f49a03ef1841fbd0064" dmcf-pid="HOZIx2V7wt" dmcf-ptype="figure"> <p class="link_figure"><img alt="A.X K2와 글로벌 프런티어 모델과의 주요 성능 비교 / 출처=SK텔레콤" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162707784mobz.jpg" data-org-width="1000" dmcf-mid="FRAo71tWOd" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162707784mobz.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> A.X K2와 글로벌 프런티어 모델과의 주요 성능 비교 / 출처=SK텔레콤 </figcaption> </figure> <p contents-hash="837f4f632eecf8d4b6ad22ca50493cfabb5d8b4eb78ad2d11a48bb146a73d06b" dmcf-pid="XBRblwrNw1" dmcf-ptype="general">성능은 GPQA-다이아몬드가 85.6%며, AIME 2026은 97.1%로 우수한 지능 점수를 보여줬다. 라이브 벤치 v6는 84%로 1세대의 74.9%에 비하면 올랐지만 매개변수가 절반 정도인 3970억 개에 170억 개 전문가 모델이 동작하는 큐웬 3.5의 82.6%와 크게 다르지 않아 아쉽다. 한국어 성능을 확인하는 KMMLU-프로는 전작이 68.9점이었으나 80.5점으로 크게 높였다. </p> <p contents-hash="7bdb0840f54eb84cb0113e2258c17b8e397c3e5cdc4f781b40b7b4c5166398a9" dmcf-pid="ZbeKSrmjs5" dmcf-ptype="general">주목할만한 점은 모델 크기가 크다보니 학습 방식을 FP8 혼합정밀도에서 네이티브 MXFP8로 변경했다. 1세대 모델은 메인 매개변수는 FP32, BF16으로 관리하며 학습 중 FP8 연산을 활용하는 방식이었지만, 2세대 모델은 배포파일 자체를 FP8로 저장하는 MXFP8로 전환함과 동시에 데이터를 32개 수준의 더 작은 블록 단위로 조절해 수치 손실을 줄이고 정밀도를 높였다. MXFP8은 글로벌 서버 표준을 제정하는 오픈 컴퓨트 프로젝트(OCP)에서 제정한 표준이고, 엔비디아 블랙웰에서 텐서코어 레벨에서 처리되므로 향후 확산 시 활용 가치가 높다.</p> <figure class="figure_frm origin_fig" contents-hash="a7f680c147fb6b47283cfe5de26501c0ec5a7c46d4b1672565ac1a99880abaa3" dmcf-pid="5Kd9vmsADZ" dmcf-ptype="figure"> <p class="link_figure"><img alt="누구나 이용할 수 있는 아파치 2.0 라이선스로 배포돼 AI 생태계 침투력을 크게 높였다 / 출처=허깅페이스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162708987vbyj.jpg" data-org-width="1000" dmcf-mid="3E8zIkEoOe" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162708987vbyj.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 누구나 이용할 수 있는 아파치 2.0 라이선스로 배포돼 AI 생태계 침투력을 크게 높였다 / 출처=허깅페이스 </figcaption> </figure> <p contents-hash="452c21ab8deed4dfcc72c8635ef2c02d0f39abbd76bc5682cb9df8b9e8bc3e3a" dmcf-pid="19J2TsOcwX" dmcf-ptype="general">다만 MXFP8로 요구 메모리를 절반이나 줄였음에도 불구하고 활성 용량이 647 GiB(기비바이트), KV 캐시 및 활성화를 포함하면 800 GiB의 막대한 GPU 메모리가 필요하다. 검증에는 4개의 엔비디아 B300 카드가 활용됐는데 엔비디아 H100으로 환산하면 12장 이상이 필요한 수준이다. 긍정적인 점은 라이선스가 아파치 2.0으로 배포돼 상업적 이용, 수정, 재배포가 모두 가능하다. 소규모 스타트업들도 A.X K2, VE를 기반으로 서비스를 제작하고 만들어도 무방하다. 대신 ALM은 비상업적-연구 용도로만 쓸 수 있고, 라온 스피치는 저작자 표시 및 비상업 용도로만 쓸 수 있다.</p> <h3 contents-hash="1e4a2256df341d4d20f2baf45e188fd4f9c79c84752c6596db99bef7ce0e57dd" dmcf-pid="t2iVyOIkmH" dmcf-ptype="h3">LG AI 연구원, 3배 커진 749B K-EXAONE 2.0으로 승부수</h3> <figure class="figure_frm origin_fig" contents-hash="f0334c400c3516090b9359ab013ea97465a25ed3b09f43818c69f33eb453defd" dmcf-pid="FVnfWICEmG" dmcf-ptype="figure"> <p class="link_figure"><img alt="LG AI 연구원의 2세대 모델은 K-EXAONE 2.0 주요 변경점 / 출처=LG AI 연구원" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162710222fpub.jpg" data-org-width="1000" dmcf-mid="01BtkLoMwR" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162710222fpub.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> LG AI 연구원의 2세대 모델은 K-EXAONE 2.0 주요 변경점 / 출처=LG AI 연구원 </figcaption> </figure> <p contents-hash="2efdb80bc901d2a462ca3406ee7d189e01699f6804c25481a61ae7a74fc442dd" dmcf-pid="3fL4YChDEY" dmcf-ptype="general">LG AI 연구원의 K-EXAONE 2.0은 전작 대비 매개변수를 3.2배 키운 7490억 개 초대형 모델로 승부수를 띄웠다. 아키텍처는 기존의 희소성 MoE 모델에 레이어를 48에서 78로 올리고, 동원 전문가는 256으로 늘린 뒤 매개변수를 236B에서 749B로 확장한 구조다. 모델 크기가 커지다보니 추론 가속을 위해 DSpark라는 선택지가 새롭게 도입된다. 1세대 모델은 사전 모델이 초안 단어를 만든 뒤 주력 모델이 일괄 검수하는 다중 토큰 예측(MTP)만 사용됐는데, 2세대는 별도로 학습된 모듈이 7개 토큰 크기의 블록을 한 번의 연산으로 초안을 찍어내는 DSpark 레이어 활용 버전을 추가해 초당 토큰 생성 속도를 1.81배에서 최대 2.57배 늘렸다.</p> <figure class="figure_frm origin_fig" contents-hash="01d40f028c01c206b24f57999926e13dc07ce7175e3e9ef400fc72d7f582f0f8" dmcf-pid="04o8GhlwwW" dmcf-ptype="figure"> <p class="link_figure"><img alt="장문맥 탐색 및 추론 성능, 지시 준수 및 안정성 점수는 크게 올랐으나 전반적인 지식 성능은 거의 비슷했다. 실제 환경 에이전트 과제 성능은 3세대 모델에서 해결해야할 숙제로 남았다 / 출처=LG AI 연구원" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162711469mkvd.jpg" data-org-width="1000" dmcf-mid="pLEnUZ5TwM" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162711469mkvd.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 장문맥 탐색 및 추론 성능, 지시 준수 및 안정성 점수는 크게 올랐으나 전반적인 지식 성능은 거의 비슷했다. 실제 환경 에이전트 과제 성능은 3세대 모델에서 해결해야할 숙제로 남았다 / 출처=LG AI 연구원 </figcaption> </figure> <p contents-hash="d3552c74cb588cb87092ad871c9ad7c78e2ab7b3333827f751b304144f0eb958" dmcf-pid="p8g6HlSrEy" dmcf-ptype="general">다만 매개변수를 세배나 높인 것에 비해 벤치마크 점수가 크게 높아지지 않았다. GPQA-다이아몬드는 전작이 79.1%에서 82.2%로 소폭 올랐고, AIME2026은 전작의 92.2%에서 0.1% 오른 92.3%로 큰 차이가 없었다. KMMLU-프로는 전작이 67.3점이었는데 69.1로 오름폭이 적었다. 오히려 매개변수가 330억 개로 구성된 엑사원 4.5가 AIME 2026이 92.6점, KMMLU-프로가 67.6점임을 감안하면 기대했던 만큼 성능이 나오진 않는다. 기술 보고서에서는 지표 향상보다는 에이전틱 코딩, 초장문 맥락 이해, 도구 사용 등 실무 서빙에 필요한 핵심 역량 향상에 집중했다고 서술했다. </p> <p contents-hash="4c6f3c53750c73a716423963ecff148b6ebc954811ae717a169118c112f21835" dmcf-pid="U6aPXSvmET" dmcf-ptype="general">실제 성능 향상은 AI 코딩 및 에이전트 벤치마크 세 종에서 약 30%의 성능 향상을 기록했으며, 최대 지원 콘텍스트의 길이는 25만 6000토큰으로 유지하면서 효율을 크게 끌어올린 점을 강조한다. 토큰 윈도우 크기를 의미하는 슬라이딩 윈도우 크기는 기존에는 일률적으로 128으로 고정했으나 새 버전에는 두 번째 레이어를 적용해 크기를 4096으로 넓혀 초반 문맥 수용력을 넓혔고, 사전 학습 이후 중간 단계에서 추가로 학습하는 미드 트레이닝을 추가해 장문 추론 추적, 에이전트 실행 이력 확인 성능 등을 높였다. 덕분에 긴 문맥 속에서 여러 위치에 흩어진 정보를 찾아 연계하는 오픈AI-MRCR 점수는 52.3점에서 94.4점으로 대폭 향상됐다. </p> <figure class="figure_frm origin_fig" contents-hash="22de3c2563d10e639f7e68bc9bc94d9a3a4d5811dcc6b5a349a12deca3f4cc34" dmcf-pid="uqMBhDwaIv" dmcf-ptype="figure"> <p class="link_figure"><img alt="좌측이 K-EXAONE 2.0의 메인 모델 아키텍처, 우측 상단이 다중토큰예측(MTP) 모듈, 하단이 DSpark 모듈 구조다 / 출처=LG AI 연구원" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162712711ytjx.jpg" data-org-width="1000" dmcf-mid="USLm6bKprx" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162712711ytjx.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 좌측이 K-EXAONE 2.0의 메인 모델 아키텍처, 우측 상단이 다중토큰예측(MTP) 모듈, 하단이 DSpark 모듈 구조다 / 출처=LG AI 연구원 </figcaption> </figure> <p contents-hash="5a1c70403edb04b8a0a0fe2daf2ac5d916e5f313115efbccd36215accd353cda" dmcf-pid="7BRblwrNsS" dmcf-ptype="general">매개변수가 크다보니 하드웨어 요구 성능도 높다. 일단 A.X K2와 마찬가지로 다중 토큰 예측을 활용하고, MTP 대신 5개의 DSpark 레이어를 적용한 별도 모델도 공개해 추론 속도는 솔라 오픈 2나 모티프 3보다 빠를 것으로 예상된다. BF16으로 구동 시 하드웨어는 8개의 H200으로 구성된 노드 두 개, 즉 H200 16개가 필요하다. FP8 환경이면 귄장 VRAM이 가중치 750GB에 KV캐시를 포함해 900GB 수준으로 H200 8개가 필요하다. 엔비디아 블랙웰 B200을 활용하면 권장 VRAM을 500GB까지 줄여 4대의 B200으로도 충분하다.</p> <figure class="figure_frm origin_fig" contents-hash="e9659423b7238b33f339effc5a5cee3c718e86f6946f582374d59a7388feeda1" dmcf-pid="zbeKSrmjrl" dmcf-ptype="figure"> <p class="link_figure"><img alt="퓨리오사AI가 1세대 모델인 K-EXAONE-236B 모델을 자사의 AI 가속기인 RNGD(레니게이드)에서 NVFP4로 구동할 수 있는 모델을 허깅페이스에 업로드했다 / 출처=허깅페이스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162713927nbii.jpg" data-org-width="1000" dmcf-mid="uPqx5TyODQ" dmcf-mtype="image" height="auto" src="https://img2.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162713927nbii.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 퓨리오사AI가 1세대 모델인 K-EXAONE-236B 모델을 자사의 AI 가속기인 RNGD(레니게이드)에서 NVFP4로 구동할 수 있는 모델을 허깅페이스에 업로드했다 / 출처=허깅페이스 </figcaption> </figure> <p contents-hash="edd8836fb1c4c01e475e5f55f3a93803a02ddf248940887ed835e816162ce7ad" dmcf-pid="qKd9vmsAmh" dmcf-ptype="general">하드웨어 요구 사항이 이례적으로 높긴 하나 퓨리오사AI의 NPU RNGD가 해답이 될 수 있다. 퓨리오사AI는 지난 7월 1세대 모델인 K-EXAONE-236B-A23B를 NVFP4로 구동하는 모델을 업로드했다. 해당 모델이 4장의 RNGD 카드만으로 구동되는 점을 감안하면 아키텍처를 유지하며 매개변수를 3배로 늘린 2세대 모델은 약 12장 정도면 구성할 수 있을 것으로 추정된다. NVFP4용 엔비디아 B200의 개별 제품 단가와 전력효율을 고려하면 GPU 대비 약 25~30%의 총소유비용과 6배 적은 소비전력으로도 K-EXAONE 2.0를 활용할 수 있을 것이다.</p> <h3 contents-hash="c68c9803abce3aa8a1467b9f946886bcdeb6b14ea4997e53f097b261cd6af46a" dmcf-pid="B9J2TsOcOC" dmcf-ptype="h3">모티프 3, 자체 기술로 글로벌 프런티어급 성능 달성</h3> <figure class="figure_frm origin_fig" contents-hash="ce0ecdd0adba8d7315934e073fbfcce1dbecf6af71f252e330adbfa81376be84" dmcf-pid="b2iVyOIkOI" dmcf-ptype="figure"> <p class="link_figure"><img alt="모티프테크놀로지스의 모티프-3는 현재 베타 버전으로 등록돼있다. 조만간 공식 버전이 출시될 전망이다 / 출처=허깅페이스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162715155azzj.jpg" data-org-width="1000" dmcf-mid="7pu6HlSrDP" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162715155azzj.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 모티프테크놀로지스의 모티프-3는 현재 베타 버전으로 등록돼있다. 조만간 공식 버전이 출시될 전망이다 / 출처=허깅페이스 </figcaption> </figure> <p contents-hash="7e009e966885bf8284d50a1753d6fd297b511b8f9f02f13d50fc9c53dd75730a" dmcf-pid="KVnfWICEDO" dmcf-ptype="general">모티프는 컨소시엄에 가장 마지막으로 참여한 만큼 허깅페이스 상에는 모티프 3 베타 버전만 공개했으며 지난 4일 정보통신산업진흥원에 모티프 3 및 성과보고서를 제출한 것으로 알려졌다. 모티프 3는 오픈소스 아키텍처를 사용하지 않고 모티프 테크놀로지스가 완전히 독자적으로 설계한 모델이며, 총 3140억 개의 매개변수와 130억 개의 활성 매개변수를 갖췄다. 모티프 3는 전문가는 384개, 공유 전문가는 1개로 전문가당 매개 변수를 0.8B로 매우 작게 쪼갰고, 토큰당 활성 전문가는 8개를 배치했다. 결과물이 더 세밀하고 유연하게 나올 수 있는 구조다. </p> <figure class="figure_frm origin_fig" contents-hash="55eef7060d19422ed91ee0f7959db5b2b9fccbcf09f901317a30d57eabf2b33e" dmcf-pid="9fL4YChDOs" dmcf-ptype="figure"> <p class="link_figure"><img alt="모티프-3는 베타 버전으로도 아티피셜 애널리시스의 지능 테스트에서 44점을 획득하는 등 우수한 성능을 보여줬다 / 출처=아티피셜애널리시스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162716383slcm.jpg" data-org-width="1000" dmcf-mid="zWxjb0pXm6" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162716383slcm.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 모티프-3는 베타 버전으로도 아티피셜 애널리시스의 지능 테스트에서 44점을 획득하는 등 우수한 성능을 보여줬다 / 출처=아티피셜애널리시스 </figcaption> </figure> <p contents-hash="cfc4ab7ebe3d57af18c30455ee0392b3cb3742467a45e847886d70d0a6624b1d" dmcf-pid="24o8Ghlwsm" dmcf-ptype="general">또한 그룹화 차분 잠재 어텐션(GLDA)이라는 구조도 적용했다. GLDA는 문맥상 관련이 적은 단어를 줄이는 차분 어텐션, KV캐시를 벡터로 압축해 메모리를 줄이는 잠재 어탠션, 두 어텐션을 활용할 때 병렬 처리 및 자원 할당 등을 관리하는 그룹화 작업을 엮은 기술로 메모리 효율과 추론 속도는 높이는 기술이다. 모티프가 올해 2월 합류해 30여 명의 인원과 700장의 GPU만으로 학습했음을 감안하면 구조의 독창성이나 완성도가 매우 우수한 편이다.</p> <p contents-hash="d0ce4c3c04961b0c7bdb96d6fcc1f08ff7702320f38ba74791004adcbde1cd5f" dmcf-pid="V8g6HlSrIr" dmcf-ptype="general">구체적인 요구 GPU 사양은 공개되지 않았으나 테스트는 엔비디아 H200 및 B200에서 처리되었으며 vLLM을 활용했을 때 8대의 GPU를 데이터 병렬화로 구성한 것을 고려하면 H200 8장 정도는 필요할 것으로 예상된다. 모델 자체는 BF16으로 구성되어 향후 모델 양자화시 요구 하드웨어 사양은 더 줄어들 수 있다. 8비트 양자화는 텐서가 아닌 블록 단위로 가능하고, 4비트 양자화는 시험 단계라고 밝히고 있다. </p> <figure class="figure_frm origin_fig" contents-hash="c83a7457d870fc23e902dc87e1208e0d03b32e5f4207f912cc6358e2a96a8f8c" dmcf-pid="f8g6HlSrrw" dmcf-ptype="figure"> <p class="link_figure"><img alt="모티프-3 베타 버전의 GPQA-다이아몬드 테스트 정확성은 87%, 터미널-벤치 v2.1도 71%로 높게 확인된다 / 출처=아티피셜애널리시스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162717607iyzp.jpg" data-org-width="1000" dmcf-mid="qHnfWICEr8" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162717607iyzp.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 모티프-3 베타 버전의 GPQA-다이아몬드 테스트 정확성은 87%, 터미널-벤치 v2.1도 71%로 높게 확인된다 / 출처=아티피셜애널리시스 </figcaption> </figure> <p contents-hash="04ce7341c6f428d038d4c4ffd03899e5e97c3236125d7075ec3467bad74a518b" dmcf-pid="46aPXSvmmD" dmcf-ptype="general">베타 버전이 아닌 정식 버전 출시 시점에는 모델 양자화나 구체적인 성능 등이 공개될 예정이다. 한편 모티프 3는 정식 버전이 아님에도 불구하고 글로벌 AI 벤치마크 기관인 아티피셜 애널리시스의 지능지수 검증에서 44점을 획득했다. 해당 항목에서 확인할 수 있는 GPQA-다이아몬드 정확성은 87%, 터미널 벤치 2.1 버전은 71%다. K-EXAONE 2.0이 각각 82.2%, 43.8%인 점을 감안하면 예상 수준을 상회하는 성능이며 정식 버전에서는 점수가 더 향상될 여지가 있다.</p> <h3 contents-hash="9edec0380f40d85e884cd392c71eee8a8db87b64edb0bc305d6508593a196237" dmcf-pid="8PNQZvTsDE" dmcf-ptype="h3">오는 8월 11일까지 국민참여단 평가··· 이후 4팀 중 3팀만 생존</h3> <p contents-hash="377ffbd242e413defb79f7f66be277faafaafe31f93fea6bb961907f5c05459c" dmcf-pid="6Qjx5TyOIk" dmcf-ptype="general">모티프까지 모델 전달을 완료하면서 독자 AI 파운데이션 2차 평가가 곧 시작된다. 정부는 오는 8일부터 11일까지 일반 국민 200명이 참여하는 국민평가단을 운영한다. 각계각층으로 구성된 200명의 평가단이 4개 AI 모델을 직접 사용한 뒤 절대평가 방식으로 채점한다. 2차 결과는 해당 기준과 벤치마크 평가, 그리고 전문가 평가 점수를 종합한 뒤 12일 이후에 윤곽을 드러낼 예정이다. 2차 평가를 거치면 4개 팀 중 하나 팀이 탈락하고, 올해 연말에 최종 평가를 통해 두 개 팀만 남게 된다.</p> <figure class="figure_frm origin_fig" contents-hash="729c021e357998cb4af87f23dff0d8c502d9a8fb34ca37a2ffa379eec1d3a8f2" dmcf-pid="PxAM1yWIwc" dmcf-ptype="figure"> <p class="link_figure"><img alt="정부가 요구하는 AI 모델의 핵심은 단순 지표가 아닌 AI 에이전트, 즉 현실에서의 활용 가치다. 제시한 모델을 얼마나 산업적 가치로 승화시키는가가 선정의 관건이 될 전망이다 / 출처=LG AI 연구원" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/06/itdonga/20260806162718825lwlr.jpg" data-org-width="1000" dmcf-mid="BOaPXSvms4" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/06/itdonga/20260806162718825lwlr.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 정부가 요구하는 AI 모델의 핵심은 단순 지표가 아닌 AI 에이전트, 즉 현실에서의 활용 가치다. 제시한 모델을 얼마나 산업적 가치로 승화시키는가가 선정의 관건이 될 전망이다 / 출처=LG AI 연구원 </figcaption> </figure> <p contents-hash="9011747ceb67216a1e6d0f562e51cba7a8ea3419d29cbd2262f6af5a3e1dc60c" dmcf-pid="QMcRtWYCDA" dmcf-ptype="general">각 기업 모델의 주요 특징과 기술 보고서만으로는 AI 모델의 성능이나 실용성 등은 예측할 수 없다. 2차 평가의 기준은 AI 에이전트의 수행 능력과 산업 현장의 적용성, 개방성, 생태계 확장성 등을 종합적으로 평가하며 이는 라이선스나 벤치마크 상으로는 확인할 수 없다. 또한 모델의 서빙 속도나 이용 비용 등 기술 외적인 부분도 고려하지 않을 수 없다. 실제로 모델 성능이나 지능은 높아도 토큰 생성 속도가 느려서 활용성이 부족한 경우도 있고, 반대로 모델 크기 대비 AI 에이전트 성능이 기대 이상인 모델들도 많다. 2차 평가에서 실제로 국민들이 AI를 써보는 평가가 들어간 이유다.</p> <p contents-hash="1bff92dd72e577f6514c8c22153fb8a4015755eecae7aa158fb30decea4260d3" dmcf-pid="xRkeFYGhIj" dmcf-ptype="general">배경훈 정보통신부장관은 지난 7월 열린 2026 하반기 업무보고 과정에서 ‘독파모 2차 평가가 나오면 기존 3위를 넘어 2위권에도 도전해볼 수 있을 것’이라며 기대감을 나타냈다. 당장 모티프가 700여 장의 B200만으로 세계적 수준의 모델을 만든 점을 감안하면 정부의 전폭적인 지원을 통해 더 큰 결과도 창출해 낼 여력이 있다. 지난 6개월 간의 개발 여정은 이제 마무리되었고 그 결과만을 남겨두고 있다. 남은 것은 기다림 뿐이다.</p> <p contents-hash="058201a7e09f2c49ae011df8ec5311261097afb6eec55f2cde965e4fb7c44ca4" dmcf-pid="yY7GgRe4mN" dmcf-ptype="general">IT동아 남시현 기자 (sh@itdonga.com)</p> <p contents-hash="451754088f5c6725afb4d1f8dcfa167f3ebab2327e8d9912f231b388d2e0ed37" dmcf-pid="WGzHaed8Ea" dmcf-ptype="general">사용자 중심의 IT 저널 - IT동아 (<span>it.donga.com</span>)</p> </section> </div> <p class="" data-translation="true">Copyright © IT동아. 무단전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기