로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
국힘, 전체 당협위원장 재선출 검토‥'대거 물갈이' 시사
N
[실시간뉴스]
청주생활자원회수센터 현도에 존치…주민 "행정신뢰 붕괴"(종합)
N
[IT뉴스]
[스타트업人] AI 올인원 브랜딩 솔루션 개발, 타이디비 디자이너 이야기
N
[IT뉴스]
두나무의 ‘업비트데이터랩’, 자산 분류 체계 고도화… ‘영지식 인프라’도 한눈에
N
[IT뉴스]
딥핑소스 “현장 수기 집계, AI가 대신한다”…자동차 전시장 고객 유형 분석도 자동화
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스]모티프 47점·업스테이지 37점·SKT 35점·LG 31점…AAII ‘벤치마크 한계’도(종합)
온카뱅크관리자
조회:
2
2026-08-13 14:27:31
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">독파모 3차 평가에 들어가는 AAII 결과 공개<br>모티프 국내 1위·글로벌 LLM 10위<br>AI 에이전트 시대 실제 활용 능력 모두 반영하기 어려워<br>NIA 비공개 평가 등 최종 결과 주목</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="1wfgLPCEEA"> <p contents-hash="aa20afba1543d585bf3ee50e316e5b6ed55fdce9bca926c8c5c0cb833be92ebb" dmcf-pid="tr4aoQhDmj" dmcf-ptype="general"> [이데일리 김현아 기자] 국내 ‘AI 국가대표’ 선발전인 독자 AI 파운데이션 모델 사업(독파모)에 참여한 4개 기업의 글로벌 AI 평가 결과가 공개됐다. 모티프테크놀로지스의 ‘Motif 3’가 47점으로 가장 높았고, 업스테이지 37점, SK텔레콤(017670) 35점, LG(003550) AI연구원 31점 순으로 나타났다.</p> <p contents-hash="1169ce0de0d9a80c2d77ebeab40cf0189296cedc94b3542b6de36697d41ae066" dmcf-pid="Fm8NgxlwON" dmcf-ptype="general">글로벌 평가기관이 동일한 기준으로 국내 AI 모델을 비교했다는 점에서 의미가 있지만, AAII 점수만으로 모델의 종합적인 경쟁력이나 실제 활용 능력을 판단하기에는 한계가 있다는 지적도 나온다. </p> <p contents-hash="012206212a6530fcd95e4915d39d216ddc03289fac0e7a99707dd883682fc31e" dmcf-pid="3DVon6IkDa" dmcf-ptype="general">특히 AI가 단순 질의응답을 넘어 복잡한 업무를 스스로 수행하는 에이전트 AI로 발전하면서 기존 벤치마크가 실제 업무 능력을 얼마나 반영할 수 있는지가 새로운 평가 과제로 떠오르고 있다.</p> <figure class="figure_frm origin_fig" contents-hash="e1d738ea5e0d4113f85d685b002d1e85bcc5245e55da64956692c079b2088591" dmcf-pid="0wfgLPCEsg" dmcf-ptype="figure"> <p class="link_figure"><img alt="모티프 47점·업스테이지 37점·SKT 35점·LG 31점…AAII ‘벤치마크 한계’도(종합)" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/13/Edaily/20260813141739903hyuh.jpg" data-org-width="1024" dmcf-mid="5ORDkiYCEc" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/13/Edaily/20260813141739903hyuh.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 모티프 47점·업스테이지 37점·SKT 35점·LG 31점…AAII ‘벤치마크 한계’도(종합) </figcaption> </figure> <div contents-hash="3f4d29180460d671166b89ffd4179e942079d994c0347aea52029b965cee3250" dmcf-pid="pr4aoQhDIo" dmcf-ptype="general"> <strong>모티프 47점으로 1위…업스테이지·SKT·LG 뒤이어</strong> </div> <p contents-hash="addfd69b04f67773002d868dc37d93bfaf7272b3229a6214c97dfa8db3b7a049" dmcf-pid="Um8NgxlwDL" dmcf-ptype="general">13일 글로벌 AI 분석기관 아티피셜 애널리시스(Artificial Analysis)가 공개한 ‘Artificial Analysis Intelligence Index(AAII) v4.1.1’에 따르면 모티프의 Motif 3는 47점을 기록했다.</p> <p contents-hash="71e38b27c663a1eb18d2f90967808acd80d188c39574b7a856627e8c3c7ec784" dmcf-pid="us6jaMSrrn" dmcf-ptype="general">업스테이지의 ‘Solar Open 2 250B’가 37점으로 2위, SK텔레콤의 ‘A.X K2’가 35점으로 3위, LG AI연구원의 ‘K-EXAONE 2.0 0803’이 31점으로 뒤를 이었다.</p> <p contents-hash="44fbc184c24f953661f9197bf47c34b5b0f2a615a93cdcd57fd7653d85c2cdba" dmcf-pid="7OPANRvmEi" dmcf-ptype="general">AAII는 수학·과학·코딩·추론 등 여러 분야의 평가 결과를 종합해 AI 모델의 성능을 하나의 점수로 보여주는 지표다. 이번 평가에는 금융 업무, 코딩, 과학·수학 문제, 장문 추론, 정보 정확성 등을 평가하는 9개 항목이 활용됐다.</p> <p contents-hash="430ab0f9a0df99a991388d7500d0ab38076f46778ccf0cbb9fdfd60a4c9a974a" dmcf-pid="zIQcjeTssJ" dmcf-ptype="general">모티프3는 글로벌 대규모언어모델(LLM) 가운데 10위, 오픈웨이트 모델 가운데 4위에 올랐다. 특히 금융 업무를 수행하는 AI 에이전트와 코딩 능력을 평가하는 일부 항목에서 강점을 보였다.</p> <p contents-hash="7cba40981c179579b2a9973323b958db2c44eeaa7995ea6fbba55c22a5b66c8f" dmcf-pid="qCxkAdyOId" dmcf-ptype="general">모티프는 이날 Motif 3의 모델 가중치뿐 아니라 학습 코드와 라이브러리까지 공개하며 모델 생태계 확대에도 나섰다.</p> <p contents-hash="1454d763a1359d4bfcf9f7b55f48294a0165c67720410d859da75a507a9e804f" dmcf-pid="BFkWTr71me" dmcf-ptype="general"><strong>AAII 25점 반영…독파모 최종 순위와는 별개</strong></p> <p contents-hash="1aefa13eb51bf48050b90e253dd40e388481c793424c00a4ee7724cb9b1f1001" dmcf-pid="b3EYymztmR" dmcf-ptype="general">이번 결과가 주목받는 이유는 과학기술정보통신부의 독파모 3차 평가와 직접 연결되기 때문이다.</p> <p contents-hash="e4d123d47b340f5f65436497ba40652787a4c92e485e40315968ed273249035d" dmcf-pid="K0DGWsqFsM" dmcf-ptype="general">3차 평가에서는 LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 등 4개 기업 가운데 1곳이 탈락한다. </p> <p contents-hash="bddf0eb488ca05ae29ae56add15ad3d03938417c63cf8914dd8a3a0dd26c8164" dmcf-pid="9pwHYOB3Dx" dmcf-ptype="general">독파모 평가에서 벤치마크 영역은 총 40점으로, 이 가운데 AAII가 25점, 한국지능정보사회진흥원(NIA)의 자체 벤치마크가 15점을 차지한다. 나머지 60점은 전문가 평가 35점과 사용자 평가 25점으로 구성된다.</p> <p contents-hash="dd2072e44572ca9f92fd892e8c1cdacdaa6104076bdcdc5962f0ff45f9144086" dmcf-pid="2UrXGIb0mQ" dmcf-ptype="general">AAII가 전체 평가의 25%를 차지하는 만큼 이번 점수 차이가 최종 결과에 상당한 영향을 미칠 수 있다. 하지만 AAII가 독파모 최종 순위를 결정하는 것은 아니다.</p> <p contents-hash="49ef23dd6f1f332aa3a22fc3472e170513886e3c302b3b53c6384cdf830dc6b0" dmcf-pid="VumZHCKpEP" dmcf-ptype="general">특히 NIA의 비공개 평가와 전문가·사용자 평가가 남아 있어 AAII 순위가 독파모 최종 순위와 반드시 일치한다고 볼 수 없다.</p> <p contents-hash="1da312c7f370508a04ccdd21bccc35e496555809c6bb41338516c313bce4e697" dmcf-pid="f7s5Xh9UI6" dmcf-ptype="general"><strong>“AAII, 에이전트 AI 실제 업무 능력 평가엔 한계”</strong></p> <p contents-hash="32aaa2f815f9de229c3b48f0aada8e6601376a7dd96dfcb15281f04d15f84d50" dmcf-pid="4zO1Zl2uO8" dmcf-ptype="general">이번 결과를 놓고 전문가는 AAII의 유용성을 인정하면서도 평가 방식의 한계를 지적했다.</p> <p contents-hash="dd4be038c3fb4ca1cb43e7a0630b6983d5b54c82bc59ca51f99a697e530d2232" dmcf-pid="8qIt5SV7O4" dmcf-ptype="general">국가 AI전략위원회 기술혁신·인프라 분과 한 위원은 “아티피셜 애널리시스(Artificial Analysis) 같은 평가는 여러 모델의 성능을 빠르게 비교할 수 있다는 점에서 의미가 있다”면서도 “현재의 평가 방식만으로 에이전트 AI의 실제 업무 수행 능력을 모두 평가하기에는 한계가 있다”고 말했다.</p> <p contents-hash="5033240cc3a0f5563b9f24a7d29932ce532b2792457a6c9bd277713d706b5e43" dmcf-pid="65jvlEpXmf" dmcf-ptype="general">AI가 단순히 질문에 답하는 수준을 넘어 여러 차례 대화를 이어가고 웹사이트나 참고자료를 찾아 정보를 확인한 뒤 실제 업무를 수행하는 단계로 발전하고 있다는 이유에서다.</p> <p contents-hash="017fdda83cf63fe86c863b66d5ec9e87e2cb01f2723331b0811f9616a15cb056" dmcf-pid="P1ATSDUZmV" dmcf-ptype="general">그는 “에이전트 AI는 하나의 업무를 수행하는 과정에서도 여러 단계의 추론과 실행이 필요하다”며 “기존 벤치마크만으로는 이런 복합적인 능력을 충분히 평가하기 어렵다”고 설명했다.</p> <p contents-hash="3570a3f7118b7026aaa4039bce2fc2810f15a453fa41feea840b359a1e28b26c" dmcf-pid="Qtcyvwu5I2" dmcf-ptype="general">실제 업무 수행 능력을 평가하려면 문제 해결 과정 전체를 확인해야 하는 만큼 평가에 필요한 시간과 비용도 커진다. 이 때문에 현재는 여러 모델의 성능을 빠르게 비교할 수 있는 기존 벤치마크가 널리 활용되고 있지만, 실제 AI 서비스 환경과는 차이가 있을 수 있다는 설명이다.</p> <p contents-hash="d81c444ee2e1b63806a8f73c8245f46017725a2cd323a9884cb11d14535b94ed" dmcf-pid="xFkWTr71w9" dmcf-ptype="general">다만 “AAII가 의미 없는 지표라는 것은 아니다”라며 “여러 모델의 성능을 동일한 기준에서 비교할 수 있다는 점에서 유용하지만, 에이전트 AI 시대의 모델 성능을 보여주는 유일한 지표로 봐서는 안 된다”고 말했다.</p> <p contents-hash="e99f2c95c4b1fbd5fbb19340132c453502875172d53b445e7bcf443eb660c22b" dmcf-pid="yg7MQbkLmK" dmcf-ptype="general"><strong>업스테이지·SKT “단일 지표로 모델 완성도 판단 어려워”</strong></p> <p contents-hash="ab6465eb3c458ea58e825ef98c31348d6048611ef59d9e893932f968945eb827" dmcf-pid="WazRxKEosb" dmcf-ptype="general">AAII에서 모티프에 뒤진 업스테이지와 SK텔레콤 역시 AAII 점수만으로 모델의 완성도를 판단해서는 안 된다는 입장이다. LG AI연구원은 별도 입장을 내지 않았다.</p> <p contents-hash="1d43d6156106dbc33df8162c41e658ed2cbabf4e4efe9c35041a4e1e4927331f" dmcf-pid="YNqeM9DgmB" dmcf-ptype="general">SK텔레콤은 “AAII는 독파모 평가 기준의 일부이며 전문가 평가와 사용자 평가도 남아 있다”며 “단일 지표만으로 모델의 완성도를 대표하기 어렵다는 점을 고려해 달라”고 밝혔다.</p> <p contents-hash="53f55128a87be6db6e9da7f0e932c666baa704a06dffb2f1b07c775b7b57f6f6" dmcf-pid="GjBdR2wamq" dmcf-ptype="general">이어 “모델의 경쟁력은 지표뿐 아니라 실제 활용 환경에서의 성능·비용·안정성이 함께 평가돼야 한다”며 “지표상 보완이 필요한 영역은 개선하면서 실제 사용 환경에서의 성능 향상도 병행할 계획”이라고 밝혔다.</p> <p contents-hash="b1148952956c7f54053e14430975e6843cda3d1e979583a1ac091d146b06f3c7" dmcf-pid="HAbJeVrNOz" dmcf-ptype="general">업스테이지 역시 “AAII 벤치마킹 결과가 의미 없는 것은 아니지만 이를 모델 성능의 절대적인 기준으로 봐서는 안 된다”며 “NIA의 비공개 평가도 함께 봐야 한다”고 말했다.</p> <p contents-hash="1622ee2672125c79a22da7b30aa0e7b9e78d50f515f6d9a64fa0cbdcb33cd0f3" dmcf-pid="XTJmwoXSw7" dmcf-ptype="general"><strong>‘AAII 1위’가 독파모 최종 1위로 이어질까</strong></p> <p contents-hash="0d19e04168bbac3b3d2d12f7ec0a753bdeacbccc50c6484c0addf7576456697a" dmcf-pid="ZyisrgZvsu" dmcf-ptype="general">이번 AAII 결과는 국내 AI 모델을 동일한 글로벌 기준에서 비교했다는 점에서 의미가 있다. 특히 모티프3가 글로벌 모델들과 비교해 높은 점수(10위)를 기록하면서 국내 AI 업계에서도 주목할 만한 성과로 평가된다.</p> <p contents-hash="cfa501e1d17c8df80395237768fce9ac71e414a770f77672a8b44fde68b26bba" dmcf-pid="5WnOma5TOU" dmcf-ptype="general">하지만 AAII 점수만으로 모델의 종합적인 경쟁력을 판단하기에는 분명한 한계가 있다. AAII는 여러 평가 결과를 하나의 점수로 종합하는 지표인 만큼 어떤 평가 항목을 포함하느냐에 따라 결과가 달라질 수 있다. 한국어 능력이나 특정 산업의 업무 수행 능력, 실제 서비스에서의 비용·속도·안정성 등도 점수 하나로 충분히 보여주기 어렵다.</p> <p contents-hash="5ad6654da5eff159c38b6ea6ec17fde1d1c244fc529b181bfbef20bbc32e970f" dmcf-pid="1YLIsN1yrp" dmcf-ptype="general">실제 아티피셜 애널리시스도 종합 지능 지수 외에 모델의 응답 속도, 사용 비용, 코딩 에이전트 성능 등 다양한 지표를 별도로 제공하고 있다. 하나의 종합 점수만으로 AI 모델의 모든 경쟁력을 설명하기 어렵다는 의미다.</p> <p contents-hash="6b212724b3fa0b1253203bbbe29ce7d86d776886b7664e7606b9491356ced9eb" dmcf-pid="tGoCOjtWm0" dmcf-ptype="general">현재 확인된 글로벌 평가 순위는 모티프 1위, 업스테이지 2위, SK텔레콤 3위, LG AI연구원 4위다. 그러나 이 순위가 곧 독파모 최종 순위를 의미하는 것은 아니다.</p> <p contents-hash="f9955bc3ae2526c62024cc221d619783c2c16ea6be1210a55e011ac586b1aee1" dmcf-pid="FHghIAFYE3" dmcf-ptype="general">AAII 25점에 NIA 평가 15점, 전문가·사용자 평가까지 더해지는 만큼 최종 결과에서 순위가 달라질 가능성도 있다.</p> <p contents-hash="996efcb5dbcaf74347ab0afb1b7b98f8792cc4c0f7abe029fed3d0150ff380aa" dmcf-pid="3XalCc3GOF" dmcf-ptype="general">이번 AAII 결과는 국내 AI 모델의 상대적인 성능을 가늠할 수 있는 중요한 참고 지표라는 의미가 크다. 다만 AI가 실제 산업과 서비스 현장에서 활용되기 위해서는 벤치마크 점수뿐 아니라 업무 수행 능력과 비용, 속도, 안정성 등을 함께 살펴봐야 한다.</p> <p contents-hash="93861e48f5b337c6b804a4ca34e108dc6aafe877e1334404f6f43dddc8de5729" dmcf-pid="0ZNShk0HIt" dmcf-ptype="general">독파모 3차 평가의 최종 관전 포인트 역시 ‘AAII 1위가 누구냐’를 넘어 글로벌 벤치마크 성적과 실제 AI 활용 능력을 어떻게 종합적으로 평가할 것인지에 맞춰질 전망이다.</p> <p contents-hash="002911e72ea4201ebf6f152a43d92eabf26b0d1acc2ef541e1752036dc6db618" dmcf-pid="p5jvlEpXD1" dmcf-ptype="general">김현아 (chaos@edaily.co.kr) </p> </section> </div> <p class="" data-translation="true">Copyright © 이데일리. 무단전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기