로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
보편형 공공임대 50% 이상 청년에…전세주택·월세 지원 확대
N
[실시간뉴스]
'헌법재판관 미임명·졸속 지명' 한덕수 1심 10월 26일 선고(종합)
N
[실시간뉴스]
혼인신고 1백만 원, 출산 최대 2천만 원‥ 일자리 창출 등 청년 예산 43조 원 투입
N
[실시간뉴스]
野 "李 대법관 후보자 재제청 요구는 위헌…명백한 탄핵 사유"(종합)
N
[실시간뉴스]
청년 지원 더, 더… 내년 청년 일자리·교육·주거·자산 全단계 43조 투입
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스]흔들리는 ‘국가대표 AI’ 선발… 평가 방식·배점 놓고 잡음 이어져
온카뱅크관리자
조회:
4
2026-08-28 17:57:25
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">글로벌 벤치마크 1위가 탈락하는 ‘국가대표 AI’ 선발<br>평가 잣대 바뀌며 ‘압도적 1위’ LG가 3위로<br>세부점수 뒤늦게 공개… “평가 방식 모호” 지적도</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="ULQDe1iPcf"> <p contents-hash="72de67b4fcaa84e51994720081929c682e755cb3ff96dc67f461a0eb14ac747e" dmcf-pid="uoxwdtnQcV" dmcf-ptype="general">정부가 ‘국가대표 인공지능(AI)’을 가리겠다며 추진 중인 ‘독자 AI 파운데이션 모델(독파모)’에서 잡음이 지속하고 있다. 2차 평가에서 글로벌 벤치마크 AAII 최고점을 받은 모티프테크놀로지스가 탈락하면서다. ‘패자 부활전’을 거쳐 뒤늦게 합류한 팀이 성능 1위임에도 탈락하는 구조가 온당하냐는 물음과, 과학기술정보통신부가 뒤늦게 세부 점수를 공개한 과정이 매끄럽지 않다는 지적이 나온다.</p> <figure class="figure_frm origin_fig" contents-hash="13a376e6010ebe847fb136710a4b7cab87daaab51273bcd9000cf3b35df5a2bf" dmcf-pid="7gMrJFLxo2" dmcf-ptype="figure"> <p class="link_figure"><img alt="류제명 과학기술정보통신부 2차관이 지난 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다. /연합뉴스" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/28/chosunbiz/20260828175108719cqtz.jpg" data-org-width="2000" dmcf-mid="pIcGwVsAj4" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/28/chosunbiz/20260828175108719cqtz.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 류제명 과학기술정보통신부 2차관이 지난 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다. /연합뉴스 </figcaption> </figure> <p contents-hash="8585105fb02dd092d23f811997e46ff5f5383b472fc89e347171520bf6bf6f4b" dmcf-pid="z9pMzsb0g9" dmcf-ptype="general"><strong>◇ 글로벌 벤치마크 1위가 탈락하는 평가</strong></p> <p contents-hash="b1203df2554f54e7a7236c026b1a00c1c4b138e74f1f4e40f34de13cc40f50a2" dmcf-pid="q2URqOKpaK" dmcf-ptype="general">28일 과기정통부에 따르면, 모티프는 AAII 벤치마크 평가(25점 만점)에서 1위를 차지했으나 NIA 벤치마크 평가(15점 만점), 전문가 평가(35점 만점), 사용자 평가(25점 만점)에서 4위를 기록하며 최종 4위로 탈락했다. 종합 점수 1위는 SK텔레콤(70.6점), 2위는 업스테이지(69.9점), 3위는 LG AI연구원(69.0점)이다. 모티프는 65.8점을 받았다.</p> <p contents-hash="d6d01e709e04f7808ea373d646ec318551ce3e5f3d1a858d8f47bd3e4b3dae4e" dmcf-pid="BVueBI9Ucb" dmcf-ptype="general">AAII 벤치마크는 과기정통부가 2차 평가의 신뢰성·공정성 확보를 위해 새로 도입한 평가 방식이다. 과기정통부는 당시 “전 세계 유수 글로벌 빅테크도 고득점을 받기 어려운 공신력 높은 벤치마크”라고 했다. 모티프는 AAII에서 47점을 받아 참여 4개 모델 중 1위였고, 글로벌에서도 10위에 올랐다.</p> <p contents-hash="80124ae605b02d9c4a5a29d86535273f1ca9a9c4ed070fc4ed5c26be03af393a" dmcf-pid="bf7dbC2ukB" dmcf-ptype="general">벤치마크가 과연 모델의 성능을 제대로 평가할 수 있냐는 지적과 모티프가 벤치마크 점수를 끌어올리는 이른바 ‘벤치맥싱’을 한 것 아니냐는 논란이 나왔지만, 평가 배점 산정 방식에 문제가 있다는 모티프의 주장에도 설득력이 있다. 글로벌 최고 수준의 모델인 앤트로픽의 오푸스5는 AAII 점수가 63점인데, 이를 25점 만점으로 환산하면 15.75점에 불과해 모델 간 실제 성능 차이가 평가 점수에 충분히 반영되지 않는다는 것이다. 실제 2차 평가에서 AAII 벤치마크 점수는 모티프 11.9점, 업스테이지 9.4점, SK텔레콤 8.8점, LG AI연구원 7.8점이었다. 15점 만점인 NIA 벤치마크 점수는 12.7~13.4점에 분포했는데, 25점 만점인 AAII 벤치마크 점수는 7.8~11.9점에 분포했다. 또 참가사의 벤치맥싱은 없었다고 AAII 평가 기관이 밝혔다.</p> <p contents-hash="9df5bb32cc4c48e1bf6f6efe5e1552713f951835eb72167a955484b05999a559" dmcf-pid="K4zJKhV7aq" dmcf-ptype="general">1차 평가에서 벤치마크, 전문가, 사용자 등 세 평가 항목을 모두 석권하며 90.2점(5개 팀 평균 79.7점)으로 압도적 1위를 차지한 LG AI연구원은 2차 평가에서 3위로 밀렸는데, 이를 보면 정부의 평가 방식 변경에 따라 순위가 완전히 뒤바뀐다는 점도 알 수 있다. 2차 평가에서 새로 추가된 AAII 벤치마크에서 LG AI연구원이 최저점을 받으며 순위가 뒤처졌기 때문이다.</p> <p contents-hash="ec865d1cd96b5132a1f28976666c4e85a49d29d1e649e20a218c01dd40be5dd0" dmcf-pid="98qi9lfzAz" dmcf-ptype="general">또 1~3위의 최종 평가 점수가 69.0~70.6점으로 미세한 상황에서, 평가위원 개인의 점수 성향이 순위에 미치는 영향이 작지 않은 것으로 나타났다. 과기정통부가 전날 공개한 전문가 평가(35점 만점) 세부 점수를 보면, 평가위원 10명 중 ‘위원7’은 업스테이지에 30점을 주면서 LG AI연구원에 24점, SK텔레콤에 20점, 모티프에 17점을 매겼다. 점수 편차를 크게 두는 배점 성향으로, 최저점과 최고점의 차이가 13점에 달했다. 반면 나머지 평가 위원들은 최저점과 최고점의 차이가 평균 4.6점에 불과해 배점 차이가 작다. 정부는 최고·최저 점수를 제외한 나머지 평가점수를 산술 평균하는 방식을 도입했는데, ‘위원7’이 LG AI연구원·SK텔레콤·모티프에 준 점수는 모두 10명 중 최저점이어서 반영되지 않았으나 업스테이지에 준 30점은 최고점이 아니어서 반영됐다.</p> <p contents-hash="deb68c15a5a42f5b1fad28aea6756c0abf63166542ab75ac047ac4e542af8542" dmcf-pid="26Bn2S4qA7" dmcf-ptype="general">편차가 유독 큰 ‘위원7’을 제외하고 같은 방식으로 전문가 평가 점수를 다시 산출하면, 2위 업스테이지와 3위 LG AI연구원의 종합 점수 격차가 0.9점에서 0.1점대로 좁혀진다.</p> <p contents-hash="e1015ad4c9add6d63b510935dbaf9f753656d88ccdceb0a6e349bbf345851838" dmcf-pid="VPbLVv8Bou" dmcf-ptype="general"><strong>◇ 절차도 매끄럽지 않아</strong></p> <p contents-hash="3c29531519732ab83705ef1ce2db5a62e2d600dc200db24c41119b6fae7ca068" dmcf-pid="fQKofT6boU" dmcf-ptype="general">과정도 매끄럽지 않았다. 과기정통부는 8월 18일 2차 결과를 발표할 때 진출·탈락 여부만 공개하고, 진출팀의 순위와 세부 점수는 내놓지 않았다. 세금이 투입되는 사업인데 순위조차 밝히지 않는다는 비판이 이어지자, 20일에는 하위 팀 ‘낙인 효과’를 이유로 항목별 1위 팀 등만 부분 공개했다. 전 항목 점수가 밝혀진 것은 모티프가 입장문을 내고 전면 공개를 요구한 뒤였다. 앞서 1차 평가에서 네이버클라우드가 ‘독자성’ 기준 미충족으로 탈락한 것과 이후 예정에 없던 패자 부활전을 진행한 것도 정책 신뢰성 및 공정성 논란을 낳았다. 공정성 의문은 업스테이지와 하정우 전 청와대 AI미래기획수석 관련 이해충돌 논란으로 증폭됐다.</p> <p contents-hash="18860e694c71997979efb6ca52494cbc60f56952ee88838f022945e86a8b0252" dmcf-pid="4x9g4yPKjp" dmcf-ptype="general">근본적으로 독파모 사업의 목표와 평가 잣대가 어긋난다는 지적도 제기된다. 독파모는 프런티어 AI 모델 대비 95% 이상 성능을 목표로 시작했는데, 2차 배점은 벤치마크(40점)보다 사람이 매기는 전문가·사용자 평가(60점)에 무게가 실렸다. 업계에서는 사용성 제고나 서비스 확산은 ‘모두의 AI’ 사업에서 다룰 일이지, 기술력을 겨루는 독파모 사업의 핵심 잣대로 삼을 일이냐고 반문한다.</p> <p contents-hash="fea3c8ad65385a53821641c896f14fdabfec45ed5cb91ac446e33126c29dabf8" dmcf-pid="8M2a8WQ9N0" dmcf-ptype="general">방식의 한계는 정부도 인정하고 있다. 배경훈 부총리 겸 과학기술정보통신부 장관은 “1년 반 전 수립된 평가나 경쟁 방식이 3~6개월 단위로 급변하는 AI 트렌드에 여전히 유효한지 근본적인 고민이 필요한 시점”이라며 “누구나 인정할 수 있는 세계적인 수준의 모델을 만들기 위해 정부 투자 집중 방식과 평가 제도의 보완을 검토하겠다”고 했다.</p> <p contents-hash="e196444ee78a6d6c5410e5c2b343004fc7d9ebdd8bd7f02416b4f4457e75fc02" dmcf-pid="6RVN6Yx2j3" dmcf-ptype="general">김장현 성균관대 교수는 “모델 자체가 아무리 고도화됐더라도 이용자 수용성이 떨어지면 그 성능의 의미가 반감되는 측면이 있다”면서도 “대규모언어모델(LLM)의 성능을 조금이라도 높이기 위해 전 세계적으로 어마어마한 경쟁이 벌어지고, 단순 수치 경쟁처럼 보이지만 실제로는 다양한 측면을 테스트한 점수를 비교하는 것이어서 벤치마크는 그렇게 단순하지 않다”고 말했다. 이어 “정부가 이번에 논란이 된 사용성 부분의 심사 기준을 더 정교화해야 한다”고 했다.</p> <p contents-hash="52c735ac5e694d5351066f6e8bd94c0bf1f1fdd1595520f9e3a3d8f78d698c36" dmcf-pid="PefjPGMVoF" dmcf-ptype="general">- Copyright ⓒ 조선비즈 & Chosun.com -</p> </section> </div> <p class="" data-translation="true">Copyright © 조선비즈. 무단전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기