로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
'최대 100% 수익' 주식 전문가 사칭해 15억 가로챈 일당 무더기 검거(종합)
N
[실시간뉴스]
주택가 창고에 ‘시신 냉장고’…600억 돈벌이 된 日고독사, 왜
N
[실시간뉴스]
“빅맥지수 대신 카레지수...日 엔화 적정가치 62엔” [글로벌 왓]
N
[IT뉴스]
"로봇 기술은 한컴 몫"…소방 로봇 AI 독점 계약
N
[IT뉴스]
'노조는 하나, 교섭은 16번'…네이버 노조, 통합교섭 요구
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스][독파모 2차전下] ‘벤치마크 한계론’부터 ‘GPU 지원 규모’까지…지속되는 쟁점은?
온카뱅크관리자
조회:
7
2026-08-12 13:17:29
<div id="layerTranslateNotice" style="display:none;"></div> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="tUwe2YPKS0"> <figure class="figure_frm origin_fig" contents-hash="b0c01e44ede4d6da3f00912a23b43a3f0980fce8acec03ad8a16794ded5b6157" dmcf-pid="FurdVGQ9h3" dmcf-ptype="figure"> <p class="link_figure"><img class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/12/552796-pzfp7fF/20260812131546930nlxr.jpg" data-org-width="640" dmcf-mid="15L20sqFWp" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/12/552796-pzfp7fF/20260812131546930nlxr.jpg" width="658"></p> </figure> <p contents-hash="00f3c0a80cc5841ababb9253bd0c541b7ed9a10a3e75bcd0f35f1ae3d276379a" dmcf-pid="37mJfHx2yF" dmcf-ptype="general">[디지털데일리 구아현·오병훈기자] 정부 주도 ‘독자 AI 파운데이션 모델(독파모)’ 프로젝트 2차 평가 결과 발표를 앞두고 업계에서는 평가 방식을 비롯한 개발 지원책 등을 둘러싼 다양한 평가와 문제 제기가 지속되고 있다.</p> <p contents-hash="56115105cbd59cad8e5a242c30fe53294bdfbd162d87a089632f383e3772a3af" dmcf-pid="0zsi4XMVvt" dmcf-ptype="general">독파모 프로젝트는 정부가 이례적으로 경쟁 과정을 공개하는 방식으로 진행하고 있는 정책 사업이다. 평가 과정 자체를 비공개에 부치는 통상적인 조달 공모 방식과는 차이가 있다. 여러 차례 평가를 거쳐 다음 단계 진출 기업을 선별하고 국민이 직접 모델을 사용해 평가하는 방식까지 도입하면서 세간의 관심도 집중되고 있다.</p> <p contents-hash="51f62e8afca31bf1058ac3b410ff34cce9a8919c8c76d0edb110c0f125516829" dmcf-pid="pfTAepoMv1" dmcf-ptype="general">이렇다 보니 기업 입장에서도 정부 평가 방식과 지원책 등을 두고 사업 참여 환경과 이해관계에 따라 서로 다른 해석과 목소리를 내놓고 있다.</p> <p contents-hash="562cc74465fdcf6454d14f2305d00febbae20c29193f87678fb107f84e1c6c69" dmcf-pid="U4ycdUgRW5" dmcf-ptype="general">12일 업계에 따르면 정부는 독파모 2차 평가 절차를 마무리하고 조만간 3차 평가 진출 기업을 발표한다. 지난 8일부터 11일까지 진행된 국민평가를 끝으로 전문가 평가와 벤치마크 평가, 사용자 평가 등을 종합해 현재 4개 정예팀 중 상위 3개 팀을 선정하게 된다.</p> <p contents-hash="9db280bb2cbdc9650da4d941e50f1adc1bd87d895da05d5a37b12f6e24a04f25" dmcf-pid="u8WkJuaeyZ" dmcf-ptype="general"><strong>◆‘벤치마크 한계론’ 넘어 ‘무용론’ 나오는데…평가 방식 설왕설래</strong></p> <p contents-hash="40750f2f8190ba57f0f2fe1bb1dc729bab47c88873f751661f248fe05c67979b" dmcf-pid="76YEi7NdTX" dmcf-ptype="general">1차 평가 때부터 꾸준히 제기된 쟁점 중 하나는 ‘벤치마크’ 평가의 적절성 문제다. 1차 평가는 벤치마크 평가 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성됐다.</p> <p contents-hash="eaa21c744bfcf77462d9e44c73cf1408767b4c9845aeb9fbaf35598d2f86cbb7" dmcf-pid="zPGDnzjJTH" dmcf-ptype="general">이 가운데 벤치마크 평가 40점은 한국지능정보사회진흥원(NIA) 벤치마크 평가 10점, 글로벌 공통 벤치마크 평가 20점, 글로벌 개별 벤치마크 평가 10점으로 나뉘었다.</p> <p contents-hash="cdd8f9428e9d1e15b5dde250d620467da4d931f666d70b2df965be588efc6c38" dmcf-pid="qQHwLqAiSG" dmcf-ptype="general">NIA 평가는 수학·지식·장문 이해와 함께 신뢰성·안전성 등을 평가했다. 글로벌 공통 평가는 국제적으로 활용되는 13개 벤치마크를 토대로 에이전트·수학·지식·추론·지시 준수 등의 성능을 측정했다. 글로벌 개별 평가는 각 정예팀이 목표로 설정한 글로벌 최상위 모델과 비교 가능한 벤치마크 5종을 선정해 성능을 평가하는 방식으로 진행됐다. 2차 평가에서도 벤치마크 점수 내 세부 요소는 변했지만 총 40점으로 큰 틀에서는 변화가 없는 것으로 알려졌다.</p> <p contents-hash="eb6e1de8cc771b16c175be409e2fb713c70573b9812cad966330ed898231c499" dmcf-pid="BxXroBcnWY" dmcf-ptype="general">정부 입장에서는 평가 공정성과 객관성을 확보하기 위해 일정 수준의 정량 평가가 필요할 수밖에 없다. 업계에서도 벤치마크 자체를 평가에서 제외해야 한다는 주장보다는 모델 간 기본 성능을 같은 조건에서 비교하기 위한 최소한의 지표가 필요하다는 데에는 대체로 공감하는 분위기다. 벤치마크가 곧장 실제 사용성을 보증하지는 않더라도 모델의 기초적인 추론·지식·코딩 능력 등을 비교하는 참고 지표로는 의미가 있다는 것이다.</p> <p contents-hash="499ece059cd7380f0fec88b01f754b3dce2599166c09178b0f717a8b9aa3982d" dmcf-pid="bMZmgbkLTW" dmcf-ptype="general">쟁점의 핵심은 ‘비중’이다. 독파모 프로젝트는 자체 모델 개발에서 끝나는 것이 아니라 이를 기반으로 산업 현장에서 다양한 서비스와 특화모델을 만들어내겠다는 목적을 갖고 있다. 때문에 벤치마크 평가가 전체 점수에서 가장 높은 비중을 차지하는 것이 정책 목적과 완전히 맞아떨어지는지를 두고는 이견이 나온다.</p> <p contents-hash="5349850eaf9df697962dc1b6f1a56a5a5ae23cfe60d098c4f8c7df70a501506a" dmcf-pid="KR5saKEohy" dmcf-ptype="general">한 AI 업계 관계자는 “궁극적으로 좋은 AI 모델은 특화모델로 발전시키기 쉽고 효율적이면서 사용성이 뛰어나야 한다”며 “벤치마크가 모델 성능을 참고할 중요한 지표라는 점에는 동의하지만 당락을 좌우할 정도의 배점을 부여하는 것을 두고는 의견이 갈릴 수 있다”고 설명했다.</p> <p contents-hash="bd3059c6d65cfbc7fac1d9875246189ffe11317ed267f3b04cf2455516c2d5e5" dmcf-pid="9e1ON9DgTT" dmcf-ptype="general">최근 AI 학계에서도 이 같은 벤치마크의 한계를 지적하는 연구가 잇따르고 있다. 옥스퍼드대학교 인터넷연구소(OII) 등이 올해 2월 발표한 연구 논문에서는 주요 AI·머신러닝 학회에서 활용된 445개 LLM 벤치마크를 체계적으로 검토했다.</p> <p contents-hash="7b7854c79965413f1d22edb750f87f16c6d2e4160631b8610b207877db1173fc" dmcf-pid="2dtIj2waCv" dmcf-ptype="general">연구진은 일부 평가에서 측정하려는 능력에 대한 정의가 명확하지 않거나 기존 데이터를 그대로 평가문제로 활용하고 통계적 검증도 충분히 이뤄지지 않는 등 평가 결과의 타당성을 떨어뜨릴 수 있는 문제가 발견됐다고 지적했다.</p> <p contents-hash="63d9e16904b29cfdc0fca33bec99ca8389e77b8c9111e46d272e56e1d202c566" dmcf-pid="VLpSE8OclS" dmcf-ptype="general">쉽게 말하면 벤치마크는 AI 모델에 동일한 ‘시험지’를 나눠주고 점수를 비교하는 방식이다. 시험지가 실제 업무 능력을 제대로 반영한다는 전제가 성립한다면 높은 점수가 높은 성능을 의미할 수 있다. 반대로 시험문제의 범위가 지나치게 좁거나 모델이 학습 과정에서 비슷한 문제와 정답을 이미 접했다면 점수가 높아져도 실제 새로운 문제를 해결하는 능력까지 좋아졌다고 단정하기 어렵다는 설명이다.</p> <p contents-hash="19f30c3b528e4093ee7327af841a7d7deb6eea12efbba5142858b408489e94b1" dmcf-pid="foUvD6IkSl" dmcf-ptype="general">특히 최근에는 특정 벤치마크 점수를 집중적으로 끌어올리는 이른바 ‘벤치맥싱(Benchmaxxing)’도 평가 신뢰성을 둘러싼 화두로 떠올랐다. 벤치맥싱은 모델의 전반적인 능력을 높이는 것보다 공개된 평가 방식이나 특정 문제 유형에 맞춰 사후학습 데이터와 강화학습 자원을 집중함으로써 리더보드 점수를 최대화하는 방식을 뜻한다.</p> <p contents-hash="bc279d6eaabb438c418be4c23bd1aecb2cc53560e516a2f8031b379a1ccbfb49" dmcf-pid="4guTwPCElh" dmcf-ptype="general">실제 AI 모델의 사후학습용 데이터 제공과 성능 분석·개선을 지원하는 해외 전문업체들도 국내 시장 진출에 나서고 있다.</p> <p contents-hash="1e722ec57fd376b785dcc95a217c8781e24d48ea3ebf1a928e24a53f694aeef6" dmcf-pid="8a7yrQhDWC" dmcf-ptype="general">업계에서는 모델이 특정 벤치마크에서 취약한 영역을 찾아내고 여기에 맞는 학습 데이터를 추가하는 방식 자체가 문제라고 볼 수는 없지만 국가대표 모델을 선발하는 평가에서 특정 공개 지표의 비중이 지나치게 높을 경우 결과적으로 ‘좋은 모델을 만드는 경쟁’과 ‘좋은 평가 점수를 만드는 경쟁’ 사이의 경계가 흐려질 가능성을 경계하고 있는 분위기다.</p> <p contents-hash="26de84f1b9f46c387f47bb79796cd456a40416598c0f79e0f5a30faf064c4d6d" dmcf-pid="6NzWmxlwTI" dmcf-ptype="general"><strong>◆“정부 지원 GPU 부족”vs“정부 의존↑ 바람직하지 않아”</strong></p> <p contents-hash="5c2344f0a605baa827269085d78fd50585ca86462e8ece13b78a86b039048bc8" dmcf-pid="PjqYsMSrhO" dmcf-ptype="general">모델 개발을 위한 그래픽처리장치(GPU) 지원 규모도 독파모 사업 초기부터 이어져 온 쟁점이다. 과기정통부는 참여팀에게 B200 512장 또는 H100 1024장을 지원하기로 했다. SK텔레콤과 네이버클라우드는 당시 정부 GPU 임차사업의 공급사업자였기 때문에 해당 기간 정부 GPU 지원 대상에서 제외됐다.</p> <p contents-hash="8436bb7690183035e65f3fe2874d58ba3ccbbfaf868fe92b0b1c98f2419826e7" dmcf-pid="QABGORvmys" dmcf-ptype="general">업계에서는 정부 지원을 받은 기업에서도 정부가 제공한 GPU 외에 자체 보유 장비나 별도로 확보한 클라우드 연산 자원 등을 추가 투입했을 것으로 보고 있다. 모델 규모가 커질수록 사전학습뿐 아니라 사후학습과 추론, 멀티모달 기능 개발에 필요한 연산량도 함께 늘어나기 때문이다.</p> <p contents-hash="658bef1fbe3d39662bd79d942cbf73317244004d84d3e7e91cf1e90b543c8807" dmcf-pid="xcbHIeTsTm" dmcf-ptype="general">AI 인프라 기업 관계자는 “정부가 지원한 GPU 512장만으로는 대형 모델 학습에 필요한 연산량을 모두 감당하기 어렵고 실제 개발 과정에서는 자체 연산 자원을 추가로 투입할 수밖에 없다”며 “결국 모델 경쟁이 순수한 기술력뿐 아니라 어느 정도의 GPU와 자본을 추가 투입할 수 있느냐는 규모의 경쟁으로 이어질 가능성이 있다”고 말했다.</p> <p contents-hash="3fe4a229cb80887c2072dcb1ecf74dc23334320ba4fe194462e0c565f4921784" dmcf-pid="yurdVGQ9Wr" dmcf-ptype="general">특히 일부에서는 GPU 512장이 대규모 모델을 처음부터 학습시키기 위한 규모라기보다는 이미 만들어진 모델을 서비스하거나 제한적인 후속학습을 진행하는 데 가까운 수준이라는 평가도 나온다. 정해진 연산자원 안에서 개발해야 한다면 모델 파라미터 규모를 줄이거나 이미지 처리, 복잡한 추론처럼 연산량이 많이 필요한 기능에서 선택과 집중이 불가피하다는 것이다.</p> <p contents-hash="5bcf8c9660fac0deffaaeed6ee4f07175563c691447c16856fac36791de9ffab" dmcf-pid="W7mJfHx2hw" dmcf-ptype="general">문제는 이를 정부가 어디까지 보완해야 하느냐에 있다. 정부 지원 확대 필요성에는 공감하면서도 AI 모델을 개발하는 민간 기업이 필요한 연산자원을 모두 정부 지원에 의존하는 구조 역시 바람직하지 않다는 반론도 만만치 않다.</p> <p contents-hash="a9ccb0e8f074f843f23b16241513fcc967dbbef209c886229dcc5e009afd91aa" dmcf-pid="Yzsi4XMVTD" dmcf-ptype="general">이 때문에 독파모 사업 자체가 애초 정부 지원만으로 모델을 완성하는 구조라기보다는 정부가 초기 인프라와 개발 환경을 제공하고 민간의 추가 투자를 끌어내는 방식으로 설계됐다는 해석도 나온다. 다만 평가를 통해 국가대표 모델을 선발하는 사업인 만큼 기업별 자본력 차이가 곧 모델 성능과 평가 결과의 격차로 연결될 경우 정책 사업에서 어디까지 이를 허용할 것인지에 대한 논의는 계속될 것으로 보인다.</p> <p contents-hash="283dcaa7eebf8516fea2948a53da8c463d045c6159dd7acd9d1e5d6413755c65" dmcf-pid="GPGDnzjJCE" dmcf-ptype="general">향후 지원 방식도 GPU 수량 확대만으로 접근해서는 안 된다는 의견도 나온다. AI 기술 경쟁의 중심이 대규모 사전학습에서 추론과 에이전트 활용으로 넓어지는 만큼 2차·3차 단계로 갈수록 연산자원 지원 규모를 현실화하는 동시에 NPU를 비롯한 추론용 인프라까지 지원 범위를 다변화할 필요가 있다는 설명이다.</p> <p contents-hash="21894970a68988b7796ba26fc96d99bb68c3da89dab78ebd92ab2839d654bff5" dmcf-pid="HQHwLqAilk" dmcf-ptype="general">AI 모델 기업 관계자는 “정부 지원 GPU가 넉넉하지 않은 것은 사실이지만 AI 모델을 개발하는 기업이 필요한 연산 자원을 전부 정부에 의존할 수도 없다”며 “자체 인프라와 투자 여력이 큰 기업과 스타트업 사이에 어느 정도 격차가 발생하는 것은 불가피하고, 이를 정부가 모두 동일한 수준으로 맞추는 방식 역시 현실적이지 않다”고 말했다.</p> </section> </div> <p class="" data-translation="true">Copyright © 디지털데일리. All rights reserved. 무단 전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기