로그인
보증업체
스포츠중계
스포츠분석
먹튀사이트
지식/노하우
판매의뢰
업체홍보/구인
뉴스
커뮤니티
포토
포인트
보증카지노
보증토토
보증홀덤
스포츠 중계
기타
축구
야구
농구
배구
하키
미식축구
카지노 먹튀
토토 먹튀
먹튀제보
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
제작판매
제작의뢰
게임
구인
구직
총판
제작업체홍보
실시간뉴스
스포츠뉴스
연예뉴스
IT뉴스
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[실시간뉴스]
'북핵 고도화 제동' 공감대 있지만…靑, 불안한 한미관계 속 북미대화 주시
N
[IT뉴스]
“전기차는 불쑥, 충전기는 주춤”…100만대 시대의 인프라 ‘경고음’
N
[IT뉴스]
[AI혁명](212)공간의 맥락을 읽는다…드론·위성 다 잡은 '메이사'
N
[실시간뉴스]
캐나다 보복관세에 美 "대응" 방침…협상결렬에 무역갈등 격화(종합)
N
[IT뉴스]
개인정보 가려도 데이터 활용 가치는 살린다 ‘가명처리 솔루션’ [보안TMI]
N
커뮤니티
더보기
[자유게시판]
드디어 금요일이군요
[자유게시판]
오늘 다저스 어떻게 생각하시나요
[자유게시판]
하아 댓노
[자유게시판]
식곤증지립니다요
[자유게시판]
벌써 불금이네요
목록
글쓰기
[IT뉴스][독파모 2차전 진단②] ‘잘 쓰이는 AI’ 가린다더니… 사용성 평가는 충분했나
온카뱅크관리자
조회:
8
2026-08-23 05:57:25
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">“3차전 평가단 늘리고 실제 사용환경 반영해야”</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="7PxkHA0HT5"> <figure class="figure_frm origin_fig" contents-hash="50f0041a4bec607041160199b2bebaf8e0e25d8d57630175d0a746e6e97a8600" dmcf-pid="zQMEXcpXTZ" dmcf-ptype="figure"> <p class="link_figure"><img class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/23/552796-pzfp7fF/20260823055611467lqgk.jpg" data-org-width="640" dmcf-mid="UyMEXcpXWt" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/23/552796-pzfp7fF/20260823055611467lqgk.jpg" width="658"></p> </figure> <p contents-hash="c4397aa1483feec3ad4719e456dbd7670c871d043d1afd08355a75c7ce66fc9b" dmcf-pid="qxRDZkUZlX" dmcf-ptype="general">[디지털데일리 구아현기자] 정부가 ‘실제로 잘 쓰이는 인공지능(AI)’을 가리겠다며 독자 AI 파운데이션 모델(독파모) 2차 평가에 국민 사용성 평가를 도입했지만 평가 방식에는 보완이 필요하다는 지적이 나온다. 모델별 최소 체험시간은 3분이었고 평가 대상도 텍스트 전용 언어모델(LLM)에 한정됐다. 일반 국민 200명을 뽑았지만 실제 평가자는 185명이었다.</p> <p contents-hash="006e699127b21ad55737cdc58461cdd09f9e50e38a9cc1d652a2d5c02ace4616" dmcf-pid="BMew5Eu5vH" dmcf-ptype="general">과학기술정보통신부에 따르면 독파모 2차 사용자 평가는 전체 100점 가운데 25점이다. AI 전문사용자 평가 15점과 일반 국민 평가 10점으로 나뉜다. AI 전문사용자는 50명을 선정해 49명이 참여했고, 일반 국민은 성별·연령별 쿼터를 적용해 200명을 무작위 선정한 뒤 185명이 실제 평가했다.</p> <p contents-hash="d9a692b044c27b35cb2eb57dff3d45342aaedcf51e34f7d92075bdb4c4a1a58a" dmcf-pid="bRdr1D71hG" dmcf-ptype="general">지난 1월 1차 단계평가에서는 기존 5개 정예팀 가운데 LG AI연구원과 SK텔레콤, 업스테이지 등 3개 팀이 2차 단계에 진출하고 네이버클라우드와 NC AI가 탈락했다. 이후 추가 공모를 거쳐 모티프테크놀로지가 합류하면서 4개 팀이 2차 평가를 치렀고, LG AI연구원과 SK텔레콤, 업스테이지가 3차 단계에 진출했다.</p> <p contents-hash="066ec50fcb5fbd6f52212c710b6bae1b05bdae062b99ec510c7b33517972e977" dmcf-pid="KeJmtwztWY" dmcf-ptype="general">평가자는 4개 정예팀 모델을 적용한 별도 웹사이트에서 AI를 직접 써본 뒤 모델마다 1점 ‘매우 미흡’부터 5점 ‘매우 우수’까지 절대평가했다. 정부는 모델 노출 순서를 무작위로 하고 사용자환경(UI)·사용자경험(UX)이 아닌 모델이 만든 콘텐츠의 내용과 품질을 중심으로 보도록 안내했다.</p> <p contents-hash="ebeba2dd242abe24345177fed425294c13886bd36ce47678209c2f6a2afada3f" dmcf-pid="9t38cfOchW" dmcf-ptype="general">일반 국민 평가는 AI 사용 경험과 프롬프트 작성 능력, 답변을 판단하는 기준이 사람마다 달라 평가 편차인 ‘노이즈’가 상대적으로 클 수 있다. 업계에서는 국민 참여 취지는 긍정적이지만 185명으로 이 같은 편차를 충분히 줄였는지 따져봐야 한다는 목소리가 나온다.</p> <p contents-hash="23cdcdb58b7803ab5089157984898a1d5240c9a01a96037117fbd69772e541ec" dmcf-pid="2F06k4Ikvy" dmcf-ptype="general"><strong>◆최소 3분·텍스트 전용 평가…‘실사용’ 가리기 충분했나</strong></p> <p contents-hash="07d72a99c42c51439e99bdebc58cbd3170a5dd554f6f4e51c98c2582111c650f" dmcf-pid="V3pPE8CElT" dmcf-ptype="general">평가 가이드에는 각 모델을 최소 3분 이상 사용해야 평가 버튼이 활성화된다고 명시돼 있다. 평가 대상은 ‘텍스트 전용 언어모델(LLM)’로 제한했고 이미지·비디오 생성 등 텍스트 이외 기능은 평가에서 제외했다. 평가 문항은 단순 질의응답보다 복잡한 지시 수행과 논리적 문제 해결 능력을 살피는 데 초점을 맞췄다.</p> <p contents-hash="9d83c4da36643c7224d8f784c6092178b8712c2a8fe5e8858ae11930faa04b9d" dmcf-pid="f0UQD6hDvv" dmcf-ptype="general">다만 실제 AI 활용은 이미 텍스트 질의응답을 넘어섰다. 반면 이번 평가 환경에서는 대부분 문서 파일 업로드 자체가 지원되지 않았고, 일부 모델은 파일을 첨부할 수 있어도 사실상 텍스트 처리에 그쳐 표·그래프 등 문서 안의 다양한 정보를 제대로 다루기 어려웠다는 게 평가 참여자의 설명이다.</p> <p contents-hash="0257bd8ab90f72b93bdf97b0dd607d0514e501342e0aca42a243222b3f8225c1" dmcf-pid="4puxwPlwhS" dmcf-ptype="general">이번 평가가 텍스트 LLM을 대상으로 한 만큼 멀티모달 기능을 제외한 것 자체가 잘못됐다고 보기는 어렵다. 다만 정부가 ‘사용성’을 국가대표 AI의 주요 판단 기준으로 삼는다면 텍스트 답변 중심 평가만으로 실제 활용 경쟁력까지 충분히 가릴 수 있느냐는 질문은 남는다.</p> <p contents-hash="d375564ba9d2f21e5f94b299922e6310f434a8d645755476a8e841b2d1f76182" dmcf-pid="8U7MrQSrSl" dmcf-ptype="general">평가시간도 쟁점이다. ‘최소 3분’은 3분만 평가했다는 뜻은 아니지만, 짧은 체험과 실제 업무에서 반복적으로 AI를 사용하는 것은 성격이 다르다. 사용성을 보려면 일회성 답변 품질뿐 아니라 긴 문맥 유지, 반복 작업의 안정성, 복잡한 업무 수행 능력까지 볼 필요가 있다는 지적이다.</p> <p contents-hash="1c1a58d80b6af7c11ee16e073f8b93debb55f4cf789b676e0ad50684918ddb7c" dmcf-pid="6uzRmxvmlh" dmcf-ptype="general">한 AI 기업 대표는 “국민이 직접 모델을 써보고 평가하도록 한 방향은 긍정적”이라면서도 “이번 방식은 모델을 충분히 사용한 뒤 판단하기에는 단순했다”고 말했다. 이어 “실제 업무에서는 텍스트뿐 아니라 파일 속 표와 그래프 등을 함께 처리하는 경우가 많은 만큼 평가시간을 충분히 주고 기능 범위를 넓힐 필요가 있다”고 말했다.</p> <figure class="figure_frm origin_fig" contents-hash="c43dc72416acd76de16742c3a6632382b5eaa62b76e183b83ba015d535ffbe55" dmcf-pid="P7qesMTsCC" dmcf-ptype="figure"> <p class="link_figure"><img class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/23/552796-pzfp7fF/20260823055611743vghv.jpg" data-org-width="640" dmcf-mid="u4PAYNFYC1" dmcf-mtype="image" height="auto" src="https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/23/552796-pzfp7fF/20260823055611743vghv.jpg" width="658"></p> </figure> <p contents-hash="e3443ce2edc1e417d35f6ae88067ae8b8fab8945e42b2f6f0a618180a56fa2c8" dmcf-pid="QzBdORyOyI" dmcf-ptype="general"><strong>◆ 국민평가 10점에 185명 참여… 전문사용자와 1위도 갈렸다</strong></p> <p contents-hash="6fca5ef4548e15f0f77ed7fcbb6973470525981ffc024bd6f4dbfa490cdac500" dmcf-pid="xIh3QtnQyO" dmcf-ptype="general">쟁점은 일반 국민 평가다. 정부는 주민등록인구 통계를 기준으로 성별·연령별 쿼터를 적용해 200명을 무작위 선정했지만 실제 참여자는 185명이었다. 이들의 평가 결과는 전체 100점 가운데 10점으로 환산돼 최종 점수에 반영됐다.</p> <p contents-hash="64491c15eeb78e2210021e505a51bfa0c8650e5d5b7cb03216a9f6794bf99ef9" dmcf-pid="yV4aTo5TTs" dmcf-ptype="general">일반 국민 평가는 전문가나 AI 전문사용자 평가보다 평가자별 편차가 커질 가능성이 있다. AI 사용 경험과 프롬프트 작성 방식이 다르면 같은 모델에서도 받아보는 답변이 달라질 수 있고, ‘좋은 답변’을 판단하는 기준 역시 사람마다 다르기 때문이다.</p> <p contents-hash="714fe158e842123a790ba8546877b9b5ba1ada23ac30d84029f675a0565a80d4" dmcf-pid="Wf8Nyg1ylm" dmcf-ptype="general">성별·연령별 쿼터를 맞춰 인구학적 대표성을 높이는 것과 개인별 평가 편차를 줄여 결과의 안정성을 높이는 것은 별개의 문제다. 국민평가를 최종 선발 점수에 반영한다면 평가단 규모와 AI 숙련도 차이가 결과에 미치는 영향까지 보다 정교하게 관리해야 한다는 지적이 나온다.</p> <p contents-hash="fac33447b0722fc70b814cc1a244888d750898ccb3675e5ce6552a4b7670a819" dmcf-pid="Y46jWatWhr" dmcf-ptype="general">실제로 평가집단에 따라 최고점 모델도 달랐다. AI 전문사용자 49명의 평가에서는 SK텔레콤이 15점 만점에 11.6점으로 1위를 차지했다. 반면 일반 국민 평가에서는 LG AI연구원이 10점 만점에 7.6점으로 가장 높은 점수를 받았다. 4개 팀 평균은 각각 10.53점과 7.03점이었다.</p> <p contents-hash="c6dac1dae0cfdd6b69c7a175a89a404bb388062718cf6d6a75f4c30c5bc36d48" dmcf-pid="G8PAYNFYSw" dmcf-ptype="general">전문사용자와 일반 국민이 서로 다른 모델에 최고점을 준 셈이다. 어느 한쪽 평가가 잘못됐다는 뜻은 아니다. 오히려 ‘사용성’이 하나의 고정된 지표가 아니라 사용자의 숙련도와 이용 목적에 따라 달라질 수 있음을 보여준다.</p> <p contents-hash="211c415df7401030b031271500ba3048ff630a537a1cf763499e5ac15f1c2073" dmcf-pid="H6QcGj3GvD" dmcf-ptype="general">이에 일반 국민에게는 일상적인 질의에 대한 이해도와 만족도를, 전문사용자에게는 복잡한 지시이행과 문서 분석, 코딩·도구 활용 등 업무 수행 능력을 평가하도록 역할을 세분화할 필요가 있다는 제언도 나온다.</p> <p contents-hash="0147281d0aa87aa2da72bf1b5e924d6657971df9fa4339c5ef668cf2cc19e71a" dmcf-pid="XPxkHA0HWE" dmcf-ptype="general">한 AI 업계 관계자는 “일반인 평가는 아무래도 노이즈가 끼게 된다”며 “다양한 계층과 연령을 뽑았다고 해도 200명 안팎으로는 모집단이 충분하지 않다고 본다”고 말했다. 이어 “평가단을 더 늘리고 모델을 충분히 테스트할 수 있는 시간도 보장해야 한다”고 강조했다.</p> <p contents-hash="2571c5bb11018a877a591fc180be3147d8486b9e5c654038be0a05c73a5cb2b5" dmcf-pid="ZQMEXcpXSk" dmcf-ptype="general"><strong>◆ 3차전 배점 조정·국민평가단 늘려 평가 신뢰 높여야</strong></p> <p contents-hash="ea3d0931840e9e24b2687bfbd8e10162def617e13ce9b4e93c80506a97008492" dmcf-pid="5xRDZkUZSc" dmcf-ptype="general">정부는 3차 평가방식을 아직 확정하지 않았다. 1·2차 평가에서 나온 보완점을 검토한 뒤 업스테이지·SK텔레콤·LG AI연구원과 논의해 평가 기준을 정할 예정이다.</p> <p contents-hash="ae182a9ee44cd3e65425514ed44921200e0c827cc0e2ac1a24890b39304c8820" dmcf-pid="1Mew5Eu5vA" dmcf-ptype="general">업계에서는 국민평가를 줄이기보다 정교하게 확대해야 한다는 의견이 나온다. 평가단을 늘려 개인별 편차를 낮추고 모델을 충분히 사용할 시간을 주는 동시에 실제 이용환경에 가까운 과제를 포함해야 한다는 주장이다.</p> <p contents-hash="595ab306eed8e5dd56a9feebfd62245c737b29b3e1413a4df459a1d612ef9a5a" dmcf-pid="t46jWatWvj" dmcf-ptype="general">평가 범위도 넓힐 필요가 있다. 단순 텍스트 질의응답을 넘어 문서에서 필요한 정보를 찾거나 표·그래프를 분석하고, 이미지와 텍스트를 함께 처리하거나 여러 단계의 업무를 수행하는 과제를 동일한 조건에서 제시하는 방식이다.</p> <p contents-hash="70ab84cf5e9bb9578a02b53cdf50fdbd9578fd5768e5fb21b79b7bf62445b526" dmcf-pid="F8PAYNFYlN" dmcf-ptype="general">반대로 단순 이용자 수나 깃허브 다운로드, 업무협약(MOU), 실증(PoC) 건수를 사용성 지표로 삼는 것도 신중해야 한다. 기존 고객과 서비스 채널을 가진 대기업이 신생 AI 기업보다 구조적으로 유리할 수 있어서다. 실제 현장에서 동일한 업무를 얼마나 정확하고 안정적으로 수행하는지를 비교하는 방식이 더 적절하다는 지적이 나온다.</p> <p contents-hash="57cb63c88209ff908f1d6d344c189e6dfcbd08f1e1f9089cd15bed3fe589ad98" dmcf-pid="36QcGj3Gha" dmcf-ptype="general">3차 평가의 과제는 사용자 평가 배점을 몇 점으로 조정할지에만 있지 않다. 국민평가단 규모를 확대해 개인별 평가 편차를 낮추고, 충분한 체험시간과 실제 사용환경에 가까운 과제를 마련해 사용성 평가 자체의 신뢰도를 높이는 것이 중요하다.</p> <p contents-hash="8eebdd06fbb0c20d34abc8d58ab0f00b22aae79189fdffe593868099bb0a69fe" dmcf-pid="0PxkHA0HCg" dmcf-ptype="general">다른 AI 기업 대표는 “국민 평가를 없앨 것이 아니라 제대로 확대해야 한다”며 “평가 인원을 늘리고 충분한 시간 동안 모델을 써본 뒤 점수를 매겨야 평가 신뢰도도 높아질 수 있다”고 말했다.</p> <p contents-hash="5a0071125cb8af0fb1a76ac898403a236c6361efc0a49dd1741f25fca37dc8b7" dmcf-pid="pQMEXcpXWo" dmcf-ptype="general">한 AI 업계 관계자도 “벤치마크는 모델의 기본 능력을 확인하는 잣대지만 연구실에서 성능이 좋은 모델과 실제 서비스에서 잘 쓰이는 모델은 다를 수 있다”며 “사용자가 충분히 활용한 뒤 평가하는 방식이 더 중요해질 것”이라고 말했다.</p> </section> </div> <p class="" data-translation="true">Copyright © 디지털데일리. All rights reserved. 무단 전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기