공유하기

카카오톡
블로그
페이스북
X
주소복사

'독파모' 2차 평가 항목별 최고점은 모티프·SKT·LG

조인영 기자 (ciy8100@dailian.co.kr)
입력 2026.08.20 15:06
수정 2026.08.20 15:07

AAII 모티프 11.9점·NIA SKT 13.4점

전문가·국민 평가선 LG AI연 최고점

류제명 과기정통부 2차관이 18일 오전 서울 종로구 정부서울청사에서 '독자 AI 파운데이션 모델' 프로젝트 2차 단계평가 결과를 발표하고 있다.ⓒ데일리안 조인영 기자

과학기술정보통신부가 ‘독자 AI 파운데이션 모델(독파모)’ 프로젝트 2차 단계평가의 세부 기준과 결과를 20일 공개했다.


평가 결과 AAII 벤치마크는 모티프테크놀로지스, NIA 벤치마크와 AI 전문 사용자 평가는 SK텔레콤, 전문가 평가와 일반 국민 평가는 LG AI연구원이 각각 항목별 최고점을 기록했다.


먼저 벤치마크 평가는 AAII(Artificial Analysis Intelligence Index) 벤치마크 평가(배점 25점)와 NIA 벤치마크 평가(배점 15점)로 구성된다.


AAII 벤치마크 점수 측정 방법 등은 6월말 AA(Artificial Analysis)에서 공표한 기준을 채택했다.


AAII 벤치마크 평가는, AA가 직접 평가 결과를 도출해 제공했고, AAII 벤치마크 점수는 25점 만점 스케일링해 최종 점수에 반영했다.


AAII 벤치마크 평가 점수는 모티프테크놀로지스 정예팀이 11.9점의 최고점을 득점했고, 4팀의 평균 점수는 9.48점이다.


NIA 벤치마크 평가는 7개 분야(수학, 지식, 장문이해, 안전성, 신뢰성, 한국어, 지시이행) 벤치마크 데이터셋으로 NIA에서 평가 결과를 도출하고 15점 만점 스케일링해 최종 점수에 반영했다.


NIA 벤치마크 평가 점수는 SK텔레콤 정예팀이 13.4점의 최고점을 득점했고, 4팀의 평균 점수는 13.05점이다.


전문가 평가는 다수 외부 전문가(산업계 3명, 학계 5명, 연구계 2명)로 평가위원회를 구성해 추진하고, 정예팀이 제출한 평가서류 등을 바탕으로 약 5일 간의 서면평가와 QnA를 병행해 진행했다.


전문가 평가 기준은 개발 전략 및 기술 10점, 개발 성과 및 계획 10점, 파급효과 및 기여계획 15점이며(독자성 최소기준 점검 병행), 각 평가위원 별 점수는 이를 합산해 산정했다.


새롭게 참여한 모티프테크놀로지스와 기존 정예팀 간 공정 경쟁 지원을 위해, 모티프테크놀로지스 정예팀의 국내 AI생태계 파급효과 평가는 새로운 독자 AI모델 기반이 아닌, 기존 AI모델의 현장확산 실적·계획까지 폭넓게 종합해 평가했다.


정예팀별 평가점수 산출은 위원별 평가점수 중 최고·최저 점수를 제외한 나머지 평가점수를 산술 평균했다.


이를 종합한 전문가 평가 점수는 LG AI연구원 정예팀이 29.5점의 최고점을 득점했고, 4팀의 평균 점수는 28.75점이다.


사용자 평가는 AI모델의 활용성과 정예팀의 AI 서비스 역량 평가 등을 강화하기 위해서, AI 전문 사용자진 평가(배점 15점)와 일반 국민 평가 (배점 10점)로 구성했다.


각 팀의 AI 사용 웹사이트를 기반으로 AI 사용성(Usability) 등에 대한 평가를 진행했다.


또한 평가단 대상 프롬프트 가이드라인 제공, AI사용 웹사이트 내 정예팀별 AI모델 평가 순서 무작위 제공, 일정시간(최소 3분) 이상의 충분한 사용자 평가 지원 등을 통해 평가의 공정성을 높였다.


AI 전문 사용자진 평가는 이해충돌 확인 등을 거쳐 50명이 선정돼, 실제 49명이 평가에 참여했다. AI 전문 사용자진의 평가는 절대평가로서, 최저 1점부터 최고 5점까지 점수를 부여하도록 했다.


각 AI 전문 사용자가 절대평가해 점수를 합산하고, 15점 만점으로 스케일링해 최종 점수를 산출했다.


종합한 AI 전문 사용자진 평가 점수는 SK텔레콤 정예팀이 11.6점의 최고점을 득점했고, 4팀의 평균 점수는 10.53점이다.


일반 국민 평가단의 경우, 일반 국민에 대한 대표성 제고를 위해, 충분한 기간 동안 공모한 후, 국내 주민등록인구 통계 기준으로 성별·연령별 쿼터를 설정하고, 시스템을 통해 무작위로 200명이 선정됐고, 실제 185명이 평가에 참여했다.


국민 평가단의 평가 역시 정예팀별 절대평가로 진행돼, 최저 1점부터 최고 5점까지 점수를 부여하도록 했다. 각 사용자(일반 국민)가 절대평가해 점수를 합산하고, 10점 만점으로 스케일링해 최종 점수를 산출했다.


이를 종합한 일반 국민 평가단 평가 점수는 LG AI연구원 정예팀이 7.6점의 최고점을 득점했고, 4팀의 평균 점수는 7.03점이다.


과기정통부는 독파모 정예팀을 비롯한 다양한 기업들이 이번 프로젝트의 결과에 머무르지 않고, 각자의 AI 모델과 기술을 지속적으로 발전시켜 국내 AI 생태계에서 그 가치를 인정받고 실제 현장에서 활용·확산할 수 있도록 정책적 지원을 확대한다는 계획이다.

조인영 기자 (ciy8100@dailian.co.kr)
기사 모아 보기 >
0
0

댓글 0

로그인 후 댓글을 작성하실 수 있습니다.
  • 최신순
  • 찬성순
  • 반대순
0 개의 댓글 전체보기