검색창 열기 인더뉴스 부·울·경

ICT 정보통신

카카오 ‘카나나-2 시리즈’, 안전성 평가서 글로벌 모델 대비 종합 1위 성과

URL복사

Tuesday, August 18, 2026, 11:08:09

유사 규모 글로벌 모델 젬마, 큐웬 상회하는 결과 기록
한국어 특화 안전성 벤치마크 'AssurAI'가 활용해 측정

 

인더뉴스 이종현 기자ㅣ카카오가 오픈소스로 공개한 경량 언어모델(SLM) 카나나-2 시리즈가 안전성 평가에서 글로벌 모델 대비 종합 1위라는 성과를 거뒀습니다.

 

카카오[035720]는 자체 구축한 'AI 안전성 평가 플랫폼'을 통해 지난달 28일 허깅페이스에 오픈소스로 공개한 '카나나-2-1.3B-Instruct', '카나나-2-3B-Instruct' 두 모델을 대상으로 유해성, 편향성 등을 체계적으로 측정했습니다. 그 결과, 모델 모두 유사 파라미터 규모의 주요 글로벌 모델 대비 종합 1위를 기록했습니다.

 

이번 평가에는 과학기술정보통신부 사업의 일환으로 TTA(한국정보통신기술협회), KAIST, 카카오 등이 지난해 11월 공동 구축한 한국어 특화 안전성 벤치마크 'AssurAI'가 활용됐습니다.

 

한국의 사회‧문화적 맥락에 맞게 설계된 AssurAI는 텍스트, 이미지, 오디오 등 멀티모달은 물론, AI 서비스 이용 상황부터 악의적 프롬프트 시나리오까지 다양한 조건에서 AI의 위험 요소를 측정할 수 있습니다.

 

AssurAI는 총 35개 리스크 카테고리 내 9560건의 평가 항목을 포함하며 카카오는 이를 ▲사회적 리스크 ▲성적 콘텐츠/아동보호 ▲범죄/불법 행위 ▲폭력 ▲권리 침해 등 5개의 대분류로 재편해 집계했습니다.

 

또, 사전 정의된 채점 기준에 따라 AI 모델이 응답을 평가하는 'LLM-as-a-Judge' 방식을 적용해 대규모 평가에서도 주관적 편차를 최소화하고 동일한 기준으로 모델 간 비교가 가능하도록 했습니다.

 

이번 평가는 유사 파라미터 규모의 글로벌 모델인 구글의 '젬마', 알리바바의 '큐웬'을 비교 대상으로 설정했습니다. 카나나-2-1.3B-Instruct는 종합 점수 0.70을 기록해 젬마(0.68), 큐웬(0.58)을 앞섰으며 카나나-2-3B-Instruct 역시 0.70으로 젬마(0.66), 큐웬(0.62)보다 높은 점수를 차지한 것으로 나타났습니다.

 

대분류별 평가에서 카나나 1.3B 모델은 범죄/불법 행위 영역에서 높은 우위를 보였으며 3B 모델은 성적 콘텐츠/아동보호와 권리 침해 영역에서 비교 모델들을 앞섰습니다.

 

김경훈 카카오 AI 세이프티 리더는 "이번 평가는 자체 검증 체계를 통해 오픈소스 모델의 안전성을 사전에 점검하고, 그 결과를 공개하고자 한 사례"라며 "앞으로도 책임 있는 AI 개발 원칙 아래 안전성 검증을 모델 출시 프로세스의 핵심 단계로 정착시켜 나갈 것"이라고 말했습니다.

English(中文·日本語) news is the result of applying Google Translate. <iN THE NEWS> is not responsible for the content of English(中文·日本語) news.


이종현 기자 flopig2001@inthenews.co.kr






배너