Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
허깅페이스에 공개된 카카오의 경량 언어모델 두 개가 구글과 알리바바의 비슷한 크기 모델을 안전성 평가에서 앞섰다. Kanana-2-1.3B-Instruct와 Kanana-2-3B-Instruct 모두 종합 점수 0.70으로 1위를 기록했다. 카카오는 18일 이 결과를 공개했다.
Deux modèles de langage légers de Kakao publiés sur Hugging Face ont devancé, lors d’une évaluation de la sécurité, des modèles de taille comparable de Google et d’Alibaba. Kanana-2-1.3B-Instruct et Kanana-2-3B-Instruct se sont tous deux classés premiers avec un score global de 0,70. Kakao a publié ces résultats le 18.
비교 대상은 구글의 젬마와 알리바바의 큐웬이었다. 1.3B 모델 비교에서 젬마는 0.68, 큐웬은 0.58을 받았고, 3B 모델 비교에서는 젬마 0.66, 큐웬 0.62였다. 카나나2 1.3B는 범죄·불법 행위 영역에서, 3B는 성적 콘텐츠·아동보호와 권리 침해 영역에서 비교 모델보다 높은 점수를 기록했다.
Les modèles comparés étaient Gemma, de Google, et Qwen, d’Alibaba. Dans la comparaison des modèles 1.3B, Gemma a obtenu 0,68 et Qwen 0,58. Pour les modèles 3B, Gemma a obtenu 0,66 et Qwen 0,62. Kanana2 1.3B a obtenu un score supérieur à celui des modèles comparés dans les domaines de la criminalité et des activités illégales, tandis que le modèle 3B les a devancés dans les domaines des contenus sexuels, de la protection de l’enfance et des atteintes aux droits.
시험대가 된 것은 AssurAI다. 한국정보통신기술협회, KAIST, 카카오가 지난해 11월 공동 구축한 이 한국어 특화 벤치마크는 한국의 사회·문화적 맥락을 반영해 35개 위험 범주와 9560개 평가 항목을 담고 있다. 텍스트·이미지·오디오 같은 멀티모달 조건과 악의적 프롬프트, 실제 AI 서비스 이용 상황까지 위험 요소를 살핀다.
Le banc d’essai était AssurAI. Ce benchmark spécialisé dans le coréen, développé conjointement en novembre dernier par l’Association coréenne des technologies de l’information et des communications, KAIST et Kakao, intègre le contexte social et culturel de la Corée et comprend 35 catégories de risques et 9 560 critères d’évaluation. Il examine les facteurs de risque dans des conditions multimodales, notamment avec du texte, des images et de l’audio, ainsi que face à des prompts malveillants et dans des situations réelles d’utilisation de services d’IA.
카카오는 자체 구축한 AI 안전성 평가 플랫폼에서 사전에 정한 기준으로 모델의 답변을 채점했다. LLM-as-a-Judge, 즉 대규모 언어모델이 다른 모델의 응답을 평가하는 방식을 사용했다. 따라서 이번 결과는 카카오가 제시한 자체 평가 결과다.
Kakao a noté les réponses des modèles selon des critères définis à l’avance sur sa plateforme d’évaluation de la sécurité de l’IA développée en interne. L’entreprise a utilisé LLM-as-a-Judge, une approche dans laquelle un grand modèle de langage évalue les réponses d’un autre modèle. Les résultats présentés sont donc ceux d’une évaluation réalisée par Kakao elle-même.
카카오는 앞으로 이 사전 검증을 자체 개발 모델 전반으로 확대하고, 텍스트 모델을 넘어 멀티모달 모델과 에이전틱 AI의 위험 평가에도 적용할 계획이다.
Kakao prévoit à l’avenir d’étendre cette vérification préalable à l’ensemble de ses modèles développés en interne et de l’appliquer, au-delà des modèles de texte, à l’évaluation des risques des modèles multimodaux et de l’IA agentique.