공개 순위판 종합 1위

한국어를 가장 잘
이해하는 AI

웹스팩토리의 Webs-Sejong 모델이 과기정통부·한국지능정보사회진흥원(NIA)이 운영하는 K-AI 리더보드 공개 순위판에서 종합 1위에 올랐습니다.

1위
공개 순위판 종합
0.981
한국어 이해 · CLIcK
0.624
5개 지표 종합 평균
5
평가 지표

모델 Webs-Sejong-31B-R1 · AI Hub K-AI 리더보드 공개 순위판

🤗 Hugging Face에서 열기

About

아무 모델이나
1위에 오르지 않습니다

K-AI 리더보드는 과학기술정보통신부와 한국지능정보사회진흥원(NIA)의 AI 허브를 기반으로 운영되는, 한국 환경에 최적화된 AI 성능을 공인하는 평가 체계입니다. 한국어 문화·언어 이해(CLIcK), 전문 자격시험 수준의 추론(KMMLU-Pro) 등 성격이 다른 다섯 개의 엄격한 벤치마크를 종합해 순위를 매깁니다.

Webs-Sejong 모델은 이 다섯 지표를 종합한 공개 순위판에서 종합 1위에 올랐습니다. 특히 한국어 특유의 맥락을 이해하는 CLIcK에서 0.981을 기록해, 규모 경쟁이 아니라 한국어를 다루는 실제 서비스에 곧바로 쓸 수 있는 완성도로 정상에 섰습니다.

Evidence

공개 순위판 종합 1위

K-AI 리더보드 종합 순위에서 Webs-Sejong-31B-R1이 1위에 올라 있습니다.

AI Hub K-AI 리더보드 종합 순위 — Webs-Sejong-31B-R1이 1위(평균 0.624)
AI Hub K-AI 리더보드 종합 순위 실제 화면 (상위 5개 모델)

Benchmarks

지표별 상세 점수

공개 순위판에 게시된 점수를 그대로 옮겼습니다.

CLIcK 한국어 문화·언어 이해 최고점
0.981

한국어 특유의 문화적·언어적 맥락을 얼마나 정확히 이해하는지 측정합니다.

Com2 인과·상식 추론
0.728

일상 속 인과관계와 상식을 여러 단계로 이어 추론하는 능력을 평가합니다.

KMMLU-Pro 전문 자격시험 추론
0.713

변호사·회계사 등 전문직 자격시험 수준의 고난도 문제 해결 능력을 평가합니다.

MuSR 다단계 서사 추론
0.631

긴 이야기 속 단서를 연결해 결론에 도달하는 복합 추론 능력을 측정합니다.

* 공개 순위판은 다섯 개 지표의 종합 평균으로 순위를 매기며, Webs-Sejong이 평균 0.624로 1위를 차지했습니다.

한국어에 강한 AI가 필요하신가요?

리더보드에서 검증된 한국어 이해력을 기업 맞춤 AI로 연결해 드립니다.