모든 대형 언어 모델에 동일한 작업을 부여했습니다. 그리고 순위를 매겼습니다.
동일한 작업 세트 하나, 53개 모델, 완성도·속도·제어력·가성비로 점수를 매겼습니다. 클로즈드 API와 오픈 웨이트를 같은 페이지에 담은 이유는, 그것이 실제 선택지이기 때문입니다.
- 수록 수
- 53
- 전체 검토 완료
- 00
- 카테고리
- 05
- 평균 점수
- 79.1
짧은 답
2026년 최고의 AI 모델은 무엇일까요?
53개 대형 언어 모델을 다루는 저희 인덱스에서 1위는 Claude Fable 5, 100점 만점에 89.2점입니다. 그 뒤로 GPT-5.6 Sol 88.6점, Claude Opus 5 88.5점이 이어집니다. 모델은 답변 품질, 지연 시간, 조종 가능성, 비용 대비 성능으로 평가하며 답변 품질에 가장 큰 가중치를 둡니다. 협찬은 일절 없습니다.
인덱스 업데이트
모델 인덱스
추적 중인 모든 대형 언어 모델, 순위 순으로.
최전선 주력 모델, 직접 호스팅할 수 있는 오픈 웨이트, 루프에 넣어도 충분히 빠른 소형 모델. 모델 종류로 좁히거나 중요한 항목을 기준으로 정렬하세요.
53개 빌더
0189.2Claude Fable 5
돈으로 살 수 있는 최고의 답변. 그리고 가격도 그에 걸맞게 비쌉니다.
프론티어잠정 점수
0288.6GPT-5.6 Sol
OpenAI의 가장 깊은 사색가. 스스로 풀 수 없는 문제를 맡길 모델.
추론 모델잠정 점수
0388.5Claude Opus 5
플래그십의 핵심을 절반 가격에. 기본으로 선택해야 할 모델.
프론티어잠정 점수
0487.9Claude Sonnet 5
코딩의 주력 모델: 실제 소프트웨어 작업에서 최상위권, 합리적인 가격.
코딩잠정 점수
0587.5Kimi K3
누구도 공개한 적 없는 가장 큰 오픈 웨이트 모델, 100만 토큰도 거뜬히 읽습니다.
오픈 웨이트잠정 점수
- GLM-5.20687.1
GLM-5.2
프론티어급 출력, MIT 라이선스, 100만 토큰 컨텍스트. 이 조합이 전부입니다.
오픈 웨이트잠정 점수
- DeepSeek V4 Pro0786.8
DeepSeek V4 Pro
프론티어에 위치한 추론 모델, MIT로 공개, 가격은 부수적인 것처럼 책정.
추론 모델잠정 점수
- Gemini 3.6 Flash0886.6
Gemini 3.6 Flash
Flash 속도의 프론티어 답변, 실제로 활용 가능한 무료 티어까지.
프론티어잠정 점수
- Grok 4.50985.0
Grok 4.5
강력하고 최신이며, 실제로 묻는 질문에 비정상적으로 솔직하게 답하는 모델.
프론티어잠정 점수
- MiniMax M31084.5
MiniMax M3
소프트웨어 작업에 튜닝된 오픈 웨이트, 동급 중 가장 빠른 디코딩.
코딩잠정 점수
1184.4GPT-5.6 Terra
OpenAI 라인업의 중간, 대부분의 팀이 실제로 배포해야 할 모델.
프론티어잠정 점수
- Qwen 3.61283.3
Qwen 3.6
대부분의 사람이 실제로 실행해야 할 오픈 Qwen 릴리스. 실제 하드웨어에 맞는 크기.
오픈 웨이트잠정 점수
1383.3GPT-5.6 Luna
토큰 수를 더 이상 세지 않아도 될 만한 가격에, 프론티어 패밀리의 행동 방식.
소형·고속잠정 점수
1482.9Mistral Large 3
유럽의 답변. Apache 2.0으로 공개, 25만 토큰 컨텍스트.
오픈 웨이트잠정 점수
- DeepSeek V4 Flash1582.6
DeepSeek V4 Flash
프론티어에 근접한 답변을 프론티어 가격의 약 100분의 1에, 그것도 가중치까지 공개.
오픈 웨이트잠정 점수
전체 인덱스
이 페이지의 모든 항목을 순위순으로 정리했습니다. 위의 카드는 나눠서 불러오지만 이 목록은 그렇지 않습니다.
- 01Claude Fable 589.2
- 02GPT-5.6 Sol88.6
- 03Claude Opus 588.5
- 04Claude Sonnet 587.9
- 05Kimi K387.5
- 06GLM-5.287.1
- 07DeepSeek V4 Pro86.8
- 08Gemini 3.6 Flash86.6
- 09Grok 4.585.0
- 10MiniMax M384.5
- 11GPT-5.6 Terra84.4
- 12Qwen 3.683.3
- 13GPT-5.6 Luna83.3
- 14Mistral Large 382.9
- 15DeepSeek V4 Flash82.6
- 16Xiaomi MiMo V2.5 Pro82.4
- 17Qwen 3.5 397B81.9
- 18Step 3.7 Flash81.6
- 19Doubao Seed 2.0 Pro81.5
- 20Muse Spark81.3
- 21Qwen 3.8-Max81.2
- 22Qwen 3.7-Max81.0
- 23Llama 4 Maverick80.4
- 24Nemotron 3 Super80.1
- 25Gemma 480.1
- 26Hunyuan HY380.0
- 27Solar Open 279.2
- 28Claude Haiku 4.578.9
- 29Mistral Medium 3.578.6
- 30Llama 4 Behemoth78.2
- 31Mistral Small 478.1
- 32EXAONE 2.077.8
- 33ERNIE 5.177.7
- 34openPangu 2.0 Pro77.7
- 35Llama 4 Scout77.3
- 36Amazon Nova Premier77.3
- 37Hermes 477.0
- 38Grok 4.2076.9
- 39Cohere Command A+76.8
- 40Phi-4 Reasoning Vision76.8
- 41Gemini 3.5 Flash-Lite75.2
- 42Sarvam 105B74.3
- 43Mercury 273.2
- 44IBM Granite 3.272.5
- 45Amazon Nova Lite72.4
- 46OLMo 3.172.0
- 47Perplexity Sonar Pro71.6
- 48Doubao Seed 1.6 Flash71.2
- 49HyperCLOVA X THINK70.7
- 50Ministral 369.0
- 51Reka Edge68.7
- 52SmolLM367.7
- 53Liquid LFM 266.7
주간 업데이트
순위는 바뀝니다. 언제 바뀌는지 알아보세요.
One short email a week: what changed in the index, which builder moved and why, and anything new worth trying. No sponsorships, no reprinted press releases.