Neue Agent-Skills für Coding-Agenten verfügbar →
← Zurück zur Startseite

LoL — das Leaderboard der Leaderboards

Die Top-Modelle jeder Kategorie — kompiliert aus den Boards, die wir selbst für Modellwahl und Architekturempfehlungen heranziehen.

LLM-Intelligenz

AA Intelligence Index v4.3.2 · Index (höher = besser) · Artificial Analysis

#ModellScore
1Claude Opus 5.5 (max)Anthropic58
2Claude Sonnet 5.5 (max)Anthropic56
3Claude Opus 5.5 (high)Anthropic55
4Claude Fable 5.1 (max)Anthropic54
5GPT-6 Astra (max)OpenAI53
6Gemini 4 Argon (high)Google52
7GPT-6.1 Sol (max)OpenAI51
8Claude Opus 5.5 (medium)Anthropic50

Embedding-Modelle

MTEB (Overall) · Score (höher = besser) · MTEB Leaderboard (Hugging Face)

#ModellScore
1Gemini Embedding 001Google68.3
2Qwen3-Embedding-8BAlibabaopen67.9
3NV-Embed-v2NVIDIAopen67.3
4Voyage-Large-2Voyage AI67.0
5Cohere Embed v4Cohere66.7
6text-embedding-3-largeOpenAI66.5
7BGE-Large-v2BAAIopen65.9

Terminal-Agents

Terminal-Bench 4.0 · % gelöste Aufgaben · Terminal-Bench (via Artificial Analysis)

#ModellScore
1Claude Sonnet 5.5Anthropic70.6
2Claude Opus 5.5Anthropic66.4
3Claude Mythos 5.1Anthropic60.9
4GPT-6 AstraOpenAI58.2
5Claude Fable 5.1Anthropic57.9
6Gemini 4 ArgonGoogle57.4
7GPT-6.1 SolOpenAI56.1
8Claude Opus 5Anthropic53.9
9Claude Fable 5Anthropic44.5
10GPT-6 SolOpenAI43.9
11GLM-5.3Z AIopenbestes Open-Weight-Modell41.8

Decision-Modelle

Requests · Anfragen (Verwendung, nicht Benchmark) · OpenRouter

#ModellRequests
1Jev 1.13typesafeopen+4 %981M
2Span-01 Literespanopen+9 %9.51M
3d1liquidopenneu3.53M
4GPT-6 Luna Decisionsopenaineu3.53M
5Clef Flashcloudflareopenneu3.46M
6Clefcloudflareopenneu2.7M
7Kev 4Bjaredpalmeropen+305 %2.45M
8Decider V1 27Bperplexityneu1.95M

Bildgenerierung

AA-Image-T2I v2.0 (Arena-Elo) · Elo aus Blind-Votings (höher = besser) · Artificial Analysis

#ModellScore
1GPT Image 2.5 SunburstOpenAI1198
2GPT Image 2.5 FlareOpenAI1191
3GPT Image 2OpenAI1172
4Nano Banana 2.1Google1160
5Grok Imagine Image 2.0xAI1156
6MAI-Image-2.6Microsoft1151

Text-to-Speech

Speech Arena (Arena-Elo) · Elo aus Blind-Votings (höher = besser) · Artificial Analysis

#ModellScore
1Eleven v4 TurboElevenLabs1332
2Eleven v4ElevenLabs1324
3Qwen-Audio-3.1-TTS-PlusAlibabaopen1295
4Sonic 3.6Cartesia1279
5Gemini 3.8 Flash TTSGoogle1276
6Qwen-Audio-3.0-TTS-PlusAlibabaopen1263

Speech-to-Text

AA-WER v2 · Fehlerrate (niedriger = besser) · Artificial Analysis

#ModellWER
1StepAudio 3 ASRStepFunopen1.7 %
2Fun-Realtime-ASR-previewAlibabaopen1.7 %
3MAI-Transcribe-2Microsoft2.0 %
4Scribe v2ElevenLabs2.2 %
5Grok Voice Transcribe 2.0xAI2.3 %
6Universal-3 ProAssemblyAI3.1 %
7GPT TranscribeOpenAI3.3 %