Anthropic’s Sprachmodell Claude Fable 5 erzielt Spitzenwerte in allen sechs neuen branchenspezifischen Leistungsindizes von Artificial Analysis, die Finanzwesen, Recht und Medizin umfassen. Diese führende Position ist jedoch mit erheblichen Kosten verbunden. Im „Strategy & Ops Index“ beispielsweise kostet eine einzelne Aufgabe mit Fable 5 3,48 US-Dollar. Das ist mehr als hundertmal so viel wie die 0,03 US-Dollar, die DeepSeek V4 Pro für die gleiche Aufgabe berechnet, bei einem Punktunterschied von lediglich 12 Punkten.
Neue branchenbezogene Leistungsindizes
Die Benchmarking-Plattform Artificial Analysis hat sechs neue branchenspezifische Leistungsindizes für KI-Modelle veröffentlicht. Diese erweitern die bestehenden Indizes für autonome Agenten (Agentic) und Programmieraufgaben (Coding). Die neuen Kategorien umfassen:
- Finanz- & Rechnungswesen
- Recht
- Gesundheitswesen & Medizin
- Strategie & Betrieb
- Ingenieurwesen
- Wirtschaft
Die Methodik basiert auf den beruflichen Klassifikationen des US O*NET-Systems. Domänenspezifische Fähigkeiten wie Finanzmodellierung, juristische Recherche oder klinische Entscheidungsunterstützung werden aus den dort definierten Jobaufgaben abgeleitet und die Benchmark-Suiten entsprechend gewichtet. Artificial Analysis betont, dass alle Benchmarks unabhängig durchgeführt werden.
Leistung und Platzierungen der Modelle
Claude Fable 5 von Anthropic belegt den ersten Platz in allen acht Indizes (den sechs neuen Branchenindizes sowie den bestehenden Agentic- und Coding-Indizes). Claude Opus 4.8 (max) folgt in sechs der acht Kategorien auf dem zweiten Platz, während OpenAI’s GPT-5.5 (xhigh) in den verbleibenden zwei Kategorien den zweiten Rang einnimmt. Eine bevorstehende Veröffentlichung von GPT-5.6 könnte die Lücke zu Anthropic’s Modellen schließen.
Unterhalb der Top-Modelle variieren die Platzierungen je nach Domäne erheblich. Modelle wie Google’s Gemini 3.5 Flash, Gemini 3.1 Pro Preview, OpenAI’s GPT-5.5 (xhigh), Anthropic’s Claude Sonnet 5 (max) und das chinesische GLM-5.2 (max) tauschen je nach Aufgabe die Plätze.
Bei den Open-Weight-Modellen führt GLM-5.2 (max) in fünf der sechs Branchenindizes. Im Engineering-Benchmark erreicht GLM-5.2 (max) mit 53 Punkten den fünften Platz, nur zwei Punkte hinter Claude Sonnet 5 (max) und GPT-5.5 (xhigh), die beide 55 Punkte erzielen. Im Strategy & Ops Index führt Deepseek V4 Pro (max) mit 38 Punkten bei den Open-Weight-Modellen.
Kosten-Leistungs-Verhältnis
Die hohe Leistung von Claude Fable 5 ist mit einem Premium-Preis verbunden. DeepSeek V4 Flash (max) erledigt Aufgaben über alle sechs Indizes hinweg für weniger als 0,04 US-Dollar pro Aufgabe, während es im mittleren Leistungsbereich liegt. GLM-5.2 (max) bietet die beste Open-Weight-Leistung zu Kosten zwischen 0,26 und 0,58 US-Dollar pro Aufgabe.
Der erhebliche Preisunterschied zwischen Claude Fable 5 und günstigeren Alternativen hat bereits eine Diskussion unter Unternehmen ausgelöst, ob der Leistungsvorsprung den Preis rechtfertigt. Eine Strategie besteht darin, Modelle zu kombinieren, wobei ein leistungsfähiger Orchestrator Aufgaben an günstigere „Worker-Modelle“ delegiert, die ein besseres Preis-Leistungs-Verhältnis bieten. Frontier-Modelle können auch zur Erstprüfung eingesetzt werden, um festzustellen, ob ein Sprachmodell eine Aufgabe überhaupt lösen kann.
Übereinstimmung mit unabhängigen Daten
Die Ergebnisse von Artificial Analysis stimmen mit aktuellen Daten von LMArena überein, einer unabhängigen Plattform, auf der Millionen von Nutzern Modelle durch Blindvergleiche bewerten. Laut dem Leaderboard-Snapshot vom 7. Juli belegt Claude Fable 5 den ersten Platz in der Text Arena, Code Arena und Agent Arena. Anthropic ist das einzige Labor, das alle drei Hauptkategorien anführt. In der Agent Arena liegt Fable 5 16,58 Prozent über dem Modelldurchschnitt, deutlich vor OpenAI’s GPT-5.5 xHigh (8,66 Prozent) und Z.ai’s GLM 5.2 (6,62 Prozent).
Thema: Anthropic. Quelle/Inspiration: The Decoder.