News

Fußball-Weltmeisterschaft: Wie gut kann KI Sportergebnisse vorhersagen?

12.06.2026

In einem neuen Projekt lassen LMU-Forschende verschiedene Large Language Modelle gegeneinander antreten. Ziel ist es herauszufinden, wie treffsicher die KI-Systeme Fußballergebnisse vorhersagen können.

Wer gewinnt die Fußball-WM 2026? Mit LLM SoccerArena startet an der LMU in Kooperation mit Forschenden der Universität zu Köln und der Universität Paderborn ein neues Projekt zur Evaluation großer Sprachmodelle in realen Entscheidungssituationen – und das am Beispiel der diesjährigen Fußball-Weltmeisterschaft. Die Plattform untersucht, wie gut Modelle wie GPT, Claude oder Mistral Fußballspiele und Turnier-Ausgänge vorhersagen können. Die Ergebnisse werden in einem Live-Leaderboard dargestellt, das täglich aktualisiert wird und online einsehbar ist.

Panoramaaufnahme aus dem Stadion während des Spiels der Gruppe A der FIFA-Weltmeisterschaft 2026 zwischen Mexiko und Südafrika im Mexico City Stadium am 11. Juni 2026 in Mexiko-Stadt

Panoramaaufnahme aus dem Stadion am 11. Juni 2026 in Mexiko-Stadt am zur Eröffnung der FIFA-Weltmeisterschaft 2026.

© picture alliance / NurPhoto | Jose Breton

Je nach Fragestellung und Anbieter sind sich die KI-Modelle nicht immer einig: „GPT-5.5 von OpenAI und Claude Opus 4.8 prognostizieren aktuell Spanien als Sieger der FIFA-Weltmeisterschaft, während Mistral Large Frankreich voraussagt“, erklärt Stefan Feuerriegel, Professor an der LMU Munich School of Management und Leiter des Projekts. „Solche Unterschiede sind wissenschaftlich interessant, weil sie Hinweise darauf geben können, welche Informationen Modelle nutzen – und ob Trainingsdaten, Internet-Meinungen oder sprachliche und regionale Verzerrungen eine Rolle spielen.“

Fußball als Realitätscheck

Was zunächst wie ein Tippspiel klingt, ist aus wissenschaftlicher Sicht ein realitätsnaher Benchmark: Anders als bei vielen abstrakten Testaufgaben lassen sich die Prognosen später eindeutig überprüfen. Wenn ein Sprachmodell etwa vorhersagt, welche Mannschaft die Fußball-WM gewinnt, muss es Informationen zur aktuellen Form, zu Verletzungen, Trainer-Entscheidungen, vergangenen Begegnungen, Kaderqualität oder Wettquoten einordnen – und daraus eine belastbare Prognose unter Unsicherheit ableiten.

Viele etablierte Benchmarks für große Sprachmodelle testen abstrakte Aufgaben in stark vereinfachten oder statischen Umgebungen. Medizinische Examensfragen, juristische Aufgaben oder MBA-Tests werden von modernen Modellen mittlerweile häufig sehr gut gelöst. Zugleich sagen solche Aufgaben nur begrenzt etwas darüber aus, wie zuverlässig Modelle in echten Entscheidungssituationen unter Unsicherheit agieren. Genau hier setzt LLM SoccerArena an: Die Modelle treffen Vorhersagen, deren Qualität sich später anhand realer Ergebnisse messen lässt.

Hilfe bei Wirtschaftsfragen

Die Erkenntnisse sind auch für die Management-Forschung relevant. Führungskräfte nutzen große Sprachmodelle zunehmend, um Marktinformationen zu strukturieren, Szenarien zu bewerten oder Prognosen vorzubereiten – etwa zu Nachfrage-Entwicklungen, Wettbewerbern, Produkteinführungen oder Risiken.

„Für die Management-Forschung ist entscheidend, ob Sprachmodelle reale Entscheidungssituationen zuverlässig unterstützen können“, sagt Stefan Feuerriegel. „Genau dafür brauchen wir Benchmarks, die nicht nur abstrakte Aufgaben testen, sondern den Umgang mit dynamischen Informationen, Unsicherheit und später überprüfbaren Ergebnissen.“

Stefan Feuerriegel entwickelt Anwendungen Künstlicher Intelligenz für das Management.

© Florian Generotzky / LMU

LLM SoccerArena vergleicht dabei verschiedene Ansätze. Zum einen geben Modelle Prognosen auf Basis ihres internen Wissens ab. Zum anderen wird getestet, wie gut sie zusätzliche externe Informationen aus dem Internet abrufen und verarbeiten können. Gerade diese agentische Suche ist herausfordernd: Prüft ein Modell aktuelle Verletzungen, Startaufstellungen, Formkurven, Trainerwechsel, direkte Duelle, Turnier-Kontext oder Wettquoten? Und kann es diese Informationen sinnvoll gewichten?

Wonach suchen Sie?