---
title: Google DeepMind testet KI-Modelle jetzt mit Werwolf und Poker
description: Gemini 3 schlägt GPT-5.2 im neuen Benchmark für soziale Täuschung und strategische Verhandlungen.
author: Andreas Becker
url: https://www.all-ai.de/news/news26top/deepmind-werwolf
---

![Verschiedene Kartenspiele](https://www.all-ai.de/images/Bilder%20News/26-2/kaggle-gemini-bench-1600.webp)

# Google DeepMind testet KI-Modelle jetzt mit Werwolf und Poker

Gemini 3 schlägt GPT-5.2 im neuen Benchmark für soziale Täuschung und strategische Verhandlungen.

[Andreas Becker](https://www.all-ai.de/charaktere)·04.02.26

Google

![Verschiedene Kartenspiele](https://www.all-ai.de/images/Bilder%20News/26-2/kaggle-gemini-bench-1600.webp#joomlaImage://local-images/Bilder News/26-2/kaggle-gemini-bench-1600.webp?width=1600&height=900)

Kurzfassung
 ▾

Quellen
 ▾

- Google DeepMind erweitert die Kaggle Game Arena um Werwolf und Poker, um soziale Fähigkeiten wie Täuschung bei KI-Modellen zu testen.
- Im neuen Ranking belegt Gemini 3 Pro Preview den ersten Platz und verweist Konkurrenten wie GPT-5.2 auf die hinteren Ränge.
- Die Benchmarks verdeutlichen, dass neben reiner Logik zunehmend Soft Skills und Anpassungsfähigkeit über die Qualität moderner Sprachmodelle entscheiden.

- [Google Blog - Advancing AI benchmarking with Game Arena](https://blog.google/innovation-and-ai/models-and-research/google-deepmind/kaggle-game-arena-updates/)
- [Chrome Unboxed - Google DeepMind is using Werewolf and Poker to test AI Soft Skills](https://chromeunboxed.com/google-deepmind-is-using-werewolf-and-poker-to-test-ais-soft-skills/)
- [EdTech Innovation Hub - Google DeepMind introduces new AI benchmarks to test decision-making under uncertainty](https://www.edtechinnovationhub.com/news/google-deepmind-introduces-new-ai-benchmarks-to-test-decision-making-under-uncertainty)
- [Dera AI - Training AI for the Real World: How Games Like Poker and Werewolf](https://www.dera.ai/en/news/ba68395e-756c-90e7-f4e7-820f6e2906d3)

Google DeepMind erweitert die Benchmark-Plattform "Kaggle Game Arena" um die Spiele Werwolf und Poker. Die neuen Tests zwingen KI-Modelle wie Gemini 3 und GPT-5.2 dazu, menschliche Fähigkeiten wie Täuschung und Verhandlungsgeschick unter Beweis zu stellen.

#### Abschied von statischen Tests

Reine Rechenleistung und das Lösen von Multiple-Choice-Fragen genügen nicht mehr als alleiniger Maßstab für moderne Sprachmodelle. Mit der Integration von Spielen, die auf unvollständigen Informationen basieren, verschiebt Google den Fokus auf soziale Dynamiken und Anpassungsfähigkeit. KI-Agenten müssen in Szenarien agieren, in denen Logik allein nicht zum Sieg führt.

Das Ziel ist die Simulation echter Interaktionen, bei denen Modelle die Intentionen ihrer Gegenspieler einschätzen müssen. Statische Benchmarks gelten in der Branche zunehmend als ausgereizt ("saturated"), weshalb dynamische Umgebungen an Bedeutung gewinnen.

###### Anzeige

#### Gemini dominiert soziale Deduktion

Besonders das Spiel Werwolf stellt eine neue Hürde dar, da es Kommunikation und Manipulation erfordert. Teilnehmer müssen ihre wahre Rolle verbergen oder andere Spieler gezielt durch Argumente in die Irre führen. Aktuelle Auswertungen der Kaggle-Plattform zeigen, dass Googles Gemini 3 Pro Preview in diesem sozialen Szenario die Führung übernimmt.

Das Modell setzt sich mit einem Equilibrium Rating von 0,10 % knapp gegen die eigene Flash-Variante durch. GPT-5.2 belegt den dritten Platz, während Modelle wie Grok 4 deutlich schlechter abschneiden. Die Ergebnisse basieren auf über 31.000 Matchups, um den Zufallsfaktor zu minimieren und die tatsächliche Überzeugungskraft der KI zu isolieren.

![KI spielt Werwolf](https://www.all-ai.de/images/Bilder News/26-2/kaggle-gemini-bench-werwolf.webp)

###### Quelle: Google

#### Strategie und Effizienz im Vergleich

Neben den Soft Skills bleibt strategische Planung essenziell, wie die aktualisierten Schach-Rankings zeigen. Auch hier führt Gemini 3 Pro Preview das Feld mit einem Elo-Wert von 1325 an und distanziert Konkurrenten wie o3. Auffällig ist das schlechte Abschneiden von DeepSeek V3.2, das in dieser spezifischen Testumgebung keine Punkte erzielen konnte.

Ein Blick auf die Daten offenbart zudem Unterschiede in der Wirtschaftlichkeit der Modelle. Während der Spitzenreiter im Werwolf-Spiel durchschnittlich 8,35 Cent pro Partie kostet, liegt Claude Opus 4.5 bei über 10 Cent. Diese Metriken geben Entwicklern wichtige Hinweise darauf, wie effizient komplexe Entscheidungsprozesse von den jeweiligen Modellen abgebildet werden.

![Google Bench 1](https://www.all-ai.de/images/Bilder News/26-2/kaggle-gemini-bench-bench1.webp)

![Google Bench 2](https://www.all-ai.de/images/Bilder News/26-2/kaggle-gemini-bench-bench2.webp)

###### Quelle: Google
