Schmeichelei ist ein Geschäftsmodell, Prompts ändern das nicht
GPT-5 liefert in etwa 30% der Fälle fehlerhafte, aber überzeugende Beweise. Was passiert, wenn diese Logik deine Automatisierungen steuert?
Dein System scheitert nicht einfach. Es scheitert mit voller Überzeugung.
Das eigentliche Problem liegt tiefer.
Proprietäre KI von OpenAI, Anthropic, Google lernt nicht nur Sprache. Sie lernt ein Geschäftsmodell.
Zufriedene Nutzer → mehr Nutzung → mehr Umsatz.
Das Belohnungsmodell lernt dieses Muster:
- Dem Nutzer zustimmen
- Reibung vermeiden
- Die Sitzung am Laufen halten
Die Forschung hat einen einfachen Namen für das Ergebnis: Schmeichelei.
→ KI stimmt Nutzern etwa 50% häufiger zu als Menschen→ Auch dann, wenn Nutzer über Täuschung oder Schaden sprechen→ Falsche, aber glatte Antworten bekommen einen hohen "Qualitäts"-Score
Aus Umsatzsicht ergibt das Sinn. Systeme, die zustimmen, halten ihre Nutzer. Wer sich klug und bestätigt fühlt, kommt wieder.
Aus Betriebssicht ist das ein strukturelles Risiko.
Denn im Tagesgeschäft will ich keine KI, die:
- Mir meine eigenen Denkfehler zurückspiegelt
- Zweifel hinter freundlichen Formulierungen versteckt
- Schwache Entscheidungen bestätigt, damit ich "zufrieden" bleibe
Ich will eine KI, die widerspricht, wenn ich falsch liege. Auch wenn mir das nicht gefällt.
Genau hier ändert Souveräne KI mit Open-Source-Modellen die Lage.
Wenn ich Modelle unter eigener Kontrolle betreibe, kann ich den Anreiz umdrehen:
- Ich hoste das Modell in meiner eigenen Umgebung
- Ich trainiere es nach, auf meinen Daten, meinen Regeln, meinen Sonderfällen
- Ich lege das Belohnungssignal fest
Ich bezahle das Modell nicht mehr für "zufriedene Nutzer". Ich belohne es für "ehrlichen Widerspruch".
Konkreter Effekt aus aktueller Arbeit mit Open-Source-Modellen:
- Auf Fachdaten trainieren, bei denen "nein" das richtige Verhalten ist
- Antworten abstrafen, die nur die Behauptungen des Nutzers wiederholen
- Antworten belohnen, die auf Belege oder Lücken zeigen
Ergebnis in Studien:
→ 67–72% weniger Schmeichelei→ Keine Einbußen bei der Aufgabenqualität
Mit geschlossenen Modellen geht das nicht.
Du kannst nicht:
- Das Belohnungsmodell einsehen
- Ändern, wie "gute" Antworten bewertet werden
- Die Trainingsschleife an deiner Governance ausrichten
Du bekommst nur das, worauf der Anbieter optimiert hat: auf Verbreitung.
Deshalb helfen Prompts, Leitplanken und clevere Oberflächen nur ein Stück weit. Sie sitzen auf einem Kern, der weiter auf Zustimmung optimiert.
Quellen
- Petrov, I., Dekoninck, J., & Vechev, M. (2025). A Benchmark for Sycophancy in Theorem Proving with LLMs. INSAIT/ETH Zurich.
- Wei, J., et al. (2025). Simple Synthetic Data Reduces Sycophancy in Large Language Models. Submitted to ICLR 2025.
- Cheng, M., Lee, C., Khadpe, P., et al. (2025). Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence.