- Bei Teilnehmern, die AI-Ratschläge nutzten, sank der Anteil der Antworten „Ich weiß nicht“ drastisch von 44 % auf 3 %, während die Genauigkeit von 27 % auf 9 % fiel und das Selbstvertrauen von 30 % auf 76 % stieg
- Um dies von einer rationalen Delegation an ein nützliches Tool zu unterscheiden, nutzte das Forschungsteam Fragen, bei denen AI häufig falschliegt, etwa zu visuellen Details in Filmen, sowie das Modell Step 3.5 Flash, das dabei meist falsche Antworten gibt
- Einige Teilnehmer hätten allein die richtige Antwort geben können, entschieden sich nach einer Frage an die AI aber für eine falsche Antwort, was zeigt, dass falsche AI-Ratschläge sogar bestehende Urteile beschädigen können
- Durch finanzielle Anreize verbesserten sich die Antworten „Ich weiß nicht“ auf 8 % und die Genauigkeit auf 16 %, blieben aber deutlich unter den Referenzwerten ohne AI von 44 % bzw. 27 %
- Schon allein die Möglichkeit, AI zu nutzen, kann die Gewohnheit schwächen, die Grenzen des eigenen Wissens zu erkennen, was besonders bei Kindern und Schülern mit noch nicht ausgereiftem kritischem Denken bedenklich ist
Einfluss von AI-Ratschlägen auf Urteilsvermögen und Selbstvertrauen
- Eine Studie von drei Universitäten in Frankreich und Italien untersuchte, wie sich der Zugang zu AI-Ratschlägen auf das Aussetzen von Urteilen, die Genauigkeit und das Selbstvertrauen auswirkt
- Der Anteil der Antworten „Ich weiß nicht“ sank von 44 % auf 3 %
- Die Genauigkeit fiel von 27 % auf 9 %
- Das Selbstvertrauen stieg von 30 % auf 76 %
- An der Studie beteiligt waren Valerio Capraro von der University of Milano-Bicocca, Chiara Marcoccia von der École Normale Supérieure und Walter Quattrociocchi von der Sapienza University of Rome
- Die Fragen bestanden aus visuellen Details aus Filmen, bei denen AI-Modelle typischerweise scheitern, etwa der Farbe der Teamtrikots in Bend It Like Beckham
- Verwendet wurde absichtlich Step 3.5 Flash, das bei solchen Fragen meist falschliegt, um auszuschließen, dass der Rückgang des Urteilsvermögens auf eine rationale Delegation an ein verlässliches Tool zurückzuführen ist
- Einige Teilnehmer wählten nach einer Frage an die AI selbst bei Aufgaben eine falsche Antwort, die sie allein richtig beantwortet hätten
- Finanzielle Anreize verbesserten die Ergebnisse teilweise, erreichten aber nicht das Niveau der Bedingung ohne AI
- Antworten mit „Ich weiß nicht“ stiegen von 3 % auf 8 %, lagen aber unter dem Referenzwert von 44 %
- Die Genauigkeit stieg von 9 % auf 16 %, blieb aber unter dem Referenzwert von 27 %
Kognitive Kapitulation und Sorgen im Bildungsbereich
- Forscher von Wharton bezeichneten das Phänomen, dass Menschen falsche AI-Antworten zu 80 % akzeptieren und dabei mehr Selbstvertrauen zeigen als Personen ohne AI, als
cognitive surrender - Die aktuellen Ergebnisse zeigen, dass es nicht nur beim Vertrauen in falsche AI-Antworten bleibt, sondern dass schon die Verfügbarkeit von AI selbst die Gewohnheit unterdrückt, zu erkennen, was man nicht weiß
- Capraro betont, dass die Fähigkeit, „Ich weiß nicht“ zu sagen, für den Menschen wichtig ist, weil sie das Erkennen der Grenzen des eigenen Wissens bedeutet
- Besonders besorgniserregend sind Kinder, die mit AI-Systemen aufwachsen, bevor ihre Fähigkeit zum kritischen Denken ausgereift ist
- Googles Umbau der AI-Suche hat Links durch selbstbewusst formulierte, AI-generierte Zusammenfassungen ersetzt; Common Sense Media bezeichnete dieses Design für Schüler als „inakzeptables Risiko“
- Wenn Menschen weiterhin AI-Produkte verwenden, die darauf ausgelegt sind zu antworten und nicht „Ich weiß nicht“ zu sagen, könnten auch sie dieses Verhalten erlernen
1 Kommentare
Hacker-News-Kommentare
Diese Studie ist ziemlich schlampig. Wie dieser Kommentar zum PDF treffend hervorhebt, gibt es in dem Experiment überhaupt nichts, was nur für AI-Systeme spezifisch wäre
Die Forschenden gaben den Teilnehmenden ein LLM, von dem bekannt war, dass es bei bestimmten Fragen falsche Antworten liefert, und stellten dann genau diese Fragen unter der Bedingung, dass man bei Unsicherheit auch nicht antworten müsse
Das ist so, als würde man jemandem ein Lehrbuch für ein unbekanntes Fachgebiet geben, in dem manche Fakten falsch sind, und dann genau den falschen Stoff daraus abprüfen. Natürlich steigt dann sowohl die Wahrscheinlichkeit, dass die Teilnehmenden antworten, als auch die Wahrscheinlichkeit, dass sie falsch antworten
Ich interessiere mich sehr dafür, wie Dinge wie Schmeicheltendenz oder kognitive Trägheit moderner LLMs Lernen und Selbstsicherheit beeinflussen, aber diese Studie prüft keinen dieser Faktoren, und das Versuchsdesign würde sich kaum ändern, wenn man das LLM einfach durch ein fehlerhaftes Lehrbuch ersetzen würde
Ein besserer Titel wäre „Eine sehr ungenaue AI machte Menschen ungenauer“, aber dann stellt sich natürlich sofort die Frage: „Was ist mit einer einigermaßen genauen AI?“
So wie man Mitarbeitenden kein schlechtes Lehrbuch kaufen sollte, wenn man keine falschen Antworten will, sollte man ihnen vielleicht auch keine AI für Gebiete geben, in denen sie sich nicht auskennen
Außerdem ist das Nachschlagen in einem Lehrbuch viel umständlicher, als ein LLM zu fragen, daher wäre der Effekt vermutlich schwächer. Wenn niemand verpflichtet ist zu antworten, werden ohnehin nur wenige extra ein Lehrbuch durchforsten, und erst recht nicht, wenn auf dem Umschlag steht: „Kann falsche Antworten enthalten“
Wie oft wird wohl ein Manager AI-Ratschläge wiederholen, ohne einen Experten zu fragen, oder einen Experten anzweifeln, weil die AI etwas anderes gesagt hat? Die AI kann zwar auch recht haben, aber wenn sie falsch liegt, ist das sehr schwer zu korrigieren
Subreddits für Ratschläge und Informationen sind durch die Nutzung von AI qualitativ stark schlechter geworden. Fragesteller wollen Antworten von Menschen, die selbst Bescheid wissen, aber viele leiten die Frage einfach an ChatGPT weiter und posten das Ergebnis dann so, als wäre es ihre eigene Kenntnis und Einsicht
Wie gut die Studie ist, weiß ich nicht, aber auf Reddit als halbwegs realem Raum ist das Phänomen deutlich sichtbar. Es geht längst nicht mehr nur darum, nicht einfach „Ich weiß es nicht“ zu sagen, sondern darum, aktiv nach Gelegenheiten zu suchen, so zu tun, als wüsste man Bescheid
Meine Lösung ist, ständig die Originalquelle und die Belege zu prüfen, aber das kostet viel Zeit und Mühe, und schon die Auswahl, was man zuerst verifizieren soll, ist schwierig
Es wäre noch eher sinnvoll, zu sagen „Gib xyz in ChatGPT ein“ oder einen Link zu einem strukturierten Dokument zu teilen. Wer das Ergebnis einfach nur kopiert und einfügt, fügt dem Vorgang keinerlei Wert hinzu
Man kann Informationen auch bei IMDB oder in DIY-Videos finden, aber was ich will, ist kontextreiche Erklärung und lokal angepasster Rat. Jemand, der mich kennt, weiß auch, was für mich leicht oder schwer ist, und kann mir sagen, dass ein bestimmter Film oder Trick nicht passt oder in welchen Laden ich gehen sollte
Entscheidend waren immer aktive Moderatoren, die viel Interesse und enorm viel Zeit investieren. Wenn die Zahl der Nutzer, die minderwertige Beiträge posten, einen Kipppunkt überschreitet, verschwinden die guten Nutzer und es gibt kein Zurück mehr
Aus AI-Pessimismus betrachtet wird AI den Nutzern auch dann weiter nach dem Mund reden, wenn sie intelligenter wird, und Menschen werden sie gerade in Bereichen, in denen sie sich nicht gut auskennen, nutzen, um dumme Ideen mit noch größerer Überzeugung zu bestärken
Selbst wenn es technisch lösbar wäre, wollen sie kein Modell, das ihnen sagt, dass sie falschliegen, und würden daher eher flüssig vorgetragene Lügen wählen, die ihre Überzeugungen stärken
Meinungsfreiheit lässt einen daran denken, dass man falschliegen könnte, Vereinigungsfreiheit hilft einem dagegen, das zu vermeiden. AI wird die tröstliche Echokammer des Internets auf ein kaum vorstellbares Ausmaß vergrößern
Es war die Zeit, in der Computer mehrere Größenordnungen schneller als Menschen zu rechnen begannen, und der Einsturz des Hartford Civic Center wird als Versagen behandelt, das auf blindem Vertrauen in Computerausgaben beruhte. Glücklicherweise gab es keine Todesopfer
Es wirkt wie ein etwas selektiv gewähltes Beispiel, aber bei der Kombination aus „niedriger Genauigkeit und hoher Gewissheit“ kam mir dieser Unfall in den Sinn. Ich mache mir Sorgen, ob sich die richtige Nutzung neuer Technologien erst dann etabliert, wenn Zivilisten sterben oder rechtliche Haftung entsteht; man könnte zumindest damit anfangen, 1) sie nicht in sicherheitskritischen Systemen einzusetzen und 2) Experten nicht durch Algorithmen zu ersetzen
https://www.engr.psu.edu/ae/thesis/failures/MKP/failures/fai...
Wer aber mit AI tatsächlich arbeitet und viel Geld dafür zahlt, zieht es eher vor, von der AI gesagt zu bekommen, dass sie falschliegt, als vor Kunden falschzuliegen
Da sie richtige Antworten geben und zugleich Anweisungen befolgen soll, ist das nicht leicht zu lösen und erfordert Balance. Intelligentere Modelle wissen eher, was richtig ist, und sind daher im Allgemeinen besser als kleine Modelle, die annehmen, der Nutzer habe recht, und dann die Halluzination fortsetzen
Es wäre allerdings interessant, wenn Nutzer leicht auswählen könnten, wie stark die AI ihrer Persönlichkeit oder den eingegebenen Gedanken widersprechen soll
Ohne eine ordentliche Retrieval-Augmented Generation (RAG)-Pipeline oder Websuche können sie gar nicht anders, als Halluzinationen mit maximaler Sicherheit auszugeben
Es wäre interessanter gewesen, mit einem sauber ausgerichteten Spitzenmodell zu experimentieren, das Antworten verweigert, wenn die Token-Wahrscheinlichkeit niedrig ist. Das aktuelle Experiment belegt nur, dass Menschen dazu neigen, gut geschriebene Texte zu vertrauen, die in einer Chat-UI angezeigt werden
Für diejenigen, denen Wahrheit noch wichtig ist, kann dieses Zitat von Richard Feynman als Wegweiser dienen: „Ich habe den Vorteil, herausgefunden zu haben, wie schwierig es ist, etwas wirklich zu wissen, wie sorgfältig man Experimente überprüfen muss und wie leicht es ist, Fehler zu machen und sich selbst zu täuschen …“
https://www.youtube.com/watch?v=tWr39Q9vBgo
Die Anreizstruktur der Studie war: 0,10 Dollar Auszahlung bei richtiger Antwort, 0,10 Dollar Abzug bei falscher Antwort, keine Veränderung bei verweigerter Antwort
Es stand nicht dabei, ob die Teilnehmer tatsächlich Geld erhielten oder ob sie bei einem negativen Endsaldo den Verlust bezahlen mussten
Ich glaube, der Effekt ist real, aber vermutlich nicht so groß, wie die Daten nahelegen. Wären deutlich höhere Beträge im Spiel gewesen, hätte der gesunde Menschenverstand wohl stärker gewirkt
Es ist gut, dass auf die Studie hingewiesen wurde, aber keiner der Quellenlinks führt direkt zu der zitierten Studie, sondern auf eigene Domains oder Business Insider
Marcoccia, C. et al., 《AI Advice Suppresses People’s Willingness to Say “I Don’t Know”, Even When the Advice Is Wrong and Accuracy Is Incentivized》, PsyArXiv, 15. Juli 2026
Ich würde gern wissen, ob AI tatsächlich einen praktischen Unterschied macht im Vergleich zu einer Umgebung, in der man einfach Zugang zu falschen Antworten hat
Man müsste prüfen, ob dasselbe Ergebnis herauskommt, wenn Suchergebnisse falsche Antworten auf die Frage liefern, wie stark AI-spezifische Eigenschaften wie Schmeicheltendenz oder dialogische Interaktion wirken oder ob Menschen einfach leicht glauben, was sie lesen
Kurz gesagt wurden sowohl eine LLM-Chat-Oberfläche mit falschen Antworten als auch eine Bedingung mit Zugang zu vorab erzeugten falschen Antworten untersucht, und in beiden Experimenten kamen ähnliche Ergebnisse heraus
Einige Lehrkräfte lassen Schüler ihre Aufgaben mit ChatGPT schreiben und dann die falschen Teile kritisieren
An Orten, wo man sonst die AI-Antwort einfach kopieren und einreichen würde, könnte es interessant sein, zunächst die AI-Antwort vorzulegen und dann die Gemeinschaft darüber diskutieren zu lassen, was sie ausgelassen hat