Vergleichsmaßstab ist die deutsche Langzeitstudie „Umweltbewusstsein in Deutschland“. Darin fragt das Umweltbundesamt (UBA) in regelmäßigen Abständen Menschen in Deutschland nach Verhaltens- und Handlungsweisen bezüglich Umweltthemen. Die Autor:innen übernahmen Fragen aus der Umweltbewusstseinsstudie und erarbeiteten weitere, bei denen die Antwortenden ihr Verhalten zwischen 0 = wenig umweltbewusst bis 10 = sehr umweltbewusst einordnen. Da Sprachmodelle keine eigenen Alltagsentscheidungen treffen, wurden Verhaltensfragen in Fragen nach Empfehlungen umformuliert.
Getestet wurden 31 Large Language Modelle – kurz LLMs – aus den USA, China und Europa Darunter bekannte Modelle wie: ChatGPT, Gemini, Grok, Claude und DeepSeek. Die Modelle wurden zunächst möglichst wertneutral mit den Fragen gefüttert und immer wieder von neuem, ohne vorherigen Wissensstand, gefragt. Jegliche Einstellungen, die die LLMs aus möglichen vorherigen Prompts und Vorgaben haben könnten, wurden damit nach Möglichkeit minimiert.
Es zeigte sich: 19 von 31 Modellen waren in Umweltfragen progressiver als der Bundesdurchschnitt, nur vier waren konservativer.Die Mehrheit der Modelle lag innerhalb der normalen Streuung der deutschen Bevölkerung (Abfrage aus dem Jahr 2024). Die Studie befindet sich aktuell im sogenannten Peer Review Verfahren, in der sie von weiteren Wissenschaftler:innen begutachtet wird.
Frau Kunkel, warum antworten viele der von Ihnen untersuchten LLMs grüner als der Durchschnitt der deutschen Bevölkerung?
Das ist gleich eine Frage, die schwer zu beantworten ist und die wir zunächst auch gar nicht beabsichtigt haben zu beantworten, da es mit unserer Methodik nicht möglich ist. Trotzdem ist die Frage sehr relevant und auch in unserem Interesse. Nach der Analyse weiterer Studien, vermuten wir, dass der Ursprung unter anderem in den Daten liegt, also den Daten, mit denen die Modelle trainiert werden.
Werden diese von den Unternehmen hinter den LLMs offen kommuniziert?
Überwiegend nein und gerade die großen Modelle, wie ChatGPT, Gemini und Co. sind eine Black Box. Wie und mit was die großen Tech-Unternehmen ihre Modelle füttern, wird von Ihnen weitgehend geheim gehalten. Zunächst aber kann man vermuten, dass die Algorithmen der Modelle, bezogen auf Umweltfragen wie etwa auf den Klimawandel, anhand seriöser wissenschaftlicher Studien lernen. Und der wissenschaftliche Konsens zum Klimawandel ist nun mal eindeutig. Zudem wird in weiteren Studien der Aspekt des Reinforcement Learning through human Feedback (RLHF) häufig als mögliche Ursache für Ausrichtungen der Modelle genannt. Da geht es um Finetuning der Modelle durch Menschen, die noch einmal Feedback zu den maschinell erstellten Antworten geben.
Wer sind diese Menschen?
Auch das wird von den Firmen überwiegend verschleiert. Oftmals werden diese Arbeiten an Firmen im Ausland ausgelagert, wo die Löhne niedriger sind. Es gibt aber Studien, die versucht haben, das RLHF zu untersuchen, und es zeigt sich zumindest, dass, wenn Menschen eine bestimmte Haltung haben, dies Einzug in die LLMs findet. Es gibt eine meinungsverstärkende Wirkung, da die LLMs gerne gefällige Antworten geben. Wenn man sich die im Durchschnitt progressiveren Antworten unserer Untersuchung anschaut, ist zu vermuten, dass das Zusammenspiel von Datengrundlage und RLHF Teil der Erklärung dieser Antworten ist.
Ist es möglich, dass die LLMs gemerkt haben, dass die Fragen aus der Umweltbewusstseinsstudie des UBA stammen und deswegen gewünschte Antworten gegeben haben?
Es kann sein, dass die LLMs Fragemuster aus der Umweltbewusstseinsstudie erkannt und die echten Antworten der Umweltbewusstseinsstudie analysiert haben. Gleichzeitig waren die Antworten der LLMs im Durchschnitt eben „umweltfreundlicher“ als in der Studie des UBA. Wir haben die Studie grundsätzlich so konzipiert, dass sich die Antworten nicht gegenseitig beeinflussen sollten. Bei jeder Frage und Antwort sind wir quasi bei Null gestartet, ohne vorherigen Wissenstands von Prompts. Zudem sind viele der Fragen so konzipiert, dass sie nicht Wissen abfragen, sondern Einstellungen zu bestimmten Themen, etwa ob man das Gefühl hat, dass der Klimawandel das Leben verändert und ob man diesbezüglich beunruhigt ist. Eine mögliche Schwäche der Studie ist, dass wir vorgegeben haben, dass die LLMs antworten müssen. Ansonsten hätten sie zum Beispiel vielleicht aufgrund der Einsicht, dass sie keine Emotionen haben, manche Fragen nicht beantwortet.
Sie haben ebenfalls untersucht, wie sich das Antwortverhalten ändert, wenn anders geprompted und den/dem Fragenden neue Rollen zugewiesen wurden.
Wenn wir dem Sprachmodell gesagt haben, antworte wie ein konservativer Politiker oder wir haben uns als Vertreterin einer Umweltschutzorganisation ausgegeben, dann haben sich die Antworten der LLMs geändert. Es zeigte sich wieder die Tendenz, dass die Modelle den Fragenden gefallen wollen. Das ist logisch, wenn man bedenkt, dass die Unternehmen möchten, dass die Modelle möglichst häufig genutzt werden. Für die Fragenden ist es meist deutlich angenehmer, eigene Werte gespiegelt zu bekommen und zumindest keinen starken Dissens zu verspüren. So müssen die Menschen sich nicht mit möglichen eigenen Fehleinschätzungen auseinandersetzen.
Können aber in der Tendenz zunächst einmal grünere Antworten, das Verhalten der Menschen zum Positiven, hinsichtlich Klima- und Umweltschutz, verändern?
Es gibt Untersuchungen, die wir zum Teil auch in unserer Studie zitieren, die geprüft haben, ob infolge der Interaktion mit einem Sprachmodell, umweltfreundlichere Einstellungen bei den Nutzer*innen entstehen. In einer solchen Studie wurde nach LLM-Nutzung ein höheres Bewusstsein für Umweltthemen und Intentionen hinsichtlich umweltfreundlicheren Verhaltens gemessen. Jedoch bestehen Zweifel über die tatsächliche Umsetzung der Intentionen. Das deckt sich mit psychologischer Forschung, wonach Menschen häufig mehr über Klimaschutz und Nachhaltigkeit wissen, als sie am Ende tatsächlich in die Tat umsetzen. Es zeigte sich aber in einer weiteren Studie auch, wenn man den Menschen spezifischere, auf ihr Personenprofil zugeschnittene, Empfehlungen macht, dass diese mehr Potenzial haben, in die Tat umgesetzt zu werden. Das geht in die Richtung eines gezielten Werbens. Mit den ganzen Daten, die die großen Tech-Unternehmen über ihre Nutzer:innen haben, liegt hier viel Potenzial für Manipulation des Nuter*innenverhaltens, z.B. in Bezug auf Kaufentscheidungen - im positiven wie im negativen.
Die Studie Greener Than Humans? Environmental Attitudes in Large Language Models wurde erarbeitet von Stefanie Kunkel, Tilman Hartwig (Umweltbundesamt), Marcus Voß (u.a Birds on Mars), Emma K. Schütt (RIFS) und Angelika Gellrich (Umweltbundesamt)
























































