Macht KI alle gleich gut? Was Produktivitätsstudien wirklich zeigen

KI kann Unterschiede bei Arbeitsergebnissen drastisch verkleinern. Ob Menschen dadurch ebenso viel können, ist nicht dieselbe Frage. Eine Analyse widersprüchlicher Experimente.
TUTORize GmbH, Andreas Junga 09.10.2026 Lesezeit wird berechnet
Kurz zusammengefasst

Das Wichtigste in Kürze

  • In einem randomisierten Experiment schrumpfte der bildungsbezogene Leistungsabstand einer Aufgabe mit KI deutlich; ohne KI kehrte ein erheblicher Abstand zurück.
  • Im Kundenservice und in der Softwareentwicklung profitierten weniger Erfahrene besonders stark – jeweils gemessen an konkreten Tätigkeiten.
  • Für eine komplexe Aufgabe außerhalb der getesteten KI-Stärken verschlechterte sich die Richtigkeit der Lösungen.
  • Produktivität mit Assistent, eigenständige Kompetenz und spätere soziale Chancen müssen getrennt beurteilt werden.

Eine erfahrene Fachkraft und eine Berufseinsteigerin bearbeiten dieselbe Aufgabe. Ohne KI liegen ihre Ergebnisse weit auseinander. Mit einem Assistenten liefern plötzlich beide etwas Vorzeigbares ab. Ist die Berufseinsteigerin nun genauso gut wie ihre Kollegin?

Die Frage klingt provokant, ist aber empirisch interessant. Einige Studien finden besonders große KI-Gewinne bei Menschen mit weniger Erfahrung oder formaler Bildung. Andere zeigen, dass dieselbe Technologie fachlich überzeugende, aber falsche Ergebnisse begünstigen kann. KI kann einen Leistungsabstand bei einer Aufgabe verkleinern. Ob sie auch den Kompetenzabstand verkleinert, ist eine andere Frage.

Ein kleinerer Abstand im Ergebnis – nicht zwingend im Können

Eine 2026 veröffentlichte randomisierte Untersuchung von Cruces und Kollegen liefert dazu eine aufschlussreiche Beobachtung. 1.174 Erwachsene zwischen 25 und 45 Jahren lösten online eine arbeitsähnliche geschäftliche Problemstellung. Eine zufällig ausgewählte Gruppe durfte generative KI verwenden, die andere nicht.

Ohne Assistenten betrug der Leistungsabstand zwischen den untersuchten Bildungsgruppen 0,548 Standardabweichungen. Mit KI sank er auf 0,139. Das ist in dieser Aufgabe eine erhebliche Annäherung. Die Gruppe mit geringerer formaler Bildung gewann besonders viel hinzu.

Was sich im Experiment änderte

0,548

Leistungsabstand zwischen Bildungsgruppen ohne KI, in Standardabweichungen

0,139

Abstand mit KI bei derselben Aufgabenart

Cruces et al., randomisiertes Online-Experiment 2026; ein konkretes Aufgabenformat, keine Aussage über allgemeine Intelligenz oder Löhne.

Doch die Forschenden ließen anschließend erneut Aufgaben ohne KI bearbeiten. Ein deutlicher Abstand zwischen den Bildungsgruppen trat wieder hervor. Wer die Arbeit mit dem Assistenten besser erledigt, hat deshalb nicht automatisch alles gelernt, was zur selbstständigen Lösung nötig wäre.

Bemerkenswert ist ein weiterer Befund: Intensive KI-Nutzung ging zwar mit besseren unterstützten Ergebnissen einher. Verbesserungen in der späteren Bearbeitung ohne KI zeigten sich aber vor allem dort, wo die Nutzung mit eigenem Einsatz verbunden war. Diese zusätzliche Auswertung belegt keine allgemeine Lernmethode. Sie verhindert jedoch die bequeme Schlussfolgerung, bloße Tool-Nutzung mache aus einem Leistungssprung bereits Kompetenzaufbau.

Warum Einsteiger im Kundenservice besonders profitierten

Außerhalb des Online-Experiments findet sich ein ähnliches Muster. Erik Brynjolfsson, Danielle Li und Lindsey Raymond untersuchten die gestaffelte Einführung eines KI-Assistenten bei 5.172 Beschäftigten im Kundenservice. Die 2025 im Quarterly Journal of Economics veröffentlichte Studie berichtet im Durchschnitt 15% mehr erfolgreich gelöste Kundenanliegen pro Stunde.

Die Durchschnittszahl verdeckt aber den interessanteren Effekt: Weniger erfahrene und leistungsschwächere Beschäftigte verbesserten sich in dieser Kennzahl um rund 30%. Bei den erfahrensten Beschäftigten waren die Geschwindigkeitsgewinne deutlich kleiner; bei einzelnen Qualitätsmaßen gab es sogar leichte Rückgänge.

Eine naheliegende Erklärung aus der Studie lautet: Ein Assistent kann bewährte Formulierungen und Lösungswege erfahrener Kolleginnen und Kollegen in der konkreten Situation verfügbar machen. Menschen müssen nicht mehr alles bereits kennen, um bei einem Kundenanliegen ähnlich gut voranzukommen.

Das wäre eine wichtige wirtschaftliche Entwicklung. Aber auch hier misst die Studie in erster Linie Arbeitsleistung in einem bestimmten Prozess. Sie misst weder allgemeine Begabung noch, ob die Beschäftigten das zugrunde liegende Wissen ohne Hilfe dauerhaft gleich gut beherrschen.

Auch anspruchsvolle Arbeit folgt keinem einheitlichen Muster

Die These betrifft nicht nur Einstiegsjobs. Drei randomisierte Feldexperimente mit insgesamt 4.867 Softwareentwicklern bei Microsoft, Accenture und einem weiteren Großunternehmen wurden 2026 in Management Science ausgewertet. Mit KI-Coding-Assistenz stieg die Zahl abgeschlossener Aufgaben im zusammengefassten Ergebnis um 26,08%. Auch hier waren die Effekte bei weniger erfahrenen Entwicklern größer.

Die Studie ist kein Beleg, dass Softwareentwicklung durch KI um denselben Prozentsatz insgesamt besser wird. Abgeschlossene Aufgaben sind nicht identisch mit langfristiger Wartbarkeit, Systemsicherheit oder Kundennutzen. Schon der Vergleich verschiedener Experimente im selben Berufsfeld verlangt, die verwendete Kennzahl offenzulegen.

Wer aus dieser Untersuchung einen generellen Vorteil für Anfänger oder eine Entwertung von Erfahrung ableitet, überspringt genau diesen Schritt.

Wenn KI hilft, falsch zu liegen

Einen scharfen Gegenakzent liefert eine Studie mit 758 Wissensarbeitenden aus dem Beratungskontext, die 2026 in Organization Science erschienen ist. In Aufgaben innerhalb der getesteten Fähigkeiten von GPT-4 erledigten die KI-Gruppen 12,2% mehr Aufgaben und arbeiteten 25,1% schneller. Ihre Ergebnisse waren im Untersuchungsmaßstab auch qualitativ besser.

Für eine komplexe Managementaufgabe außerhalb dieser Fähigkeitsgrenze drehte sich das Bild. Mit KI-Unterstützung waren die Teilnehmenden 19% weniger wahrscheinlich bei der richtigen Lösung. Das ist ein Ergebnis für eine ausgewählte Aufgabe, keine allgemeine Fehlerquote von KI.

Entscheidend ist die Verschiebung des Problems: Ein sprachlich stimmiger Vorschlag vermittelt leicht den Eindruck, die Aufgabe sei bereits fachlich durchdrungen. Für die Frage, wer tatsächlich kompetent handelt, reicht es dann nicht, nur das abgegebene Dokument zu bewerten. Man muss auch sehen, ob jemand erkennt, wann der Vorschlag falsch ist.

Leistung mit Assistenz

Was wurde im konkreten Prozess erledigt? Geschwindigkeit, Anzahl gelöster Fälle und Ergebnisqualität können messbar steigen.

Kompetenz ohne Assistenz

Was kann die Person selbst erklären, prüfen und auf neue Situationen übertragen? Diese Fähigkeit folgt nicht automatisch aus demselben Ergebnis.

Der scheinbare Widerspruch liegt oft im Versuchsaufbau

Warum berichten Studien so unterschiedliche Effekte? Weil sie verschiedene Menschen, Aufgaben, Modelle und Erfolgskriterien untersuchen. Eine standardisierte Supportantwort ist etwas anderes als eine seltene Ausnahme in einem langjährig gewachsenen Softwaresystem. Und ein Werkzeug, das den nächsten sinnvollen Schritt vorschlägt, ist nicht zwangsläufig gut darin, eine schwierige Entscheidung gegen plausibel klingende Fehlinformationen abzusichern.

Dass auch neuere Zahlen Vorsicht verlangen, zeigt das Forschungsinstitut METR. Es hatte 2025 in einer kleinen randomisierten Untersuchung bei erfahrenen Open-Source-Entwicklern zunächst eine Verlangsamung durch KI beobachtet. In seinem methodischen Update vom Februar 2026 warnte METR ausdrücklich davor, eine spätere Messung als verlässlichen aktuellen Geschwindigkeitseffekt zu lesen: Gerade Beschäftigte, die ungern ohne KI arbeiten wollten, nahmen seltener teil. Auch die Zeiterfassung bei parallelen Agenten war problematisch.

Das ist keine Widerlegung positiver Studien. Es ist eine Erinnerung daran, dass die Antwort auf die Produktivitätsfrage nicht unabhängig von Stichprobe und Untersuchungsmethode existiert. Wer die stärkste Zahl aus einer Studie herausgreift und zum Versprechen für alle Berufe macht, verliert die wichtigste Information.

Wird Arbeit dadurch gerechter?

Hier muss man zwei Ebenen auseinanderhalten. Eine geringere Ungleichheit beim Ergebnis einer einzelnen Aufgabe ist nicht dasselbe wie geringere Ungleichheit bei Einkommen, Karrierechancen oder Einfluss. Die genannten Experimente messen konkrete Arbeitsaufgaben. Sie können zeigen, wie bestimmte Beschäftigte mit Assistenz abschneiden. Sie belegen nicht, wer später eingestellt, befördert oder besser bezahlt wird.

Es ist sogar denkbar, dass eine Angleichung bei Routinetätigkeiten den Wert anderer Fähigkeiten erhöht: schwierige Situationen erkennen, einen Kontext beurteilen, die richtigen Fragen stellen, Fehler tragen und neue Probleme selbstständig lösen. Das ist eine plausible Folgerung aus der unterschiedlichen Aufgabenwirkung, keine in den genannten Studien nachgewiesene Lohnprognose.

Für Organisationen entsteht damit eine unbequeme Bewertungsfrage. Wenn zwei Menschen mit demselben Werkzeug ähnlich gute Ergebnisse liefern, woran erkennen wir, wer Aufgaben auch unter veränderten Bedingungen übernehmen kann? Das Problem ist nicht, dass Assistenz „unecht“ wäre. Im Arbeitsalltag zählt das fertige Ergebnis durchaus. Nur darf die Bewertung einer Person nicht stillschweigend aus der Bewertung des gemeinsamen Systems Mensch plus Werkzeug abgeleitet werden.

Was man stattdessen prüfen sollte

Wer KI-Unterstützung im Team beurteilt, sollte zuerst die Aufgabe präzise beschreiben. Geht es um wiederholbare Fälle, die sich anhand überprüfbarer Regeln lösen lassen? Oder um offene Entscheidungen, bei denen auch die Richtigkeit der Annahmen unsicher ist? Danach braucht es eine geeignete Ergebnisgröße. Reine Geschwindigkeit ist in komplexen Aufgaben häufig zu wenig.

Hilfreich ist der Vergleich dreier Situationen: Wie fällt die Leistung ohne Assistenz aus? Was verbessert sich bei erlaubter KI-Nutzung? Und was bleibt erhalten, wenn die Person den Lösungsweg später ohne Tool erklären oder in einem neuen Fall anwenden muss? Eine solche Prüfung muss fair und zum Arbeitskontext passend sein; sie ist kein allgemeingültiger Intelligenztest.

Bei riskanten Aufgaben kommt eine vierte Frage hinzu: Erkennt die Person einen guten, aber falschen KI-Vorschlag? Gerade hier kann Erfahrung wichtig bleiben, obwohl Routineergebnisse ähnlicher aussehen.

Das verschiebt den Blick vom bloßen Tool-Zugang auf nachweisbare Fähigkeiten. Ein Unternehmen kann die Qualität unterstützter Ergebnisse belohnen und zugleich Gelegenheiten schaffen, um eigenes Urteilsvermögen zu entwickeln. Beides widerspricht sich nicht.

Gleiche Ergebnisse sind noch keine gleichen Fähigkeiten

Die Forschung liefert keine einfache Antwort darauf, ob KI Leistungsunterschiede dauerhaft beseitigt. Sie zeigt etwas Präziseres: Bei passenden Aufgaben können die Unterschiede im sichtbaren Arbeitsergebnis stark schrumpfen. Zugleich bleiben Unterschiede in eigenständigem Wissen bestehen, und bei unpassenden Aufgaben kann Assistenz die Fehlerwahrscheinlichkeit erhöhen.

Die eigentliche Veränderung könnte deshalb weniger darin liegen, dass künftig alle Menschen gleich gut arbeiten. Sie liegt darin, dass wir genauer unterscheiden müssen, welches Können wir in einem Ergebnis überhaupt beobachten: die Fähigkeit einer Person, die Leistung eines KI-Systems oder die Qualität ihres Zusammenspiels.

Quellen