Kurz gesagt. Künstliche Intelligenz hält in der Personaldiagnostik Einzug, aber anders, als die Diskussion oft nahelegt. Eine aktuelle Delphi-Studie unter 247 Fachleuten zeigt ein klares Bild: Am höchsten bewertet werden Anwendungen, in denen KI die Arbeit der Beobachtenden unterstützt, Beobachtungsdaten verdichtet und individuelles Feedback ermöglicht. Wenig Zustimmung erhält dagegen alles, was die Bewertung ersetzt: Die vollständig automatisierte Beurteilung ohne menschliche Beteiligung erhält mit großem Abstand die niedrigste Zustimmung. In diesem Artikel ordnen wir ein, wo KI in der Diagnostik heute tatsächlich hilft, wo Fachleute klare Grenzen ziehen und was das für Organisationen bedeutet, die ihre Auswahl- und Entwicklungsverfahren weiterentwickeln möchten.
Die Frage, ob künstliche Intelligenz in der Personaldiagnostik eine Rolle spielen wird, ist beantwortet. Sie spielt bereits eine. Videointerviews werden automatisiert ausgewertet, Sprachanalyse ordnet Antworten Kompetenzen zu, Systeme fassen Beobachtungsnotizen zusammen. Die interessantere Frage lautet inzwischen: In welchen Schritten hilft KI tatsächlich, und an welcher Stelle darf sie die Beurteilung nicht übernehmen?
Auf diese Frage gibt es seit Kurzem eine belastbare Antwort. Die Hochschule für Wirtschaft und Gesellschaft Ludwigshafen hat gemeinsam mit der Deepwood GmbH eine Delphi-Studie durchgeführt, für die 247 Fachleute aus der eignungsdiagnostischen Praxis in mehreren Runden befragt wurden. Sie sollten sechzehn konkrete Einsatzszenarien bewerten: Wie erwünscht ist dieses Szenario, wie verbreitet ist es heute, und wie verbreitet wird es künftig sein?
Das Ergebnis ist deutlicher, als die aufgeregte Debatte über KI in der Personalauswahl vermuten lässt. Aus 25 Jahren Beratungspraxis in der Personal- und Führungskräfteentwicklung können wir die Kernaussage bestätigen: Es geht nicht um Ersetzen, es geht um Entlasten an den richtigen Stellen.
Wer von KI in der Diagnostik spricht, meint in der Regel nicht ein autonom urteilendes System, sondern eine Reihe sehr unterschiedlicher Anwendungen. Es lohnt sich, sie zu unterscheiden, weil ihre Reife und ihre Risiken weit auseinandergehen.
Sprachanalyse. Verfahren aus dem Bereich der maschinellen Sprachverarbeitung werten Texte oder Transkripte aus und ordnen sprachliche Muster definierten Kompetenzen zu. Eingesetzt wird das etwa bei der Auswertung schriftlicher Aufgaben oder bei der Strukturierung von Beobachtungsnotizen.
Asynchrone Videointerviews. Kandidatinnen und Kandidaten beantworten vorgegebene Fragen per Videoaufnahme, das System wertet die Antworten aus. Der Reiz liegt in der Skalierbarkeit, die diagnostische Aussagekraft ist allerdings begrenzter als bei einem strukturierten Interview mit geschulten Interviewenden.
Verdichtung von Beobachtungsdaten. Hier arbeitet die KI nicht am Menschen, sondern an den Daten, die Beobachtende erzeugt haben. Sie fasst Notizen in einheitlichen Protokollen zusammen, gleicht Beobachtungen mit einem Soll-Profil ab und macht Muster über mehrere Übungen hinweg sichtbar.
Vorbereitung und Nachbereitung. KI schlägt auf Basis eines Anforderungsprofils passende Übungen vor oder erstellt individuelle Entwicklungsempfehlungen aus den Ergebnissen. Diese Anwendungen berühren die Beurteilung selbst nicht.
Diese Unterscheidung ist nicht akademisch. Sie erklärt, warum die Bewertung durch Fachleute so unterschiedlich ausfällt, je nachdem welches Szenario zur Debatte steht.
In der Delphi-Studie erhielten drei Szenarien die höchste Zustimmung, und sie folgen alle demselben Muster: Die KI arbeitet zu, das Urteil bleibt beim Menschen.
Die kombinierte Bewertung. Am höchsten bewertet wurde ein Szenario, in dem die finale Einschätzung aus menschlicher Beurteilung und KI-Vorschlag mit einem vorher definierten Gewicht entsteht. Entscheidend ist dabei das Wort „definiert“: Die Organisation legt fest, welchen Anteil der maschinelle Vorschlag hat, statt ihn implizit wirken zu lassen.
Die Verknüpfung mit vorhandenen Daten. Ebenfalls hoch bewertet wurde, Ergebnisse aus Auswahl- und Entwicklungsverfahren mit Unternehmensdaten zu verbinden, um Aussagen über längerfristige Entwicklungen zu gewinnen. Hier liegt Potenzial, das viele Organisationen bisher ungenutzt lassen, weil die Daten in getrennten Systemen liegen.
Die unterstützte Selbstreflexion. Das dritte Szenario mit hoher Zustimmung: Kandidatinnen und Kandidaten reflektieren ihre eigene Leistung mit Unterstützung einer KI, die Muster erkennt und individuelles Feedback gibt. Das verschiebt den Nutzen von der Organisation zur Person und macht aus einem Auswahlverfahren einen Entwicklungsanlass.
Bei der Frage nach der künftigen Verbreitung zeichnet sich dasselbe Bild noch deutlicher ab. Die größten Zuwächse erwarten die Befragten dort, wo KI die Vorbereitung und die Nachbereitung übernimmt: passende Übungen vorschlagen, Beobachtungsdaten zu Kompetenzprofilen verdichten, individuelle Entwicklungsempfehlungen formulieren. Die Studienautoren fassen es so zusammen, dass sich KI schrittweise über unterstützende Funktionen durchsetzen dürfte, während automatisierende Anwendungen deutlich zurückhaltender beurteilt werden.
Genauso aufschlussreich wie die Zustimmung ist die Ablehnung. Drei Szenarien fielen deutlich durch, und auch sie folgen einem gemeinsamen Muster.
Die vollständig automatisierte Bewertung. Das Szenario, in dem alle Beobachtungen und Bewertungen ausschließlich durch KI-Systeme erfolgen und Menschen nicht mehr eingreifen, erhielt mit großem Abstand die niedrigste Zustimmung des gesamten Feldes. Das ist bemerkenswert, weil genau dieses Szenario die öffentliche Debatte prägt, obwohl es in der Fachwelt praktisch niemand will.
Die Analyse verdeckter Gruppenmuster. Ebenfalls klar abgelehnt wurde, dass KI Gruppenübungen beobachtet und dabei Muster wie Dominanz oder Kooperation identifiziert, die Menschen schwer erfassen. Der Reiz ist offensichtlich, das Unbehagen ebenso: Wer sich beobachtet fühlt, ohne zu wissen, worauf geachtet wird, verhält sich anders.
Die Emotionsdiagnostik. Am dritten Ablehnungspunkt steht die Analyse von Mimik, Stimme und Körpersprache, um emotionale Reaktionen wie Stress oder Empathie sichtbar zu machen. Hier kommen fachliche Zweifel an der Validität und rechtliche Bedenken zusammen.
Die Trennlinie verläuft damit sehr präzise: Solange KI Arbeit abnimmt, Daten aufbereitet oder Rückmeldung individualisiert, ist die Akzeptanz hoch. Sobald sie in die Beurteilung selbst eingreift oder Aspekte erfasst, die die beurteilte Person nicht überblicken kann, kippt sie. Diese Haltung deckt sich mit dem, was wir in Gesprächen mit Personalverantwortlichen hören: Die diagnostische Verantwortung soll beim Menschen bleiben.
Sie fragen sich, ob Ihre Auswahlverfahren noch valide sind, wenn Kandidat:innen KI-Tools nutzen?
Wir haben dazu ein eigenes Format entwickelt. Mehr dazu auf unserer Seite zum KI-robusten Assessment Center.
Aus den Befunden lassen sich für Organisationen drei konkrete Konsequenzen ableiten.
Erstens: Der Einstieg liegt in der Nachbereitung, nicht in der Bewertung. Wer KI in der Diagnostik ausprobieren möchte, beginnt sinnvollerweise dort, wo das Risiko gering und der Zeitgewinn spürbar ist. Die Zusammenfassung von Beobachtungsnotizen in einheitlichen Protokollen ist so ein Punkt. Sie kostet in der klassischen Durchführung viel Zeit, sie ist gut strukturierbar, und ein Fehler wird beim Gegenlesen bemerkt.
Zweitens: Wer KI einsetzt, muss sie beurteilen können. Die Studie zeigt beim erwarteten Kompetenzwandel ein eindeutiges Bild: Den stärksten Bedeutungszuwachs sehen die Befragten bei technologischer Kompetenz, gefolgt von der Fähigkeit zur Dateninterpretation. Ein System, dessen Ergebnisse niemand einordnen kann, schafft keine Entlastung, sondern eine neue Abhängigkeit. Diese Verschiebung betrifft nicht nur die Diagnostik, sondern Fach- und Führungsrollen insgesamt, wie wir im Artikel zu Future Skills im Unternehmen beschrieben haben.
Drittens: Die Verantwortungsfrage gehört vorab geklärt. Wenn ein maschineller Vorschlag in eine Personalentscheidung einfließt, muss vorher feststehen, wer die Entscheidung trägt und wie stark der Vorschlag gewichtet wird. Das höchstbewertete Szenario der Studie beschreibt genau das: eine definierte Gewichtung statt einer diffusen Vermischung. Ohne diese Festlegung entsteht ein Graubereich, in dem sich am Ende niemand zuständig fühlt.
Die Norm DIN 33430 zu Anforderungen an berufsbezogene Eignungsbeurteilungen bleibt dabei der Maßstab. Sie stellt Anforderungen an die Qualifikation der Beurteilenden, an die Nachvollziehbarkeit des Verfahrens und an die Dokumentation. Ein KI-gestützter Prozess muss diese Anforderungen genauso erfüllen wie ein klassischer.
Eine Entwicklung wird in der Diskussion über KI in der Diagnostik regelmäßig übersehen, obwohl sie für die Praxis unmittelbarer relevant ist als jede Frage nach automatisierter Bewertung: Kandidatinnen und Kandidaten nutzen KI längst selbst.
Bei einer schriftlichen Aufgabe, die remote bearbeitet wird, ist heute nicht mehr sicher zu sagen, wessen Formulierungsfähigkeit bewertet wird. Bei einer Fallstudie, die vorbereitet mitgebracht wird, gilt dasselbe für die Analysetiefe. Das ist kein moralisches Problem, sondern ein methodisches: Ein Verfahren misst nur dann, was es messen soll, wenn die Bedingungen kontrolliert sind.
Die Antwort darauf liegt nicht darin, KI zu verbieten, was ohnehin kaum durchsetzbar wäre. Sie liegt im Aufgabendesign. Übungen, die im direkten Gespräch stattfinden, Situationen mit unerwarteten Wendungen, Aufgaben, bei denen die Begründung wichtiger ist als das Ergebnis: Solche Formate bleiben aussagekräftig, unabhängig davon welche Werkzeuge jemand kennt. Genau an diesem Punkt setzt unser Format des KI-robusten Assessment Centers an.
In unserer Arbeit mit Organisationen, die ihre Verfahren weiterentwickeln, hat sich ein pragmatisches Vorgehen bewährt: nicht das gesamte Verfahren umstellen, sondern einen klar umrissenen Schritt herausgreifen, ihn parallel zum bisherigen Weg testen und die Ergebnisse vergleichen. Wer die maschinelle Zusammenfassung von Beobachtungsnotizen einführt, kann sie zunächst neben der bisherigen Auswertung laufen lassen und prüfen, ob dieselben Kernaussagen entstehen.
Eine Beobachtung aus unserer Praxis: Der größte Gewinn liegt oft nicht in der Technik selbst, sondern darin, dass Organisationen beim Einführen zum ersten Mal seit Jahren wieder genau hinschauen, welche Kompetenzen sie eigentlich messen wollen. Diese Klärung wirkt unabhängig davon, ob am Ende ein System eingesetzt wird oder nicht. Wer sein Anforderungsprofil und seine Beobachtungskriterien geschärft hat, verbessert damit auch das klassische Verfahren.
Für Organisationen, die sich dem Thema zum ersten Mal nähern, empfiehlt sich deshalb diese Reihenfolge: erst die eigenen Kriterien schärfen, dann prüfen, an welcher Stelle im Prozess Zeit verloren geht, und erst danach die Frage stellen, ob ein System dort sinnvoll unterstützt.
Der Einsatz unterstützender Systeme ist grundsätzlich möglich, unterliegt aber mehreren Anforderungen. Relevant sind der Datenschutz, die Mitbestimmungsrechte des Betriebsrats bei der Einführung technischer Einrichtungen und die Frage automatisierter Einzelentscheidungen. Je stärker ein System in die Entscheidung eingreift, desto höher die Anforderungen an Transparenz und Nachvollziehbarkeit. Bei konkreten Vorhaben lohnt sich eine juristische Prüfung im Einzelfall, weil die Bewertung stark von der Ausgestaltung abhängt.
Drei Fragen bringen schnell Klarheit. Erstens: Welche Belege gibt es für die Aussagekraft des Verfahrens, und beziehen sie sich auf einen vergleichbaren Anwendungsfall? Zweitens: Lässt sich nachvollziehen, wie ein Ergebnis zustande kommt, oder bleibt es eine Blackbox? Drittens: Welche Daten wurden zum Training verwendet, und wie wird geprüft, ob sich darin systematische Verzerrungen fortschreiben? Ein Anbieter, der diesen Fragen ausweicht, ist ein Warnsignal.
In eine Richtung ja, in die andere nein. Ein System bewertet alle Beteiligten nach denselben Regeln und unterliegt nicht der Tagesform oder Sympathie. Es kann deshalb helfen, Unterschiede in menschlichen Urteilen sichtbar zu machen. Gleichzeitig übernimmt es Verzerrungen aus den Daten, mit denen es trainiert wurde. Wurde ein System mit historischen Personalentscheidungen trainiert, die bestimmte Gruppen benachteiligt haben, reproduziert es dieses Muster. Objektivität entsteht also nicht automatisch durch Technik, sondern durch Prüfung.
Zurückhaltender als auf menschliche Beurteilung. Das gilt besonders dann, wenn nicht erklärt wird, was ausgewertet wird und wie das Ergebnis in die Entscheidung einfließt. Wer KI einsetzt, sollte das offen kommunizieren und erläutern können, welchen Anteil sie an der Entscheidung hat. Intransparenz beschädigt das Erleben des Verfahrens stärker als der Technikeinsatz selbst.

Über die Autorin
Samira Kurschel
Geschäftsführerin MES GmbH. Seit über 15 Jahren in der Personal- und Führungskräfteentwicklung im Mittelstand und in DAX-Unternehmen. Schwerpunkte: Führungskräfteentwicklung und Talentprogramme, Begleitung Kulturwandel.
Für Organisationen, die ihre Auswahlverfahren so gestalten möchten, dass sie auch dann aussagekräftig bleiben, wenn Kandidat:innen KI-Werkzeuge nutzen: Aufgabendesign, das im direkten Gespräch trägt, klare Beobachtungskriterien und ein Verfahren nach DIN 33430. Begleitet von unseren Berater:innen aus Hamburg, Köln und München.
Sie sehen gerade einen Platzhalterinhalt von Vimeo. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von YouTube. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie müssen den Inhalt von reCAPTCHA laden, um das Formular abzuschicken. Bitte beachten Sie, dass dabei Daten mit Drittanbietern ausgetauscht werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von Facebook. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von Instagram. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von Google Maps. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von Google Maps. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von Mapbox. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von OpenStreetMap. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr InformationenSie sehen gerade einen Platzhalterinhalt von X. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.
Mehr Informationen