Künstliche Intelligenz Datenanalyse: Ablauf statt Blackbox
Künstliche Intelligenz in der Datenanalyse liefert keine fertigen Erkenntnisse von allein. Ein Ablauf mit Beispiel, Werkzeugtypen und dem einen Prüfschritt.
Künstliche Intelligenz in der Datenanalyse bedeutet in der Praxis meistens: ein Modell schreibt und führt den Code aus, den du sonst selbst in einer Tabellenkalkulation oder einem Statistikprogramm getippt hättest. Es findet keine Erkenntnis, die dir sonst entgangen wäre — es nimmt dir die Mechanik ab, Zahlen zu gruppieren, zu filtern und darzustellen. Die eigentliche Analysearbeit, die Frage klar zu stellen und das Ergebnis richtig zu lesen, bleibt bei dir.
Der häufigste Fehler sieht so aus: eine Rohdatei hochladen und „was fällt dir auf?" fragen. Ohne eigene Fragestellung sucht das Modell nach irgendeinem Muster — meistens findet es eines, unabhängig davon, ob es bedeutet.
Drei Arten von Werkzeugen, drei unterschiedliche Grenzen
- Chat mit Code-Ausführung — etwa ChatGPT mit Advanced Data Analysis: Am flexibelsten, weil es jede Frage in eigenen Code übersetzt. Genau deshalb musst du diesen Code auch lesen können, bevor du dem Ergebnis vertraust — er zeigt, welche Annahme das Modell getroffen hat, nicht nur die fertige Zahl.
- KI-Zusätze in BI-Werkzeugen — etwa Copilot in Power BI: Arbeitet auf bereits sauber modellierten Daten und liefert dort verlässlichere Ergebnisse. Bei unaufgeräumten Rohdaten, doppelten Zeilen oder uneinheitlichen Spaltennamen versagt genau diese Verlässlichkeit zuerst.
- Eng gebaute Analyse-Assistenten für eine einzelne Aufgabe: Weniger flexibel, dafür in ihrem schmalen Bereich — etwa Kündigungsquoten oder Kampagnenkennzahlen — seltener falsch, weil das Werkzeug keine fremden Fragen beantworten muss.
Für eine Zahl, die später in einen Geschäftsbericht oder eine behördliche Meldung geht, reicht keines der drei Werkzeuge allein. Dafür brauchst du weiterhin eine Methode, die jemand mit Fachkenntnis nachvollziehen und im Zweifel vor einer Prüfung verteidigen kann — KI-Datenanalyse ersetzt diesen Schritt nicht, sie beschleunigt höchstens den Weg dorthin.
Ein Ablauf, der zu einem belastbaren Ergebnis führt
- Formuliere die Frage, bevor die Datei hochgeht: „Welche drei Kundengruppen kündigen am häufigsten?" statt „Analysiere diese Daten."
- Beschreibe die Datenstruktur kurz mit — welche Spalte was bedeutet, wo Lücken oder Dubletten zu erwarten sind. Das Modell füllt Unklarheiten sonst mit einer Annahme, die es nicht offenlegt.
- Lass dir die Methode zeigen, nicht nur das Ergebnis: welche Filter, welche Gruppierung, welche Formel. Ohne diesen Schritt prüfst du eine Zahl, ohne zu wissen, wie sie zustande kam.
- Rechne eine einzelne Zahl von Hand nach, an einer Stelle, die du selbst überblickst. Stimmt sie, ist die Methode wahrscheinlich richtig angewendet. Stimmt sie nicht, ist jede andere Zahl im Ergebnis genauso fraglich.
Ein Beispiel von Anfang bis Ende
Schwacher Prompt: „Hier sind unsere Kundendaten, analysiere sie." Ergebnis: eine Liste austauschbarer Beobachtungen — irgendetwas über Alter, irgendetwas über Region — ohne erkennbaren Bezug zu einer echten Entscheidung.
Vollständiger Prompt: „Spalte ‚Status‘ zeigt aktiv oder gekündigt, Spalte ‚Vertragsmonate‘ die Laufzeit. Welche drei Wertebereiche bei Vertragsmonaten haben den höchsten Anteil an Kündigungen? Zeig mir die Berechnung, nicht nur das Ergebnis." Das Ergebnis ist jetzt eine konkrete Methode — eine Gruppierung nach Laufzeit-Intervallen mit dem jeweiligen Kündigungsanteil —, die du gegen eine Stichprobe der Rohdaten selbst nachrechnen kannst.
Genau dieser letzte Schritt entscheidet, ob das Ergebnis brauchbar ist. Stimmt die nachgerechnete Zahl, kannst du der Methode auch für die restlichen Wertebereiche vertrauen. Weicht sie ab, liegt der Fehler fast immer in einer stillen Annahme — etwa dass eine leere Zelle als null statt als fehlender Wert gezählt wurde.
Eine zweite Runde lohnt sich meistens: „Zeig mir zusätzlich, wie viele Verträge in jedem Wertebereich überhaupt stecken." Ohne diese Rückfrage bleibt unsichtbar, ob ein auffälliger Kündigungsanteil auf zwanzig Verträgen beruht oder auf zwei — und genau dieser Unterschied entscheidet, ob die Zahl eine Entscheidung tragen sollte.
Ein KI-Ergebnis mit sauberer Tabelle und klarer Grafik ist noch keine richtige Analyse. Richtig ist sie erst, wenn du die Methode dahinter nachvollziehen und mindestens eine Zahl selbst bestätigen kannst.
Wo die Grenzen liegen
Drei Fehler kommen bei KI-gestützter Datenanalyse besonders häufig vor. Erstens Korrelation statt Ursache: Das Modell nennt zwei Werte, die sich gemeinsam bewegen, als wäre der eine die Ursache des anderen — das lässt sich aus reinen Zahlen allein selten belegen. Zweitens eine Zahl, die plausibel klingt, aber auf einer stillen Annahme über fehlende oder widersprüchliche Werte beruht, die im Datensatz gar nicht so eindeutig war. Drittens eine zu kleine Stichprobe: Zehn Datenpunkte in drei Gruppen aufteilen und daraus einen Trend ableiten, klingt in einer flüssig formulierten Antwort genauso überzeugend wie ein Ergebnis aus tausend Datenpunkten — obwohl der Unterschied für die Belastbarkeit der Aussage entscheidend ist.
Keiner dieser drei Fehler zeigt sich in der Formatierung des Ergebnisses. Eine Tabelle mit sauberen Spalten und eine Grafik mit klarer Legende sehen unabhängig davon fertig aus, ob die Methode dahinter trägt — das ist genau der Punkt, an dem der Nachrechenschritt aus dem Ablauf oben den Unterschied macht.
Wie verbreitet der Einsatz solcher Werkzeuge im Arbeitsalltag inzwischen ist, zeigt der Bitkom in seinen regelmäßigen Erhebungen zum KI-Einsatz in deutschen Unternehmen. Welche Auswertungsaufgaben sich davon technisch grundsätzlich automatisieren lassen und welche weiterhin eine Prüfung durch eine Person brauchen, untersucht laufend das IAB.
Wie schnell sich die zugrundeliegenden Modelle weiterentwickeln, verfolgt der Stanford AI Index systematisch Jahr für Jahr — der Abstand zwischen einer überzeugend klingenden und einer tatsächlich richtigen Ausgabe schließt sich, aber langsamer, als es sich beim ersten Ausprobieren eines neuen Werkzeugs anfühlt. Genau diese Prüfroutine ist Teil dessen, wofür der Arbeitsmarkt laut PwC AI Jobs Barometer einen deutlichen Gehaltsaufschlag zahlt — nicht das Ausführen der Analyse an sich, sondern die Fähigkeit zu erkennen, welche Stelle darin noch von Hand geprüft werden muss. Wie sich das insgesamt auf Stellen in Deutschland auswirkt, lässt sich an der Erwerbstätigenstatistik ablesen, nicht an einzelnen Werkzeugankündigungen.
Was du am Montag ausprobierst
- Nimm einen Datensatz, den du bereits kennst — nicht eine Testdatei, sondern echte Zahlen aus deiner Arbeit.
- Formuliere die Frage schriftlich, bevor du die Datei hochlädst.
- Lass dir die Methode zeigen, nicht nur das Ergebnis, und lies sie einmal ganz durch.
- Rechne eine einzelne Zahl an einer Stelle nach, die du selbst überblickst, bevor du das Ergebnis weitergibst.
Steckt die Datenquelle in einer klassischen Tabelle statt in einer Rohdatei, zeigt Excel auswerten lassen denselben Ablauf mit den Eigenheiten von Zellen und Formeln. Einen Überblick, welches Excel-eigene oder externe Werkzeug für welchen Schritt taugt, gibt Tools für Excel. Soll aus der Analyse am Ende eine Folie werden, zeigt Gute PowerPoint-Präsentation, wie sich eine geprüfte Zahl in eine Aussage verwandelt, ohne dass die Methode dahinter verlorengeht. Läuft dieselbe Auswertung jeden Monat erneut, spart Workflow-Automatisierung die Arbeit, den Ablauf jedes Mal neu aufzusetzen. Der Prüfschritt selbst — eine Zahl gegen die Quelle nachrechnen, bevor sie weitergeht — ist derselbe wie bei jeder anderen Büroaufgabe mit KI, ausführlicher beschrieben in KI im Büro.
Genau diese Fähigkeit — eine Methode nachzuvollziehen, statt einem fertigen Ergebnis einfach zu vertrauen — vermittelt Coursium in kurzen Lektionen fürs Handy. Bleib der KI voraus mit Übungen an echten Aufgaben statt an Demo-Daten. Mehr zu diesem Ansatz steht über Coursium.