Blog · 28. September 2026 · 7 Min. Lesezeit

KI-Lösungen: erst die Aufgabe, dann das Werkzeug

KI-Lösungen im Vergleich beginnen mit der Aufgabe, nicht dem Werkzeug. Ein Ablauf, um zwei Kandidaten an echten Beispielen zu testen und das Ergebnis zu prüfen.

Aufgabe zuerst. Zwei testen. Ergebnis prüfen.

„KI-Lösungen" klingt nach einer Liste von Produkten, aus der eines ausgewählt wird. In der Praxis läuft der nützliche Teil der Entscheidung andersherum: erst eine konkrete, wiederkehrende Aufgabe benennen, dann prüfen, welches Werkzeug an genau dieser Aufgabe ein brauchbares Ergebnis liefert. Wer stattdessen mit einer Liste von Anbietern startet, landet meist bei dem Werkzeug mit der überzeugendsten Produktseite — nicht bei dem, das die eigene Aufgabe tatsächlich löst.

Der Unterschied fällt erst auf, wenn zwei Kandidaten an derselben echten Aufgabe getestet werden, statt jeden für sich an einer Demo zu beurteilen. Ein Werkzeug, das in einer Produktvorführung beeindruckt, kann an einer alltäglichen Aufgabe trotzdem schlechter abschneiden als ein unauffälligeres — und umgekehrt.

Woran eine brauchbare KI-Lösung sich erkennen lässt

  • Sie löst eine benannte, wiederkehrende Aufgabe — nicht „bessere Produktivität" allgemein, sondern etwa „Antwortentwürfe auf Lieferanfragen" oder „Erstfassungen für Angebote".
  • Ihr Ergebnis lässt sich in wenigen Minuten gegen eine bekannte Quelle prüfen — eine Tabelle, ein Vertrag, ein bestehendes Dokument — statt nur „plausibel zu klingen".
  • Sie passt zur Menge an Daten, die tatsächlich anfällt. Ein Werkzeug für einzelne Anfragen unterscheidet sich von einem, das hundert Anfragen am Tag verarbeiten soll.
  • Ihr Preis skaliert mit der tatsächlichen Nutzung im Team, nicht mit einer Schätzung, die vor dem ersten Test gemacht wurde.

Keiner dieser vier Punkte lässt sich von einer Produktseite ablesen. Alle vier zeigen sich erst, wenn ein Werkzeug an einer echten Aufgabe aus dem eigenen Arbeitsalltag ausprobiert wird — mit den eigenen, nicht mit den Beispieldaten des Anbieters.

Ein Ablauf, um eine Lösung tatsächlich zu finden

  1. Schreib die Aufgabe so konkret auf, dass eine zweite Person sie ohne Rückfrage verstehen würde — nicht „Kundenservice verbessern", sondern „Antwortentwürfe auf die zehn häufigsten Fragen zu Lieferzeiten vorformulieren".
  2. Wähl zwei, höchstens drei Kandidaten, die für genau diese Aufgabe gebaut oder zumindest dafür geeignet sind — nicht die zwei bekanntesten Namen am Markt.
  3. Gib jedem Kandidaten dieselben drei echten Beispiele aus dem eigenen Alltag, nicht die Beispieldaten aus der jeweiligen Produkttour.
  4. Prüf jedes Ergebnis gegen eine bekannte, korrekte Antwort, bevor du die Ausgaben der Kandidaten überhaupt miteinander vergleichst. Ein Ergebnis, das falsch ist, gewinnt den Vergleich nicht dadurch, dass es besser klingt als das andere falsche Ergebnis.
  5. Entscheide nach der Aufgabe, nicht nach der Funktionsliste. Ein Werkzeug mit zwanzig Funktionen, von denen eine einzige gebraucht wird, ist selten die richtige Wahl gegenüber einem mit drei Funktionen, die alle passen.

Ein Beispiel von Anfang bis Ende

Schwacher Start: „Wir brauchen eine KI-Lösung für den Kundenservice." Ergebnis: eine Liste von fünf bekannten Anbietern, ein Vergleich von Preisstaffeln und Funktionslisten, und am Ende eine Entscheidung, die auf der überzeugendsten Verkaufspräsentation beruht statt auf einem tatsächlichen Test.

Vollständiger Ablauf: Die konkrete Aufgabe lautet „Antwortentwürfe auf die zehn häufigsten Anfragen zu Lieferzeiten, die ein Mitarbeiter in unter einer Minute prüfen und verschicken kann". Zwei Kandidaten bekommen dieselben drei echten Anfragen aus der letzten Woche, samt der tatsächlichen Antwort aus dem Versandsystem als Vergleichswert. Ein Kandidat liefert Entwürfe, die bei zwei von drei Anfragen die richtige Lieferzeit nennen; der andere bei allen drei, braucht dafür aber eine zusätzliche Eingabe der Bestellnummer. Erst mit diesem Ergebnis vor Augen — nicht vorher — lässt sich abwägen, ob der zusätzliche Schritt den Unterschied in der Genauigkeit wert ist.

Wo die Werkzeuggrenzen liegen

Der häufigste Fehler bei der Suche nach einer KI-Lösung ist nicht die falsche Wahl, sondern die fehlende Prüfung danach. Ein Werkzeug, das im Test drei von drei Beispielen richtig löst, liefert bei der vierten, etwas anderen Anfrage trotzdem manchmal ein falsches Ergebnis — Modelle verallgemeinern aus Mustern, nicht aus Regeln, und ein neuer Fall kann außerhalb des getesteten Musters liegen. Deshalb bleibt der Prüfschritt aus dem Test auch nach der Einführung bestehen, nicht nur während der Auswahl.

Wie verbreitet der Einsatz solcher Werkzeuge im Arbeitsalltag deutscher Unternehmen bereits ist, zeigt der Bitkom in seinen Erhebungen zum KI-Einsatz. Welche Aufgaben sich davon technisch grundsätzlich zuverlässig automatisieren lassen und welche weiterhin eine Prüfung durch eine Person brauchen, untersucht laufend das IAB.

Die OECD-Leitlinien zu KI nennen die menschliche Prüfung als festen Bestandteil eines verantwortungsvollen Einsatzes, nicht als optionalen letzten Schritt bei der Auswahl — genau der Prüfschritt, der im Vergleichstest zwischen zwei Kandidaten bereits eingebaut sein sollte. Wie schnell sich die zugrundeliegenden Modelle weiterentwickeln, verfolgt der Stanford AI Index Jahr für Jahr — ein Grund, eine Entscheidung eher an einem eigenen Test als an einem Anbietervergleich von vor sechs Monaten festzumachen.

Genau diese Prüffähigkeit ist Teil dessen, wofür der Arbeitsmarkt laut PwC AI Jobs Barometer einen deutlichen Gehaltsaufschlag zahlt — nicht das Aussuchen eines Werkzeugs an sich, sondern die Fähigkeit, sein Ergebnis an der eigenen Aufgabe zu beurteilen statt an der Produktseite.

Was du am Montag ausprobierst

  1. Schreib eine einzelne wiederkehrende Aufgabe so konkret auf, dass eine Kollegin sie ohne Rückfrage versteht.
  2. Wähl zwei Kandidaten, statt eine ganze Liste von Anbietern zu vergleichen.
  3. Gib beiden dieselben drei echten Beispiele aus dieser Woche, mit einer bekannten richtigen Antwort zum Vergleich.
  4. Entscheide nach dem Testergebnis, nicht nach der Funktionsliste oder der Demo.

Soll der Test nicht bei einem einzelnen Vergleich bleiben, sondern zu einem echten Pilotprojekt im Team werden, zeigt KI für Unternehmen den Ablauf danach, inklusive einer Regel gegen unkontrollierte Schatten-KI. Geht es speziell um die laufenden Kosten mehrerer Abos statt um die erste Auswahl, hilft KI-Abo-Kosten im Vergleich. Soll aus der gefundenen Lösung ein fester, wiederholbarer Baustein werden, zeigt Custom GPT erstellen, wie sich der Kontext einmal statt jedes Mal neu festlegen lässt — und sobald mehrere Arbeitsschritte zusammenhängen, Workflow-Automatisierung denselben Ablauf für eine ganze Kette von Schritten.

Der Prüfschritt selbst — ein Ergebnis gegen eine bekannte Quelle nachrechnen, bevor es verwendet wird — gilt für jede einzelne Büroaufgabe mit KI, nicht nur für die Auswahl eines Werkzeugs, ausführlicher beschrieben in KI im Büro. Wer diese Auswahl und Prüfung im Unternehmen koordiniert, trägt in vielen Betrieben inzwischen den Titel KI-Manager.

Genau diese Fähigkeit — ein Ergebnis an der eigenen Aufgabe zu prüfen, statt es an einer Produktseite zu beurteilen — vermittelt Coursium in kurzen Lektionen fürs Handy. Bleib der KI voraus mit Übungen an echten Aufgaben statt an Demo-Beispielen. Mehr zu diesem Ansatz steht über Coursium.

Coursium

Bleib der KI voraus — lern die Tools auf dem Handy.

App holen