Zum Inhalt springen
hilfmirmal...
Angebot Erstgespräch

KI-Manager:in · Präsentation · Teil 4

Daten, Datenanalyse und RAG

Folien zum KI-Manager-Lernpfad: fünf Merkmale guter Daten, Datenarten, Data Owner, KI-Zahlen nachrechnen, RAG und Deep Research.

Ein Kurs von Erik Lorenscheit, Gründer von hilfmirmal · Zuletzt aktualisiert am

Teil 4 · Daten, Datenanalyse und RAG

Die KI rechnet nur mit dem, was du reingibst

Ein Sprachmodell weiß nichts, es rechnet. In diesem Teil geht es um das, womit es rechnet: Daten. Stimmen sie nicht, macht die KI daraus trotzdem eine selbstbewusste Empfehlung.

Dein Weg durch diesen Teil
  1. Daten verstehen
  2. Mit KI rechnen und prüfen
  3. RAG und Deep Research

hilfmirmal.de · KI-Manager:in

Erklärung zur Folie

In Teil 3 hast du gesehen, wie ein Sprachmodell arbeitet. Es zerlegt Text in Token und berechnet, was wahrscheinlich als Nächstes kommt. Es weiß nichts, es rechnet. Jetzt geht es um das, womit es rechnet: Daten.

Ein kleines Beispiel zeigt das Problem. Eine Tabelle mit vier Zeilen: Filiale „Süd“, Filiale „nord“, Filiale „Nord“ mit 100 Bremsreparaturen für zusammen 135 Euro und Filiale „Sued“. Die KI macht daraus: „Die Filiale Nord wächst stark, vor allem bei Bremsreparaturen. Empfehlung: zweite Werkstatt eröffnen.“ Klingt überzeugend. Ist Unsinn.

Du gehst in drei Schritten vor. Zuerst lernst du, woran du gute Daten erkennst und wo sie im Unternehmen liegen. Dann lässt du eine KI rechnen und prüfst, was dabei herauskommt. Zum Schluss geht es darum, wie eine KI im Firmenwissen nachschlägt: RAG und Deep Research.

Zum Ausprobieren: Lass die KI eine Tabelle beschreiben

  1. Nimm eine kleine Tabelle mit erfundenen Daten, etwa Verkäufe eines Ladens über einen Monat.
  2. Lade sie in Copilot oder ChatGPT hoch.
  3. Prompt: „Beschreibe diese Tabelle in fünf Sätzen.“ Genau so, nichts ergänzen.
  4. Öffne die Datei selbst und prüf jeden Satz: Zeilen, Zeitraum, Filialen.

Merk dir

Nur erfundene Daten. Echte Kundendaten gehören nicht in ein privates KI-Konto.

Erklärung zur Folie

Im Präsenzkurs gab es dafür eine erfundene Datei: Verkaufsdaten eines Fahrradladens mit drei Filialen, Nord, Süd und Mitte, September 2026, 59 Zeilen. Jede Zeile ist eine Bestellung mit Bestell-ID, Datum, Filiale, Produkt, Menge, Einzelpreis, Umsatz und dem Kürzel der Person, die verkauft hat. Bau dir eine ähnliche Tabelle in Excel oder Google Tabellen und bau ruhig ein paar Fehler ein: eine Filiale einmal kleingeschrieben, einmal „Sued“ statt „Süd“, eine Zeile doppelt.

Dann lädst du sie hoch und lässt sie in fünf Sätzen beschreiben. Typisch ist: Die KI nennt Zeilenzahl, Zeitraum und „drei Filialen“ und übersieht die abweichenden Schreibweisen. Oder sie zählt fünf Filialen und merkt nicht, dass zwei davon Tippfehler sind.

Merk dir, wie sicher die Antwort klingt, auch wenn die KI die Tabelle nur überflogen hat. Was in so einer Datei alles faul sein kann, lernst du auf den nächsten Folien.

Garbage in, garbage out

Schlechte Daten rein, schlechte Ergebnisse raus. Auch mit der besten KI.

Früher gab ein falscher Wert eine falsche Zahl, die auffiel. Heute baut die KI daraus einen flüssigen Absatz, der richtig klingt.

Erklärung zur Folie

Garbage in, garbage out heißt: Müll rein, Müll raus. Der Satz ist älter als jede KI, er stammt aus der frühen Informatik.

Links geht eine fehlerhafte Tabelle rein: „nord“, „Sued“, 100 Bremsreparaturen, ein Schlauch für minus 24,50 Euro. In der Mitte rechnet die KI und schreibt flüssig. Sie prüft aber nicht, ob die Daten stimmen. Raus kommen ein schönes Diagramm und eine klare Empfehlung, und trotzdem ist beides falsch.

Deshalb fragst du bei jedem KI-Projekt zuerst: Welche Daten gehen rein? Wer hat sie gepflegt? Wie alt sind sie? Denk kurz an deinen eigenen Beruf: Wo hast du schon mit Daten gearbeitet, denen du nicht getraut hast?

Woran du gute Daten erkennst

Merkmal Prüffrage Beispiel für einen Fehler
Vollständig Sind alle Pflichtfelder gefüllt? Bestellung ohne Menge
Korrekt Stimmt der Wert mit der Wirklichkeit? Schlauch für minus 24,50 Euro
Einheitlich Gleiche Schreibweise, gleiches Format? „Süd“ und „Sued“
Aktuell Ist der Stand bekannt und passend? Kundenliste von 2019
Eindeutig Steht jeder Datensatz nur einmal drin? Bestellung B1052 doppelt

Merk dir

Diese fünf Fragen sind dein Prüfraster für jede Spalte.

Erklärung zur Folie

Datenqualität klingt abstrakt. Sie lässt sich aber mit fünf Fragen prüfen.

Vollständig: Sind alle Pflichtfelder gefüllt? Eine Bestellung ohne Menge ist wertlos. Korrekt: Stimmt der Wert? Ein Schlauch für minus 24,50 Euro ist kein Schnäppchen, sondern ein Fehler. Einheitlich: Heißt die Filiale überall gleich? Für dich sind „Süd“ und „Sued“ dasselbe. Für eine Auswertung sind das zwei verschiedene Filialen.

Aktuell: Weißt du, von wann die Daten sind? Eine Kundenliste von 2019 bringt dir 2026 wenig. Eindeutig: Steht ein Datensatz nur einmal drin? Eine doppelte Bestellung verdoppelt deinen Umsatz, auf dem Papier. Eine solche doppelte Zeile heißt Dublette.

Fehlerjagd: fünf Fehler, fünf Merkmale

ID Datum Art Anzahl Koordinate
K01 2026-05-04 Rotmilan 2 52.41, 13.12
K02 2026-05-04 Feldlerche 5 52.40, 13.10
K03 2026-05-11 Rot-Milan 1 52.42, 13.14
K04 2026-05-11 Kiebitz -2 52.39, 13.11
K05 2026-05-18 Feldlerche 3 (leer)
K06 2019-05-18 Neuntöter 1 52.41, 13.13
K07 2026-05-25 Feldlerche 4 52.40, 13.12
K07 2026-05-25 Feldlerche 4 52.40, 13.12

Erfundene Brutvogelkartierung, Fläche Nord. Für jedes Merkmal steckt genau ein Fehler drin.

Erklärung zur Folie

Rate zuerst selbst: Welche Zeile, welches Merkmal? Nimm dir fünf Minuten, bevor du weiterliest.

Die Lösung: K03 schreibt „Rot-Milan“ mit Bindestrich. Für eine Auswertung ist das eine eigene Art, also fehlt es an Einheitlichkeit. K04 meldet minus zwei Kiebitze. Negative Vögel gibt es nicht, der Wert ist nicht korrekt. Bei K05 fehlt die Koordinate, die Beobachtung ist auf keiner Karte zu finden: nicht vollständig.

K06 trägt das Jahr 2019 in einer Kartierung von 2026: nicht aktuell. Und K07 steht zweimal da: nicht eindeutig. Genau diese fünf Fehlerarten findest du in fast jeder echten Tabelle wieder, meist öfter.

Strukturiert oder unstrukturiert?

Strukturiert: feste Spalten

  • Jede Spalte hat eine feste Bedeutung: Datum, Filiale, Menge.
  • Tabellen, Datenbanken, CSV, Attributtabellen.

Unstrukturiert: freier Text, Bild, Ton

  • „Hallo, mein Rad war schon wieder nicht fertig, obwohl mir Freitag zugesagt wurde …“
  • E-Mails, PDFs, Protokolle, Luftbilder, Sprachnachrichten.

Merk dir

Neu: Sprachmodelle arbeiten gut mit unstrukturierten Daten.

Erklärung zur Folie

Daten gibt es in zwei Grundformen. Strukturierte Daten stehen in Tabellen, jede Spalte hat eine feste Bedeutung. Damit rechnet Excel seit Jahrzehnten.

Unstrukturierte Daten haben keine feste Form: E-Mails, Verträge als PDF, Gesprächsnotizen, Fotos, Sprachnachrichten. Ein großer Teil des Wissens in einem Unternehmen steckt hier. Dazwischen liegen halbstrukturierte Daten. Eine E-Mail hat feste Felder wie Absender und Datum, aber einen freien Text.

Das Neue an Sprachmodellen: Sie arbeiten gut mit unstrukturierten Daten. Sie fassen Beschwerde-Mails zusammen oder ziehen aus einem Vertrag die Kündigungsfrist. Das war früher teure Handarbeit. Bei Geodaten hast du übrigens oft beides: eine Attributtabelle zu jeder Fläche und dazu das Luftbild.

Welche Datenform ist das?

Datenquelle Lösung Warum
Attributtabelle eines Shapefiles strukturiert feste Spalten pro Fläche
Luftbild einer Baufläche unstrukturiert Pixel ohne feste Bedeutung, KI kann Klassen daraus machen
Gutachten als PDF unstrukturiert freier Text, Tabellen darin sind Beiwerk
Excel-Liste der kartierten Arten strukturiert solange alle dieselben Spalten nutzen
E-Mail einer Behörde halbstrukturiert Absender und Datum fest, Text frei
Sprachmemo aus dem Gelände unstrukturiert Ton: erst Transkript, dann Auswertung
Erklärung zur Folie

Deck die Spalten „Lösung“ und „Warum“ ab und rate zuerst selbst. Sechs Datenquellen aus Planung und Geodaten, und bei jeder fragst du: strukturiert, unstrukturiert oder halbstrukturiert?

Die Attributtabelle eines Shapefiles hat feste Spalten pro Fläche, sie ist strukturiert. Das Luftbild besteht aus Pixeln ohne feste Bedeutung. Eine KI kann daraus Klassen machen, etwa Wald, Wasser, Acker, aber das Bild selbst ist unstrukturiert. Das Gutachten als PDF ist freier Text.

Die Excel-Liste der kartierten Arten ist strukturiert, solange alle dieselben Spalten nutzen. Die E-Mail der Behörde ist halbstrukturiert. Und das Sprachmemo aus dem Gelände ist Ton: erst ein Transkript, dann die Auswertung.

Fünf Datenarten, die du kennen musst

Datenart Was sie ausmacht Beispiele
Stammdaten ändern sich selten Kunde, Produkt, Preis
Bewegungsdaten entstehen ständig Bestellung, Buchung, Ticket
Personenbezogene Daten alles zu einer Person Name, Mail, auch ein Kürzel
Metadaten Daten über Daten wer, wann, welche Version, welches Koordinatensystem
Wissen Texte, die Abläufe erklären Handbücher, Richtlinien, Protokolle

In einer Verkaufstabelle: Produkt und Einzelpreis sind Stammdaten, Datum, Bestellnummer und Menge Bewegung, das Kürzel der verkaufenden Person ein Personenbezug.

Erklärung zur Folie

Fünf Datenarten begegnen dir in jedem Unternehmen. Stammdaten ändern sich selten: der Kunde, das Produkt, der Preis. Bewegungsdaten entstehen ständig: jede Bestellung, jede Buchung, jedes Support-Ticket.

Personenbezogene Daten sind alles, womit sich ein Mensch identifizieren lässt. Name, E-Mail, auch ein Kürzel, wenn man weiß, wer dahintersteht. Wie die DSGVO damit umgeht, zeigt Teil 6. Metadaten beschreiben andere Daten: Wer hat die Datei erstellt, wann, in welcher Version? Bei Geodaten gehört das Koordinatensystem dazu. Ohne das ist eine Koordinate wertlos.

Und dann das Wissen: Handbücher, Richtlinien, Protokolle. Das ist das Futter für RAG, dazu kommst du weiter hinten in diesem Teil.

Wo die Daten im Unternehmen liegen

  • ERP: Warenwirtschaft, Bestellungen.
  • CRM: Vertrieb, Kundenkontakte.
  • Buchhaltung und Personal: Rechnungen, Belege, Verträge, Zeiten.
  • SharePoint, Laufwerke, Postfächer: das große unstrukturierte Feld.
  • Fachsysteme: zum Beispiel ein GIS mit Geodaten.
  • Excel-Listen auf einzelnen Rechnern: Umsatz_final_v3.xlsx, Kosten_neu_NICHT_LÖSCHEN.xlsx.

Achtung

Excel-Listen sind oft am wichtigsten und oft nur von einer Person verstanden.

Erklärung zur Folie

Stell dir ein typisches Unternehmen als Grundriss vor. Die Daten liegen im ERP, also der Warenwirtschaft. Im CRM beim Vertrieb. In der Buchhaltung und im Personalsystem. Dann das große unstrukturierte Feld: SharePoint, Netzlaufwerke, Postfächer. Und Fachsysteme, etwa ein GIS mit Geodaten oder eine Kartierungsdatenbank.

Dazwischen, oft am wichtigsten: Excel-Listen auf einzelnen Rechnern. „Umsatz final, Version drei.“ Die Artenliste einer Kollegin. Und die Datei, die niemand löschen darf, aber auch niemand erklären kann. Ist die zuständige Person im Urlaub, weiß keiner, welche Spalte was bedeutet.

Für KI heißt das: Bevor du ein Werkzeug einführst, schreibst du auf, wo die nötigen Daten liegen und in welchem Zustand. Das ist unspektakulär. Es entscheidet aber, ob das Projekt klappt.

Jeder Datenbestand braucht eine zuständige Person

Fachwort: Data Owner. Die Person oder Abteilung, die für einen Datenbestand geradesteht.

  1. Wer pflegt die Daten?
  2. Wer darf sie ändern?
  3. Wer gibt sie für die KI frei?
  4. Wer löscht sie, wenn die Frist abläuft?

Merk dir

Keine Antwort? Dann hast du die erste Aufgabe für dein KI-Projekt gefunden.

Erklärung zur Folie

Die häufigste Antwort auf die Frage „Wer ist für diese Daten zuständig?“ lautet: „Weiß ich nicht.“ Fachlich spricht man vom Data Owner. Das ist die Person oder Abteilung, die für einen Datenbestand geradesteht.

Vier Fragen klärst du für jeden Datenbestand, bevor er in eine KI geht: Wer pflegt ihn? Wer darf ihn ändern? Wer gibt ihn für die KI frei? Und wer löscht ihn, wenn er nicht mehr gebraucht wird?

Kannst du eine dieser Fragen nicht beantworten, ist das kein Rückschlag. Du hast damit die erste Aufgabe für dein KI-Projekt gefunden.

Aufbewahren und löschen

Was Wie lange Grundlage
Bücher, Jahresabschlüsse 10 Jahre § 257 HGB, § 147 AO
Buchungsbelege, Rechnungen 8 Jahre, seit 2025 § 257 HGB, § 147 AO
Handels- und Geschäftsbriefe 6 Jahre § 257 HGB, § 147 AO
Personenbezogene Daten so kurz wie nötig Art. 5 Abs. 1 lit. e DSGVO, Recht auf Löschung: Art. 17

Prüffrage: Kannst du Daten im KI-System auch wieder löschen? Einordnung, keine Rechtsberatung.

Erklärung zur Folie

Daten haben ein Verfallsdatum, und zwar in beide Richtungen. Manche musst du aufbewahren. Das regeln Paragraf 257 im Handelsgesetzbuch und Paragraf 147 AO im Steuerrecht. Bücher und Jahresabschlüsse zehn Jahre. Buchungsbelege wie Rechnungen seit 2025 nur noch acht Jahre, vorher waren es zehn; verkürzt hat das das Bürokratieentlastungsgesetz IV. Handels- und Geschäftsbriefe sechs Jahre.

Andere Daten musst du löschen. Die DSGVO sagt in Artikel 5, dass personenbezogene Daten nur so lange gespeichert werden, wie es für den Zweck nötig ist. Artikel 17 gibt Menschen ein Recht auf Löschung.

Für KI ist das wichtig: Wenn du Daten in ein KI-System lädst, musst du wissen, ob du sie dort auch wieder löschen kannst. Im echten Projekt klärst du das mit Datenschutz und Steuerberatung. Einordnung, keine Rechtsberatung.

Drei Fragen vor jedem KI-Projekt

  1. Welche Daten brauchen wir? Genau benennen, nicht „alle“.
  2. In welchem Zustand sind sie? Die fünf Merkmale prüfen.
  3. Wer ist zuständig und gibt frei? Der Data Owner.

Achtung

Ein häufiger Grund für gescheiterte Piloten: nicht das Modell, sondern die Datenlage.

Erklärung zur Folie

Wenn du aus der ersten Hälfte dieses Teils nur eine Sache mitnimmst, dann diese drei Fragen. Welche Daten brauchen wir? In welchem Zustand sind sie? Und wer ist zuständig und gibt frei?

Das klingt nach Verwaltung. Es ist aber ein häufiger Grund, warum KI-Pilotprojekte stecken bleiben. Nicht das Modell scheitert, sondern die Datenlage.

Ab der nächsten Folie lässt du die KI rechnen. Behalt die drei Fragen dabei im Kopf.

Was KI mit Tabellen gut kann

Aufgabe Was du bekommst
Überblick Spalten, Zeilen, Zeitraum
Rechnen Summen, Durchschnitte, Rangfolgen
Diagramme auf Zuruf
Auffälligkeiten Ausreißer finden
Formeln Excel-Formeln erklären und bauen

ChatGPT: CSV oder Excel hochladen, in normaler Sprache fragen. Copilot: auch direkt in Excel, je nach Lizenz und Freigabe.

Merk dir

Erste Antwort. Nicht letzte.

Erklärung zur Folie

ChatGPT und Copilot können Tabellen lesen. Du lädst eine CSV- oder Excel-Datei hoch und stellst Fragen in normaler Sprache. Welche Filiale hat den meisten Umsatz? Zeig mir den Verlauf pro Woche als Diagramm. Welche Werte fallen aus der Reihe? Erklär mir diese Excel-Formel.

Das ist ein echter Gewinn. Du musst keine Pivot-Tabelle bauen können, um eine erste Antwort zu bekommen.

Aber es ist eine erste Antwort, keine letzte. Wie du sie prüfst, zeigen die nächsten Folien.

Wie die KI eigentlich rechnet

Nur gelesen: Zahl ist geschätzt

„Der Gesamtumsatz beträgt etwa 3.700 €.“

Das Modell sagt Token voraus. Eine Summe, die gut aussieht, ist noch keine Rechnung.

Mit Code-Ausführung: Zahl ist gerechnet

df = pd.read_csv("beispieldaten-verkauf.csv")
df["Umsatz_EUR"].sum()
# Ergebnis: 3686.59

Erkennbar am aufklappbaren Code. Ohne Code: Zahl nicht übernehmen.

Achtung

Auch gerechnet heißt nicht richtig. Der Code rechnet mit „nord“, „Sued“ und der Dublette.

Erklärung zur Folie

Bevor du einer KI-Summe glaubst, musst du eine Sache verstehen. Ein Sprachmodell rechnet nicht im Kopf. Es sagt Token voraus, das kennst du aus Teil 3. Wenn es eine Tabelle nur liest und dann eine Summe nennt, ist das eine geschätzte Zahl, die gut aussieht.

Viele Werkzeuge haben deshalb eine Code-Ausführung. ChatGPT schreibt dann ein kleines Python-Programm, führt es aus und gibt dir das Ergebnis. Diese Zahl ist gerechnet. Du erkennst das daran, dass du den Code aufklappen kannst. Siehst du keinen Code und keinen Hinweis auf eine Analyse, übernimmst du die Zahl nicht ungeprüft.

Und auch gerechnet heißt nicht richtig. Der Code rechnet mit den Daten, die drinstehen, mit „nord“, „Sued“ und der doppelten Bestellung. Garbage in, garbage out.

Zum Ausprobieren: Umsatz pro Filiale

Filiale laut KI Umsatz in Euro
Süd 1.422,70
Nord 1.333,90
Mitte 906,29
Sued 15,80
nord 7,90

Der Laden hat drei Filialen. Im Diagramm der KI stehen fünf.

Merk dir

Nachrechnen: Spalte in Excel markieren, Summe unten ablesen. Hier 3.686,59 €.

Erklärung zur Folie

So kann es aussehen, wenn du die Verkaufstabelle aus dem Beispiel in ChatGPT lädst. Über das Plus-Symbol im Eingabefeld fügst du die Datei hinzu. Erster Prompt: „Wie hoch ist der Umsatz pro Filiale? Gib eine Tabelle aus.“ Zweiter Prompt: „Erstelle dazu ein Balkendiagramm.“ Die Zahlen oben sind die echten Summen der Rohdaten aus der Beispieldatei.

Das Diagramm sieht professionell aus, und genau das ist das Problem. Der Laden hat drei Filialen, im Diagramm sind es fünf. „Sued“ und „nord“ sind für die KI eigene Filialen. Frag deshalb nach: „Hast du Werte verändert oder zusammengefasst? Liste jede Änderung auf.“ Manche Werkzeuge bereinigen still und sagen es nicht.

Dann kommt der wichtigste Schritt: Du rechnest selbst nach. Datei in Excel öffnen, Spalte mit dem Umsatz markieren, unten in der Statusleiste steht die Summe. In der Beispieldatei sind es 3.686,59 Euro. Stimmt das mit der KI überein?

Ein Diagramm ist kein Beweis

Achse beginnt bei 0

  • Süd und Nord aus der Beispieldatei.
  • Süd liegt knapp vorn.

Achse beginnt bei 1.300

  • Dieselben Zahlen.
  • Süd scheint Nord zu überrollen.

Merk dir

Frag bei jedem KI-Diagramm: Wo beginnt die Achse? Was fehlt?

Erklärung zur Folie

Ein Trick, den KI-Diagramme gern machen, ohne böse Absicht. Nimm Süd und Nord aus der Beispieldatei: 1.422,70 und 1.333,90 Euro. Beginnt die Achse bei null, liegt Süd knapp vorn. Der Unterschied ist klein.

Dieselben Zahlen, aber die Achse beginnt bei 1.300. Jetzt sieht es aus, als würde Süd Nord überrollen. Gleiche Daten, völlig anderer Eindruck.

Die KI wählt die Achse oft automatisch. Deshalb fragst du bei jedem Diagramm: Wo beginnt die Achse? Und was fehlt?

Plausibilitätsprüfung in vier Schritten

  1. Ganze Datei gelesen? Zeilenzahl und Zeitraum vergleichen.
  2. Eine Summe selbst rechnen. Nur eine. Stimmt sie, steigt das Vertrauen.
  3. Größenordnung prüfen. 100 Bremsreparaturen an einem Tag? Dein Fachwissen prüft.
  4. Was hat die KI verändert? „Liste jede Änderung auf.“

Merk dir

Diese vier Schritte gehören in jede Datenanalyse mit KI.

Erklärung zur Folie

Plausibel heißt: Kann das überhaupt stimmen? Dafür reichen vier Schritte.

Erstens: Hat die KI die ganze Datei gelesen? Vergleich Zeilenzahl und Zeitraum. Zweitens: Rechne eine Summe selbst, nur eine. Stimmt sie, steigt das Vertrauen. Stimmt sie nicht, prüfst du alles.

Drittens: die Größenordnung. Ein kleiner Fahrradladen macht keine hundert Bremsreparaturen an einem Tag. Dein Fachwissen ist hier das beste Prüfwerkzeug. Viertens: Frag die KI, ob sie Daten verändert, gelöscht oder zusammengefasst hat, und lass dir jede Änderung auflisten.

Plausibel oder nicht?

Aussage Lösung Warum
Ein kleiner Fahrradladen macht 100 Bremsreparaturen an einem Tag. unplausibel Tippfehler: 135 € Umsatz passen zu drei Reparaturen
Ein Fahrradschlauch kostet minus 24,50 €. unplausibel negative Preise gibt es nicht, vielleicht eine Gutschrift
Der Punkt 52,52° N, 13,40° O liegt in Berlin. plausibel das ist Berlin-Mitte
Auf 2 Hektar Wiese brüten 40 Rotmilan-Paare. unplausibel Greifvögel brauchen große Reviere
Eine Bestellung vom 31.10.2026 im Septemberbericht. unplausibel außerhalb des Monats, klären
Die mittlere Julitemperatur in Berlin liegt bei 19 °C. plausibel üblicher Bereich: rund 19 bis 20 °C
Erklärung zur Folie

Hier trainierst du Schritt drei, die Größenordnung. Deck die Spalten „Lösung“ und „Warum“ ab und rate zuerst selbst.

Hundert Bremsreparaturen an einem Tag sind ein Tippfehler, der Umsatz von 135 Euro passt zu drei Reparaturen. Einen Schlauch für minus 24,50 Euro gibt es nicht. Vielleicht war es eine Gutschrift, dann gehört sie anders gebucht. Der Punkt 52,52 Grad Nord, 13,40 Grad Ost ist Berlin-Mitte. Vertauscht man die beiden Werte, landet man im Meer.

Vierzig Rotmilan-Paare auf zwei Hektar sind unplausibel, Greifvögel brauchen große Reviere. Vielleicht wurde die Art verwechselt, eher Feldlerche? Eine Bestellung vom 31. Oktober gehört nicht in den Septemberbericht, und im Beispiel lag sie sogar in der Zukunft. Die 19 Grad im Juli in Berlin dagegen liegen im üblichen Bereich.

Was nicht in ein privates KI-Konto gehört

Daten In ein privates KI-Konto?
Echte Kundendaten ohne Freigabe nein
Personaldaten, Gehälter nein
Gesundheitsdaten nein
Geschäftsgeheimnisse nein
Erfundene Daten ja
Anonymisierte Beispiele ja

Ob ein Unternehmens-Copilot über das Firmenkonto echte Daten verarbeiten darf, entscheidet der Arbeitgeber mit dem Datenschutz.

Erklärung zur Folie

Eine Grenze, bevor du loslegst. Echte Kundendaten, Personaldaten, Gesundheitsdaten oder Geschäftsgeheimnisse gehören nicht in ein privates KI-Konto.

Ob ein Unternehmens-Copilot oder ein Business-Tarif das darf, entscheidet dein Arbeitgeber mit dem Datenschutz, nicht du allein. Zum Üben nimmst du deshalb nur erfundene oder anonymisierte Daten. Die Verkaufstabelle aus diesem Teil ist komplett ausgedacht.

Wie das rechtlich genau aussieht, zeigt Teil 6. Einordnung, keine Rechtsberatung.

RAG: erst nachschlagen, dann antworten

Frage: „Wie lange Garantie auf einen Fahrradmantel?“
  1. RRetrieval: im Firmenwissen suchen
  2. AAugmented: Fundstellen an die Frage hängen
  3. GGeneration: aus den Fundstellen antworten
  4. Antwortmit Quelle: „Garantie-Richtlinie, S. 3“
  • Nicht neu trainieren: Ändert sich die Regel, tauschst du das Dokument. Das Modell bleibt gleich.
  • Mit Quelle: Du kannst nachsehen, woher die Antwort kommt.
Erklärung zur Folie

Jedes Unternehmen stellt irgendwann die Frage: Wie bringe ich der KI unser eigenes Wissen bei? Die Antwort heißt meistens nicht „Modell neu trainieren“. Sie heißt RAG, Retrieval-Augmented Generation. Auf Deutsch: Erzeugung mit vorheriger Suche.

Stell dir den Kundenservice eines Fahrradladens vor. Eine Kundin fragt nach der Garantie auf einen Fahrradmantel. Das RAG-System sucht zuerst in den internen Dokumenten nach passenden Stellen, das ist Retrieval. Diese Stellen hängt es an die Frage an, das ist Augmented. Erst dann formuliert das Sprachmodell eine Antwort, und zwar aus diesen Stellen. Das ist Generation.

Der Vorteil: Die Antwort kann eine Quelle nennen, und du kannst nachprüfen, woher sie kommt. Ändern sich die Garantiebedingungen, tauschst du das Dokument aus. Das Modell bleibt gleich.

RAG kennst du schon

Werkzeug Woraus es antwortet
Copilot aus Datei, SharePoint, Postfach, je nach Rechten
ChatGPT aus Projekten mit eigenen Dokumenten
Gemini aus Dateien in Google Drive
NotebookLM nur aus deinen Quellen

Gleiches Prinzip: erst nachschlagen, dann antworten. Wie genau es intern läuft, legen die Anbieter nicht immer offen.

Erklärung zur Folie

RAG klingt nach großem IT-Projekt. Das Prinzip benutzt du aber schon. Wenn du in Copilot eine Datei hochlädst und Fragen dazu stellst, antwortet das Modell aus dieser Datei. Probier es aus: Lade die Beispieltabelle hoch und frag „Was steht in der Datei zu Filiale Mitte? Nenne die Bestell-IDs.“

In Unternehmen kann Copilot auch auf SharePoint und Postfächer zugreifen, sofern Lizenz und Rechte das hergeben. ChatGPT hat Projekte mit eigenen Dokumenten. Gemini arbeitet mit Dateien aus Google Drive. Und Google hat NotebookLM, das nur aus deinen Quellen antwortet.

Wie das intern technisch umgesetzt ist, legen die Anbieter nicht immer offen. Behaupte also nicht, welches Verfahren genau läuft. Das Prinzip ist dasselbe: erst nachschlagen, dann antworten.

Wo RAG scheitert

  • Veraltet: Alte Dokumente, alte Antworten.
  • Zwei Versionen: Welche die KI nimmt, ist Glück.
  • Falsche Rechte: Gehaltsliste für alle freigegeben? Copilot findet sie.
  • Falsche Stelle: Die Suche findet einen Absatz, in dem das Wort passt, aber nicht der Sinn.

Merk dir

Vor jedem RAG-Projekt: aufräumen, Versionen klären, Rechte prüfen.

Erklärung zur Folie

Hier schließt sich der Kreis zum Anfang dieses Teils: Garbage in, garbage out gilt auch für RAG. RAG ist nur so gut wie die Dokumente dahinter. Veraltete Dokumente geben veraltete Antworten. Liegen zwei Versionen einer Richtlinie nebeneinander, ist es Glück, welche die KI nimmt.

Dann das Thema Rechte. Copilot zeigt nur, was ein Mensch ohnehin sehen darf. Hat aber jemand die Gehaltsliste versehentlich für alle freigegeben, findet Copilot sie auch. Die KI macht einen alten Fehler plötzlich sichtbar.

Und manchmal findet die Suche einfach die falsche Stelle, weil ein Wort passt, aber nicht der Sinn. Deshalb gehört vor jedes RAG-Projekt: aufräumen, Versionen klären, Rechte prüfen.

RAG-Detektiv: Welche Fundstelle gewinnt?

Fundstelle Text Bewertung
A · Reisekostenrichtlinie 2021, Ordner Archiv 0,25 € pro Kilometer mit dem privaten Pkw veraltet, gehört ins Archiv oder raus
B · Reisekostenrichtlinie 2026, Ordner aktuell 0,32 € pro Kilometer mit dem privaten Pkw die richtige, wenn die KI sie wählt
C · Fuhrpark-FAQ Poolfahrzeuge spätestens zwei Tage vorher im Intranet buchen passt zum Wort, nicht zur Frage

Frage an den Firmen-Bot: „Wie viel Kilometergeld bekomme ich für Dienstfahrten mit dem Privatauto?“ Erfundenes Unternehmen, erfundene Beträge.

Erklärung zur Folie

Jetzt bist du der RAG-Detektiv. Eine Beschäftigte fragt den Firmen-Bot nach dem Kilometergeld für Dienstfahrten mit dem Privatauto. Die Suche findet drei Stellen. Deck die Spalte „Bewertung“ ab und überleg: Welche Antwort gibt der Bot? Und welche sollte er geben?

Fundstelle A ist die Richtlinie von 2021. Sie ist veraltet und gehört ins Archiv oder ganz raus aus dem Suchbereich. Fundstelle B ist die aktuelle, die richtige, wenn die KI sie wählt. Garantiert ist das nicht, solange A daneben liegt. Fundstelle C passt zum Wort „Fahrzeug“, aber nicht zur Frage.

Die Lösung ist keine bessere KI. Die Lösung ist Aufräumen.

Deep Research: Recherche als Auftrag

So läuft Deep Research
  1. AuftragThema, Zweck, Quellen, Aufbau
  2. Plandie KI zeigt ihn, du kannst ihn ändern
  3. Sucheviele Quellen, Minuten bis eine halbe Stunde
  4. Berichtmit Quellenangaben
  • ChatGPT: Plus-Symbol am Eingabefeld, dann Deep Research.
  • Gemini: Tools-Menü am Eingabefeld, dann Deep Research.

Achtung

50 Fußnoten sind kein geprüfter Bericht. Quellen selbst anklicken.

Erklärung zur Folie

Ein normaler Chatbot mit Websuche schaut kurz nach und antwortet in Sekunden. Deep Research bekommt einen Auftrag. Die KI plant die Recherche und zeigt dir den Plan. Dann durchsucht sie viele Quellen, liest nach und sucht weiter. Das dauert ein paar Minuten bis zu einer halben Stunde, OpenAI nennt etwa 5 bis 30 Minuten. Am Ende steht ein Bericht mit Quellenangaben.

Die Funktion heißt bei ChatGPT und bei Gemini gleich: Deep Research. Du findest sie jeweils am Eingabefeld. Microsoft 365 Copilot hat mit voller Lizenz einen Agenten namens „Researcher“. Wie oft du die Funktion nutzen darfst, hängt vom Tarif ab; das prüfst du im eigenen Konto. Stand September 2026.

Wichtig: Ein Bericht mit fünfzig Fußnoten ist kein geprüfter Bericht. Die Quellen klickst du selbst an, mindestens die, auf die du dich stützt.

Zum Ausprobieren: ein Deep-Research-Auftrag

Erstelle einen Leitfaden für kleine Planungsbüros in Deutschland:
Welche KI-Werkzeuge helfen bei Kartierung, Geodatenauswertung und Berichten?
Zeitraum 2025 bis 2026.
Nur deutsche und europäische Quellen, bevorzugt Behörden, Verbände, Fachpresse.
Aufbau: Überblick, fünf Werkzeuge mit Kosten, Risiken, Empfehlung.
Keine Herstellerwerbung.

Bausteine: Thema und Zweck · Frage, Zeitraum, Region · Quellenarten · Aufbau und Ausschlüsse.

Erklärung zur Folie

So sieht ein guter Auftrag aus, hier für Gemini Deep Research. Er ist aufgebaut wie ein Auftrag an eine Rechercheagentur: Thema und Zweck, die eigentliche Frage mit Zeitraum und Region, welche Quellen, wie der Bericht aussehen soll und was nicht rein soll. Das sind die Prompt-Bausteine aus Teil 2.

Öffne Gemini, wähl am Eingabefeld über das Plus- oder Tools-Symbol „Deep Research“ und füg den Auftrag ein. Gemini zeigt dir zuerst einen Rechercheplan. Den kannst du ändern, bevor es losgeht. Das ist der Moment zum Nachdenken: Fragt die KI das, was du wissen willst?

Dann bestätigst du und lässt es laufen. Wenn der Bericht fertig ist, öffnest du ihn und klickst mindestens zwei Quellen an. Tausch das Thema ruhig gegen eins aus deinem eigenen Beruf.

Dein Auftrag: Daten prüfen, KI nachrechnen, recherchieren

  1. Fehler finden, ohne KI: Prüf eine erfundene Tabelle Spalte für Spalte mit den fünf Merkmalen. Notier Zeile, Spalte, Fehler, Merkmal und was du tun würdest.
  2. KI rechnen lassen: Gesamtumsatz, Umsatz je Filiale, Balkendiagramm, Datenqualitätsprobleme mit ID.
  3. Nachfragen und nachrechnen: „Hast du Werte verändert, gelöscht oder zusammengefasst?“ Dann selbst rechnen und vergleichen.
  4. Deep Research: eine Frage zu deinem Thema, danach drei Quellen prüfen.
  5. Kursbuch: Kapitel 4 mit den Glossarbegriffen dieses Teils.
Erklärung zur Folie

Für die erste Aufgabe brauchst du eine Tabelle mit Fehlern. Bau sie dir selbst nach diesem Muster: ein Laden mit drei Filialen, ein Monat, gut 50 Zeilen mit Bestell-ID, Datum, Filiale, Produkt, Menge, Einzelpreis, Umsatz und Kürzel. Bau etwa zehn Fehler ein, wie die fünf aus der Fehlerjagd. Tipp beim Suchen: sortieren, filtern und in einer Hilfsspalte Menge mal Einzelpreis rechnen, dann mit dem Umsatz vergleichen.

Bei der zweiten und dritten Aufgabe lädst du die unveränderte Datei in ChatGPT oder Copilot. Vergleich Zeilenzahl, Gesamtumsatz und den Umsatz je Filiale mit deiner eigenen Rechnung. Schreib auf: Welche Fehler hat die KI gefunden, die du übersehen hast? Welche hast du gefunden, die sie übersehen hat? Hat sie still etwas verändert?

Für Deep Research formulierst du eine Frage, nicht fünf, und baust daraus den Auftrag mit Thema, Zweck, Zeitraum, Quellenarten, Aufbau und Ausschlüssen. Prüf danach drei Quellen: Gibt es sie, steht dort, was der Bericht behauptet, und wie aktuell sind sie? Ins Kursbuch gehören unter anderem Garbage in, garbage out, Datenqualität, Dublette, Ausreißer, Data Owner, Aufbewahrungsfrist, Plausibilitätsprüfung, Code-Ausführung, RAG und Deep Research. Nachschlagen kannst du im Glossar.

Prüf dich selbst

  1. „Süd“ und „Sued“ in einer Spalte: Welches Merkmal fehlt?

    Antwort

    Einheitlich.

  2. Ein Gutachten als PDF ist strukturiert, halbstrukturiert oder unstrukturiert?

    Antwort

    Unstrukturiert.

  3. Wie heißt die Person, die für einen Datenbestand geradesteht?

    Antwort

    Data Owner.

  4. Woran erkennst du eine gerechnete KI-Zahl?

    Antwort

    Am aufklappbaren Code. Und auch dann rechnet der Code nur mit den Daten, die drinstehen.

  5. Zwei Versionen einer Richtlinie liegen im SharePoint. Welche nimmt RAG?

    Antwort

    Zufall. Deshalb aufräumen.

  6. Was spart Deep Research, und was nicht?

    Antwort

    Suchzeit, aber nicht die Prüfung der Quellen.

Erklärung zur Folie

Beantworte die Fragen zuerst ohne nachzuschauen, dann klapp die Antworten auf. Warst du bei einer Frage unsicher, geh zur passenden Folie zurück.

Die fünf Gedanken, die du aus diesem Teil mitnimmst: Schlechte Daten erzeugen überzeugend falsche Ergebnisse. Jeder Datenbestand braucht jemanden, der dafür zuständig ist. KI-Zahlen übernimmst du erst nach einer Gegenrechnung. RAG heißt: erst nachschlagen, dann antworten. Und Deep Research spart dir Suchzeit, aber nicht die Prüfung.

In Teil 5 geht es um Ethik, Bias und den EU AI Act. Du wirst sehen: Auch Bias fängt oft bei den Daten an.

Weiter im Kurs

Gezeichnetes Porträt von Erik Lorenscheit

ErikDir reicht Selbstlernen nicht? Dann lernst du das mit mir 1:1. Auf Wunsch bringe ich es auch Unternehmerinnen, Unternehmern und ganzen Teams bei. Schreib mir, was du brauchst.

Erstgespräch anfragen

Wohin darf ich dich bringen?