KI-Manager:in · Präsentation · Teil 4
Daten, Datenanalyse und RAG
Folien zum KI-Manager-Lernpfad: fünf Merkmale guter Daten, Datenarten, Data Owner, KI-Zahlen nachrechnen, RAG und Deep Research.
Ein Kurs von Erik Lorenscheit, Gründer von hilfmirmal · Zuletzt aktualisiert am
Weiter mit den Pfeiltasten oder durch Wischen
1 / 28
Teil 4 · Daten, Datenanalyse und RAG
Die KI rechnet nur mit dem, was du reingibst
Ein Sprachmodell weiß nichts, es rechnet. In diesem Teil geht es um das, womit es rechnet: Daten. Stimmen sie nicht, macht die KI daraus trotzdem eine selbstbewusste Empfehlung.
- Daten verstehen
- Mit KI rechnen und prüfen
- RAG und Deep Research
hilfmirmal.de · KI-Manager:in
Erklärung zur Folie
In Teil 3 hast du gesehen, wie ein Sprachmodell arbeitet. Es zerlegt Text in Token und berechnet, was wahrscheinlich als Nächstes kommt. Es weiß nichts, es rechnet. Jetzt geht es um das, womit es rechnet: Daten.
Ein kleines Beispiel zeigt das Problem. Eine Tabelle mit vier Zeilen: Filiale „Süd“, Filiale „nord“, Filiale „Nord“ mit 100 Bremsreparaturen für zusammen 135 Euro und Filiale „Sued“. Die KI macht daraus: „Die Filiale Nord wächst stark, vor allem bei Bremsreparaturen. Empfehlung: zweite Werkstatt eröffnen.“ Klingt überzeugend. Ist Unsinn.
Du gehst in drei Schritten vor. Zuerst lernst du, woran du gute Daten erkennst und wo sie im Unternehmen liegen. Dann lässt du eine KI rechnen und prüfst, was dabei herauskommt. Zum Schluss geht es darum, wie eine KI im Firmenwissen nachschlägt: RAG und Deep Research.
Zum Ausprobieren: Lass die KI eine Tabelle beschreiben
- Nimm eine kleine Tabelle mit erfundenen Daten, etwa Verkäufe eines Ladens über einen Monat.
- Lade sie in Copilot oder ChatGPT hoch.
- Prompt: „Beschreibe diese Tabelle in fünf Sätzen.“ Genau so, nichts ergänzen.
- Öffne die Datei selbst und prüf jeden Satz: Zeilen, Zeitraum, Filialen.
Merk dir
Nur erfundene Daten. Echte Kundendaten gehören nicht in ein privates KI-Konto.
Erklärung zur Folie
Im Präsenzkurs gab es dafür eine erfundene Datei: Verkaufsdaten eines Fahrradladens mit drei Filialen, Nord, Süd und Mitte, September 2026, 59 Zeilen. Jede Zeile ist eine Bestellung mit Bestell-ID, Datum, Filiale, Produkt, Menge, Einzelpreis, Umsatz und dem Kürzel der Person, die verkauft hat. Bau dir eine ähnliche Tabelle in Excel oder Google Tabellen und bau ruhig ein paar Fehler ein: eine Filiale einmal kleingeschrieben, einmal „Sued“ statt „Süd“, eine Zeile doppelt.
Dann lädst du sie hoch und lässt sie in fünf Sätzen beschreiben. Typisch ist: Die KI nennt Zeilenzahl, Zeitraum und „drei Filialen“ und übersieht die abweichenden Schreibweisen. Oder sie zählt fünf Filialen und merkt nicht, dass zwei davon Tippfehler sind.
Merk dir, wie sicher die Antwort klingt, auch wenn die KI die Tabelle nur überflogen hat. Was in so einer Datei alles faul sein kann, lernst du auf den nächsten Folien.
Garbage in, garbage out
Schlechte Daten rein, schlechte Ergebnisse raus. Auch mit der besten KI.
Früher gab ein falscher Wert eine falsche Zahl, die auffiel. Heute baut die KI daraus einen flüssigen Absatz, der richtig klingt.
Erklärung zur Folie
Garbage in, garbage out heißt: Müll rein, Müll raus. Der Satz ist älter als jede KI, er stammt aus der frühen Informatik.
Links geht eine fehlerhafte Tabelle rein: „nord“, „Sued“, 100 Bremsreparaturen, ein Schlauch für minus 24,50 Euro. In der Mitte rechnet die KI und schreibt flüssig. Sie prüft aber nicht, ob die Daten stimmen. Raus kommen ein schönes Diagramm und eine klare Empfehlung, und trotzdem ist beides falsch.
Deshalb fragst du bei jedem KI-Projekt zuerst: Welche Daten gehen rein? Wer hat sie gepflegt? Wie alt sind sie? Denk kurz an deinen eigenen Beruf: Wo hast du schon mit Daten gearbeitet, denen du nicht getraut hast?
Woran du gute Daten erkennst
| Merkmal | Prüffrage | Beispiel für einen Fehler |
|---|---|---|
| Vollständig | Sind alle Pflichtfelder gefüllt? | Bestellung ohne Menge |
| Korrekt | Stimmt der Wert mit der Wirklichkeit? | Schlauch für minus 24,50 Euro |
| Einheitlich | Gleiche Schreibweise, gleiches Format? | „Süd“ und „Sued“ |
| Aktuell | Ist der Stand bekannt und passend? | Kundenliste von 2019 |
| Eindeutig | Steht jeder Datensatz nur einmal drin? | Bestellung B1052 doppelt |
Merk dir
Diese fünf Fragen sind dein Prüfraster für jede Spalte.
Erklärung zur Folie
Datenqualität klingt abstrakt. Sie lässt sich aber mit fünf Fragen prüfen.
Vollständig: Sind alle Pflichtfelder gefüllt? Eine Bestellung ohne Menge ist wertlos. Korrekt: Stimmt der Wert? Ein Schlauch für minus 24,50 Euro ist kein Schnäppchen, sondern ein Fehler. Einheitlich: Heißt die Filiale überall gleich? Für dich sind „Süd“ und „Sued“ dasselbe. Für eine Auswertung sind das zwei verschiedene Filialen.
Aktuell: Weißt du, von wann die Daten sind? Eine Kundenliste von 2019 bringt dir 2026 wenig. Eindeutig: Steht ein Datensatz nur einmal drin? Eine doppelte Bestellung verdoppelt deinen Umsatz, auf dem Papier. Eine solche doppelte Zeile heißt Dublette.
Fehlerjagd: fünf Fehler, fünf Merkmale
| ID | Datum | Art | Anzahl | Koordinate |
|---|---|---|---|---|
| K01 | 2026-05-04 | Rotmilan | 2 | 52.41, 13.12 |
| K02 | 2026-05-04 | Feldlerche | 5 | 52.40, 13.10 |
| K03 | 2026-05-11 | Rot-Milan | 1 | 52.42, 13.14 |
| K04 | 2026-05-11 | Kiebitz | -2 | 52.39, 13.11 |
| K05 | 2026-05-18 | Feldlerche | 3 | (leer) |
| K06 | 2019-05-18 | Neuntöter | 1 | 52.41, 13.13 |
| K07 | 2026-05-25 | Feldlerche | 4 | 52.40, 13.12 |
| K07 | 2026-05-25 | Feldlerche | 4 | 52.40, 13.12 |
Erfundene Brutvogelkartierung, Fläche Nord. Für jedes Merkmal steckt genau ein Fehler drin.
Erklärung zur Folie
Rate zuerst selbst: Welche Zeile, welches Merkmal? Nimm dir fünf Minuten, bevor du weiterliest.
Die Lösung: K03 schreibt „Rot-Milan“ mit Bindestrich. Für eine Auswertung ist das eine eigene Art, also fehlt es an Einheitlichkeit. K04 meldet minus zwei Kiebitze. Negative Vögel gibt es nicht, der Wert ist nicht korrekt. Bei K05 fehlt die Koordinate, die Beobachtung ist auf keiner Karte zu finden: nicht vollständig.
K06 trägt das Jahr 2019 in einer Kartierung von 2026: nicht aktuell. Und K07 steht zweimal da: nicht eindeutig. Genau diese fünf Fehlerarten findest du in fast jeder echten Tabelle wieder, meist öfter.
Strukturiert oder unstrukturiert?
Strukturiert: feste Spalten
- Jede Spalte hat eine feste Bedeutung: Datum, Filiale, Menge.
- Tabellen, Datenbanken, CSV, Attributtabellen.
Unstrukturiert: freier Text, Bild, Ton
- „Hallo, mein Rad war schon wieder nicht fertig, obwohl mir Freitag zugesagt wurde …“
- E-Mails, PDFs, Protokolle, Luftbilder, Sprachnachrichten.
Merk dir
Neu: Sprachmodelle arbeiten gut mit unstrukturierten Daten.
Erklärung zur Folie
Daten gibt es in zwei Grundformen. Strukturierte Daten stehen in Tabellen, jede Spalte hat eine feste Bedeutung. Damit rechnet Excel seit Jahrzehnten.
Unstrukturierte Daten haben keine feste Form: E-Mails, Verträge als PDF, Gesprächsnotizen, Fotos, Sprachnachrichten. Ein großer Teil des Wissens in einem Unternehmen steckt hier. Dazwischen liegen halbstrukturierte Daten. Eine E-Mail hat feste Felder wie Absender und Datum, aber einen freien Text.
Das Neue an Sprachmodellen: Sie arbeiten gut mit unstrukturierten Daten. Sie fassen Beschwerde-Mails zusammen oder ziehen aus einem Vertrag die Kündigungsfrist. Das war früher teure Handarbeit. Bei Geodaten hast du übrigens oft beides: eine Attributtabelle zu jeder Fläche und dazu das Luftbild.
Welche Datenform ist das?
| Datenquelle | Lösung | Warum |
|---|---|---|
| Attributtabelle eines Shapefiles | strukturiert | feste Spalten pro Fläche |
| Luftbild einer Baufläche | unstrukturiert | Pixel ohne feste Bedeutung, KI kann Klassen daraus machen |
| Gutachten als PDF | unstrukturiert | freier Text, Tabellen darin sind Beiwerk |
| Excel-Liste der kartierten Arten | strukturiert | solange alle dieselben Spalten nutzen |
| E-Mail einer Behörde | halbstrukturiert | Absender und Datum fest, Text frei |
| Sprachmemo aus dem Gelände | unstrukturiert | Ton: erst Transkript, dann Auswertung |
Erklärung zur Folie
Deck die Spalten „Lösung“ und „Warum“ ab und rate zuerst selbst. Sechs Datenquellen aus Planung und Geodaten, und bei jeder fragst du: strukturiert, unstrukturiert oder halbstrukturiert?
Die Attributtabelle eines Shapefiles hat feste Spalten pro Fläche, sie ist strukturiert. Das Luftbild besteht aus Pixeln ohne feste Bedeutung. Eine KI kann daraus Klassen machen, etwa Wald, Wasser, Acker, aber das Bild selbst ist unstrukturiert. Das Gutachten als PDF ist freier Text.
Die Excel-Liste der kartierten Arten ist strukturiert, solange alle dieselben Spalten nutzen. Die E-Mail der Behörde ist halbstrukturiert. Und das Sprachmemo aus dem Gelände ist Ton: erst ein Transkript, dann die Auswertung.
Fünf Datenarten, die du kennen musst
| Datenart | Was sie ausmacht | Beispiele |
|---|---|---|
| Stammdaten | ändern sich selten | Kunde, Produkt, Preis |
| Bewegungsdaten | entstehen ständig | Bestellung, Buchung, Ticket |
| Personenbezogene Daten | alles zu einer Person | Name, Mail, auch ein Kürzel |
| Metadaten | Daten über Daten | wer, wann, welche Version, welches Koordinatensystem |
| Wissen | Texte, die Abläufe erklären | Handbücher, Richtlinien, Protokolle |
In einer Verkaufstabelle: Produkt und Einzelpreis sind Stammdaten, Datum, Bestellnummer und Menge Bewegung, das Kürzel der verkaufenden Person ein Personenbezug.
Erklärung zur Folie
Fünf Datenarten begegnen dir in jedem Unternehmen. Stammdaten ändern sich selten: der Kunde, das Produkt, der Preis. Bewegungsdaten entstehen ständig: jede Bestellung, jede Buchung, jedes Support-Ticket.
Personenbezogene Daten sind alles, womit sich ein Mensch identifizieren lässt. Name, E-Mail, auch ein Kürzel, wenn man weiß, wer dahintersteht. Wie die DSGVO damit umgeht, zeigt Teil 6. Metadaten beschreiben andere Daten: Wer hat die Datei erstellt, wann, in welcher Version? Bei Geodaten gehört das Koordinatensystem dazu. Ohne das ist eine Koordinate wertlos.
Und dann das Wissen: Handbücher, Richtlinien, Protokolle. Das ist das Futter für RAG, dazu kommst du weiter hinten in diesem Teil.
Wo die Daten im Unternehmen liegen
- ERP: Warenwirtschaft, Bestellungen.
- CRM: Vertrieb, Kundenkontakte.
- Buchhaltung und Personal: Rechnungen, Belege, Verträge, Zeiten.
- SharePoint, Laufwerke, Postfächer: das große unstrukturierte Feld.
- Fachsysteme: zum Beispiel ein GIS mit Geodaten.
- Excel-Listen auf einzelnen Rechnern:
Umsatz_,final_ v3. xlsx Kosten_.neu_ NICHT_ LÖSCHEN. xlsx
Achtung
Excel-Listen sind oft am wichtigsten und oft nur von einer Person verstanden.
Erklärung zur Folie
Stell dir ein typisches Unternehmen als Grundriss vor. Die Daten liegen im ERP, also der Warenwirtschaft. Im CRM beim Vertrieb. In der Buchhaltung und im Personalsystem. Dann das große unstrukturierte Feld: SharePoint, Netzlaufwerke, Postfächer. Und Fachsysteme, etwa ein GIS mit Geodaten oder eine Kartierungsdatenbank.
Dazwischen, oft am wichtigsten: Excel-Listen auf einzelnen Rechnern. „Umsatz final, Version drei.“ Die Artenliste einer Kollegin. Und die Datei, die niemand löschen darf, aber auch niemand erklären kann. Ist die zuständige Person im Urlaub, weiß keiner, welche Spalte was bedeutet.
Für KI heißt das: Bevor du ein Werkzeug einführst, schreibst du auf, wo die nötigen Daten liegen und in welchem Zustand. Das ist unspektakulär. Es entscheidet aber, ob das Projekt klappt.
Jeder Datenbestand braucht eine zuständige Person
Fachwort: Data Owner. Die Person oder Abteilung, die für einen Datenbestand geradesteht.
- Wer pflegt die Daten?
- Wer darf sie ändern?
- Wer gibt sie für die KI frei?
- Wer löscht sie, wenn die Frist abläuft?
Merk dir
Keine Antwort? Dann hast du die erste Aufgabe für dein KI-Projekt gefunden.
Erklärung zur Folie
Die häufigste Antwort auf die Frage „Wer ist für diese Daten zuständig?“ lautet: „Weiß ich nicht.“ Fachlich spricht man vom Data Owner. Das ist die Person oder Abteilung, die für einen Datenbestand geradesteht.
Vier Fragen klärst du für jeden Datenbestand, bevor er in eine KI geht: Wer pflegt ihn? Wer darf ihn ändern? Wer gibt ihn für die KI frei? Und wer löscht ihn, wenn er nicht mehr gebraucht wird?
Kannst du eine dieser Fragen nicht beantworten, ist das kein Rückschlag. Du hast damit die erste Aufgabe für dein KI-Projekt gefunden.
Aufbewahren und löschen
| Was | Wie lange | Grundlage |
|---|---|---|
| Bücher, Jahresabschlüsse | 10 Jahre | § 257 HGB, § 147 AO |
| Buchungsbelege, Rechnungen | 8 Jahre, seit 2025 | § 257 HGB, § 147 AO |
| Handels- und Geschäftsbriefe | 6 Jahre | § 257 HGB, § 147 AO |
| Personenbezogene Daten | so kurz wie nötig | Art. 5 Abs. 1 lit. e DSGVO, Recht auf Löschung: Art. 17 |
Prüffrage: Kannst du Daten im KI-System auch wieder löschen? Einordnung, keine Rechtsberatung.
Erklärung zur Folie
Daten haben ein Verfallsdatum, und zwar in beide Richtungen. Manche musst du aufbewahren. Das regeln Paragraf 257 im Handelsgesetzbuch und Paragraf 147 AO im Steuerrecht. Bücher und Jahresabschlüsse zehn Jahre. Buchungsbelege wie Rechnungen seit 2025 nur noch acht Jahre, vorher waren es zehn; verkürzt hat das das Bürokratieentlastungsgesetz IV. Handels- und Geschäftsbriefe sechs Jahre.
Andere Daten musst du löschen. Die DSGVO sagt in Artikel 5, dass personenbezogene Daten nur so lange gespeichert werden, wie es für den Zweck nötig ist. Artikel 17 gibt Menschen ein Recht auf Löschung.
Für KI ist das wichtig: Wenn du Daten in ein KI-System lädst, musst du wissen, ob du sie dort auch wieder löschen kannst. Im echten Projekt klärst du das mit Datenschutz und Steuerberatung. Einordnung, keine Rechtsberatung.
Drei Fragen vor jedem KI-Projekt
- Welche Daten brauchen wir? Genau benennen, nicht „alle“.
- In welchem Zustand sind sie? Die fünf Merkmale prüfen.
- Wer ist zuständig und gibt frei? Der Data Owner.
Achtung
Ein häufiger Grund für gescheiterte Piloten: nicht das Modell, sondern die Datenlage.
Erklärung zur Folie
Wenn du aus der ersten Hälfte dieses Teils nur eine Sache mitnimmst, dann diese drei Fragen. Welche Daten brauchen wir? In welchem Zustand sind sie? Und wer ist zuständig und gibt frei?
Das klingt nach Verwaltung. Es ist aber ein häufiger Grund, warum KI-Pilotprojekte stecken bleiben. Nicht das Modell scheitert, sondern die Datenlage.
Ab der nächsten Folie lässt du die KI rechnen. Behalt die drei Fragen dabei im Kopf.
Was KI mit Tabellen gut kann
| Aufgabe | Was du bekommst |
|---|---|
| Überblick | Spalten, Zeilen, Zeitraum |
| Rechnen | Summen, Durchschnitte, Rangfolgen |
| Diagramme | auf Zuruf |
| Auffälligkeiten | Ausreißer finden |
| Formeln | Excel-Formeln erklären und bauen |
ChatGPT: CSV oder Excel hochladen, in normaler Sprache fragen. Copilot: auch direkt in Excel, je nach Lizenz und Freigabe.
Merk dir
Erste Antwort. Nicht letzte.
Erklärung zur Folie
ChatGPT und Copilot können Tabellen lesen. Du lädst eine CSV- oder Excel-Datei hoch und stellst Fragen in normaler Sprache. Welche Filiale hat den meisten Umsatz? Zeig mir den Verlauf pro Woche als Diagramm. Welche Werte fallen aus der Reihe? Erklär mir diese Excel-Formel.
Das ist ein echter Gewinn. Du musst keine Pivot-Tabelle bauen können, um eine erste Antwort zu bekommen.
Aber es ist eine erste Antwort, keine letzte. Wie du sie prüfst, zeigen die nächsten Folien.
Wie die KI eigentlich rechnet
Nur gelesen: Zahl ist geschätzt
„Der Gesamtumsatz beträgt etwa 3.700 €.“
Das Modell sagt Token voraus. Eine Summe, die gut aussieht, ist noch keine Rechnung.
Mit Code-Ausführung: Zahl ist gerechnet
df = pd.read_csv("beispieldaten-verkauf.csv")
df["Umsatz_EUR"].sum()
# Ergebnis: 3686.59
Erkennbar am aufklappbaren Code. Ohne Code: Zahl nicht übernehmen.
Achtung
Auch gerechnet heißt nicht richtig. Der Code rechnet mit „nord“, „Sued“ und der Dublette.
Erklärung zur Folie
Bevor du einer KI-Summe glaubst, musst du eine Sache verstehen. Ein Sprachmodell rechnet nicht im Kopf. Es sagt Token voraus, das kennst du aus Teil 3. Wenn es eine Tabelle nur liest und dann eine Summe nennt, ist das eine geschätzte Zahl, die gut aussieht.
Viele Werkzeuge haben deshalb eine Code-Ausführung. ChatGPT schreibt dann ein kleines Python-Programm, führt es aus und gibt dir das Ergebnis. Diese Zahl ist gerechnet. Du erkennst das daran, dass du den Code aufklappen kannst. Siehst du keinen Code und keinen Hinweis auf eine Analyse, übernimmst du die Zahl nicht ungeprüft.
Und auch gerechnet heißt nicht richtig. Der Code rechnet mit den Daten, die drinstehen, mit „nord“, „Sued“ und der doppelten Bestellung. Garbage in, garbage out.
Zum Ausprobieren: Umsatz pro Filiale
| Filiale laut KI | Umsatz in Euro |
|---|---|
| Süd | 1.422,70 |
| Nord | 1.333,90 |
| Mitte | 906,29 |
| Sued | 15,80 |
| nord | 7,90 |
Der Laden hat drei Filialen. Im Diagramm der KI stehen fünf.
Merk dir
Nachrechnen: Spalte in Excel markieren, Summe unten ablesen. Hier 3.686,59 €.
Erklärung zur Folie
So kann es aussehen, wenn du die Verkaufstabelle aus dem Beispiel in ChatGPT lädst. Über das Plus-Symbol im Eingabefeld fügst du die Datei hinzu. Erster Prompt: „Wie hoch ist der Umsatz pro Filiale? Gib eine Tabelle aus.“ Zweiter Prompt: „Erstelle dazu ein Balkendiagramm.“ Die Zahlen oben sind die echten Summen der Rohdaten aus der Beispieldatei.
Das Diagramm sieht professionell aus, und genau das ist das Problem. Der Laden hat drei Filialen, im Diagramm sind es fünf. „Sued“ und „nord“ sind für die KI eigene Filialen. Frag deshalb nach: „Hast du Werte verändert oder zusammengefasst? Liste jede Änderung auf.“ Manche Werkzeuge bereinigen still und sagen es nicht.
Dann kommt der wichtigste Schritt: Du rechnest selbst nach. Datei in Excel öffnen, Spalte mit dem Umsatz markieren, unten in der Statusleiste steht die Summe. In der Beispieldatei sind es 3.686,59 Euro. Stimmt das mit der KI überein?
Ein Diagramm ist kein Beweis
Achse beginnt bei 0
- Süd und Nord aus der Beispieldatei.
- Süd liegt knapp vorn.
Achse beginnt bei 1.300
- Dieselben Zahlen.
- Süd scheint Nord zu überrollen.
Merk dir
Frag bei jedem KI-Diagramm: Wo beginnt die Achse? Was fehlt?
Erklärung zur Folie
Ein Trick, den KI-Diagramme gern machen, ohne böse Absicht. Nimm Süd und Nord aus der Beispieldatei: 1.422,70 und 1.333,90 Euro. Beginnt die Achse bei null, liegt Süd knapp vorn. Der Unterschied ist klein.
Dieselben Zahlen, aber die Achse beginnt bei 1.300. Jetzt sieht es aus, als würde Süd Nord überrollen. Gleiche Daten, völlig anderer Eindruck.
Die KI wählt die Achse oft automatisch. Deshalb fragst du bei jedem Diagramm: Wo beginnt die Achse? Und was fehlt?
Plausibilitätsprüfung in vier Schritten
- Ganze Datei gelesen? Zeilenzahl und Zeitraum vergleichen.
- Eine Summe selbst rechnen. Nur eine. Stimmt sie, steigt das Vertrauen.
- Größenordnung prüfen. 100 Bremsreparaturen an einem Tag? Dein Fachwissen prüft.
- Was hat die KI verändert? „Liste jede Änderung auf.“
Merk dir
Diese vier Schritte gehören in jede Datenanalyse mit KI.
Erklärung zur Folie
Plausibel heißt: Kann das überhaupt stimmen? Dafür reichen vier Schritte.
Erstens: Hat die KI die ganze Datei gelesen? Vergleich Zeilenzahl und Zeitraum. Zweitens: Rechne eine Summe selbst, nur eine. Stimmt sie, steigt das Vertrauen. Stimmt sie nicht, prüfst du alles.
Drittens: die Größenordnung. Ein kleiner Fahrradladen macht keine hundert Bremsreparaturen an einem Tag. Dein Fachwissen ist hier das beste Prüfwerkzeug. Viertens: Frag die KI, ob sie Daten verändert, gelöscht oder zusammengefasst hat, und lass dir jede Änderung auflisten.
Plausibel oder nicht?
| Aussage | Lösung | Warum |
|---|---|---|
| Ein kleiner Fahrradladen macht 100 Bremsreparaturen an einem Tag. | unplausibel | Tippfehler: 135 € Umsatz passen zu drei Reparaturen |
| Ein Fahrradschlauch kostet minus 24,50 €. | unplausibel | negative Preise gibt es nicht, vielleicht eine Gutschrift |
| Der Punkt 52,52° N, 13,40° O liegt in Berlin. | plausibel | das ist Berlin-Mitte |
| Auf 2 Hektar Wiese brüten 40 Rotmilan-Paare. | unplausibel | Greifvögel brauchen große Reviere |
| Eine Bestellung vom 31.10.2026 im Septemberbericht. | unplausibel | außerhalb des Monats, klären |
| Die mittlere Julitemperatur in Berlin liegt bei 19 °C. | plausibel | üblicher Bereich: rund 19 bis 20 °C |
Erklärung zur Folie
Hier trainierst du Schritt drei, die Größenordnung. Deck die Spalten „Lösung“ und „Warum“ ab und rate zuerst selbst.
Hundert Bremsreparaturen an einem Tag sind ein Tippfehler, der Umsatz von 135 Euro passt zu drei Reparaturen. Einen Schlauch für minus 24,50 Euro gibt es nicht. Vielleicht war es eine Gutschrift, dann gehört sie anders gebucht. Der Punkt 52,52 Grad Nord, 13,40 Grad Ost ist Berlin-Mitte. Vertauscht man die beiden Werte, landet man im Meer.
Vierzig Rotmilan-Paare auf zwei Hektar sind unplausibel, Greifvögel brauchen große Reviere. Vielleicht wurde die Art verwechselt, eher Feldlerche? Eine Bestellung vom 31. Oktober gehört nicht in den Septemberbericht, und im Beispiel lag sie sogar in der Zukunft. Die 19 Grad im Juli in Berlin dagegen liegen im üblichen Bereich.
Was nicht in ein privates KI-Konto gehört
| Daten | In ein privates KI-Konto? |
|---|---|
| Echte Kundendaten | ohne Freigabe nein |
| Personaldaten, Gehälter | nein |
| Gesundheitsdaten | nein |
| Geschäftsgeheimnisse | nein |
| Erfundene Daten | ja |
| Anonymisierte Beispiele | ja |
Ob ein Unternehmens-Copilot über das Firmenkonto echte Daten verarbeiten darf, entscheidet der Arbeitgeber mit dem Datenschutz.
Erklärung zur Folie
Eine Grenze, bevor du loslegst. Echte Kundendaten, Personaldaten, Gesundheitsdaten oder Geschäftsgeheimnisse gehören nicht in ein privates KI-Konto.
Ob ein Unternehmens-Copilot oder ein Business-Tarif das darf, entscheidet dein Arbeitgeber mit dem Datenschutz, nicht du allein. Zum Üben nimmst du deshalb nur erfundene oder anonymisierte Daten. Die Verkaufstabelle aus diesem Teil ist komplett ausgedacht.
Wie das rechtlich genau aussieht, zeigt Teil 6. Einordnung, keine Rechtsberatung.
RAG: erst nachschlagen, dann antworten
- RRetrieval: im Firmenwissen suchen
- AAugmented: Fundstellen an die Frage hängen
- GGeneration: aus den Fundstellen antworten
- Antwortmit Quelle: „Garantie-Richtlinie, S. 3“
- Nicht neu trainieren: Ändert sich die Regel, tauschst du das Dokument. Das Modell bleibt gleich.
- Mit Quelle: Du kannst nachsehen, woher die Antwort kommt.
Erklärung zur Folie
Jedes Unternehmen stellt irgendwann die Frage: Wie bringe ich der KI unser eigenes Wissen bei? Die Antwort heißt meistens nicht „Modell neu trainieren“. Sie heißt RAG, Retrieval-Augmented Generation. Auf Deutsch: Erzeugung mit vorheriger Suche.
Stell dir den Kundenservice eines Fahrradladens vor. Eine Kundin fragt nach der Garantie auf einen Fahrradmantel. Das RAG-System sucht zuerst in den internen Dokumenten nach passenden Stellen, das ist Retrieval. Diese Stellen hängt es an die Frage an, das ist Augmented. Erst dann formuliert das Sprachmodell eine Antwort, und zwar aus diesen Stellen. Das ist Generation.
Der Vorteil: Die Antwort kann eine Quelle nennen, und du kannst nachprüfen, woher sie kommt. Ändern sich die Garantiebedingungen, tauschst du das Dokument aus. Das Modell bleibt gleich.
RAG kennst du schon
| Werkzeug | Woraus es antwortet |
|---|---|
| Copilot | aus Datei, SharePoint, Postfach, je nach Rechten |
| ChatGPT | aus Projekten mit eigenen Dokumenten |
| Gemini | aus Dateien in Google Drive |
| NotebookLM | nur aus deinen Quellen |
Gleiches Prinzip: erst nachschlagen, dann antworten. Wie genau es intern läuft, legen die Anbieter nicht immer offen.
Erklärung zur Folie
RAG klingt nach großem IT-Projekt. Das Prinzip benutzt du aber schon. Wenn du in Copilot eine Datei hochlädst und Fragen dazu stellst, antwortet das Modell aus dieser Datei. Probier es aus: Lade die Beispieltabelle hoch und frag „Was steht in der Datei zu Filiale Mitte? Nenne die Bestell-IDs.“
In Unternehmen kann Copilot auch auf SharePoint und Postfächer zugreifen, sofern Lizenz und Rechte das hergeben. ChatGPT hat Projekte mit eigenen Dokumenten. Gemini arbeitet mit Dateien aus Google Drive. Und Google hat NotebookLM, das nur aus deinen Quellen antwortet.
Wie das intern technisch umgesetzt ist, legen die Anbieter nicht immer offen. Behaupte also nicht, welches Verfahren genau läuft. Das Prinzip ist dasselbe: erst nachschlagen, dann antworten.
Wo RAG scheitert
- Veraltet: Alte Dokumente, alte Antworten.
- Zwei Versionen: Welche die KI nimmt, ist Glück.
- Falsche Rechte: Gehaltsliste für alle freigegeben? Copilot findet sie.
- Falsche Stelle: Die Suche findet einen Absatz, in dem das Wort passt, aber nicht der Sinn.
Merk dir
Vor jedem RAG-Projekt: aufräumen, Versionen klären, Rechte prüfen.
Erklärung zur Folie
Hier schließt sich der Kreis zum Anfang dieses Teils: Garbage in, garbage out gilt auch für RAG. RAG ist nur so gut wie die Dokumente dahinter. Veraltete Dokumente geben veraltete Antworten. Liegen zwei Versionen einer Richtlinie nebeneinander, ist es Glück, welche die KI nimmt.
Dann das Thema Rechte. Copilot zeigt nur, was ein Mensch ohnehin sehen darf. Hat aber jemand die Gehaltsliste versehentlich für alle freigegeben, findet Copilot sie auch. Die KI macht einen alten Fehler plötzlich sichtbar.
Und manchmal findet die Suche einfach die falsche Stelle, weil ein Wort passt, aber nicht der Sinn. Deshalb gehört vor jedes RAG-Projekt: aufräumen, Versionen klären, Rechte prüfen.
RAG-Detektiv: Welche Fundstelle gewinnt?
| Fundstelle | Text | Bewertung |
|---|---|---|
| A · Reisekostenrichtlinie 2021, Ordner Archiv | 0,25 € pro Kilometer mit dem privaten Pkw | veraltet, gehört ins Archiv oder raus |
| B · Reisekostenrichtlinie 2026, Ordner aktuell | 0,32 € pro Kilometer mit dem privaten Pkw | die richtige, wenn die KI sie wählt |
| C · Fuhrpark-FAQ | Poolfahrzeuge spätestens zwei Tage vorher im Intranet buchen | passt zum Wort, nicht zur Frage |
Frage an den Firmen-Bot: „Wie viel Kilometergeld bekomme ich für Dienstfahrten mit dem Privatauto?“ Erfundenes Unternehmen, erfundene Beträge.
Erklärung zur Folie
Jetzt bist du der RAG-Detektiv. Eine Beschäftigte fragt den Firmen-Bot nach dem Kilometergeld für Dienstfahrten mit dem Privatauto. Die Suche findet drei Stellen. Deck die Spalte „Bewertung“ ab und überleg: Welche Antwort gibt der Bot? Und welche sollte er geben?
Fundstelle A ist die Richtlinie von 2021. Sie ist veraltet und gehört ins Archiv oder ganz raus aus dem Suchbereich. Fundstelle B ist die aktuelle, die richtige, wenn die KI sie wählt. Garantiert ist das nicht, solange A daneben liegt. Fundstelle C passt zum Wort „Fahrzeug“, aber nicht zur Frage.
Die Lösung ist keine bessere KI. Die Lösung ist Aufräumen.
Deep Research: Recherche als Auftrag
- AuftragThema, Zweck, Quellen, Aufbau
- Plandie KI zeigt ihn, du kannst ihn ändern
- Sucheviele Quellen, Minuten bis eine halbe Stunde
- Berichtmit Quellenangaben
- ChatGPT: Plus-Symbol am Eingabefeld, dann Deep Research.
- Gemini: Tools-Menü am Eingabefeld, dann Deep Research.
Achtung
50 Fußnoten sind kein geprüfter Bericht. Quellen selbst anklicken.
Erklärung zur Folie
Ein normaler Chatbot mit Websuche schaut kurz nach und antwortet in Sekunden. Deep Research bekommt einen Auftrag. Die KI plant die Recherche und zeigt dir den Plan. Dann durchsucht sie viele Quellen, liest nach und sucht weiter. Das dauert ein paar Minuten bis zu einer halben Stunde, OpenAI nennt etwa 5 bis 30 Minuten. Am Ende steht ein Bericht mit Quellenangaben.
Die Funktion heißt bei ChatGPT und bei Gemini gleich: Deep Research. Du findest sie jeweils am Eingabefeld. Microsoft 365 Copilot hat mit voller Lizenz einen Agenten namens „Researcher“. Wie oft du die Funktion nutzen darfst, hängt vom Tarif ab; das prüfst du im eigenen Konto. Stand September 2026.
Wichtig: Ein Bericht mit fünfzig Fußnoten ist kein geprüfter Bericht. Die Quellen klickst du selbst an, mindestens die, auf die du dich stützt.
Zum Ausprobieren: ein Deep-Research-Auftrag
Erstelle einen Leitfaden für kleine Planungsbüros in Deutschland:
Welche KI-Werkzeuge helfen bei Kartierung, Geodatenauswertung und Berichten?
Zeitraum 2025 bis 2026.
Nur deutsche und europäische Quellen, bevorzugt Behörden, Verbände, Fachpresse.
Aufbau: Überblick, fünf Werkzeuge mit Kosten, Risiken, Empfehlung.
Keine Herstellerwerbung.
Bausteine: Thema und Zweck · Frage, Zeitraum, Region · Quellenarten · Aufbau und Ausschlüsse.
Erklärung zur Folie
So sieht ein guter Auftrag aus, hier für Gemini Deep Research. Er ist aufgebaut wie ein Auftrag an eine Rechercheagentur: Thema und Zweck, die eigentliche Frage mit Zeitraum und Region, welche Quellen, wie der Bericht aussehen soll und was nicht rein soll. Das sind die Prompt-Bausteine aus Teil 2.
Öffne Gemini, wähl am Eingabefeld über das Plus- oder Tools-Symbol „Deep Research“ und füg den Auftrag ein. Gemini zeigt dir zuerst einen Rechercheplan. Den kannst du ändern, bevor es losgeht. Das ist der Moment zum Nachdenken: Fragt die KI das, was du wissen willst?
Dann bestätigst du und lässt es laufen. Wenn der Bericht fertig ist, öffnest du ihn und klickst mindestens zwei Quellen an. Tausch das Thema ruhig gegen eins aus deinem eigenen Beruf.
Dein Auftrag: Daten prüfen, KI nachrechnen, recherchieren
- Fehler finden, ohne KI: Prüf eine erfundene Tabelle Spalte für Spalte mit den fünf Merkmalen. Notier Zeile, Spalte, Fehler, Merkmal und was du tun würdest.
- KI rechnen lassen: Gesamtumsatz, Umsatz je Filiale, Balkendiagramm, Datenqualitätsprobleme mit ID.
- Nachfragen und nachrechnen: „Hast du Werte verändert, gelöscht oder zusammengefasst?“ Dann selbst rechnen und vergleichen.
- Deep Research: eine Frage zu deinem Thema, danach drei Quellen prüfen.
- Kursbuch: Kapitel 4 mit den Glossarbegriffen dieses Teils.
Erklärung zur Folie
Für die erste Aufgabe brauchst du eine Tabelle mit Fehlern. Bau sie dir selbst nach diesem Muster: ein Laden mit drei Filialen, ein Monat, gut 50 Zeilen mit Bestell-ID, Datum, Filiale, Produkt, Menge, Einzelpreis, Umsatz und Kürzel. Bau etwa zehn Fehler ein, wie die fünf aus der Fehlerjagd. Tipp beim Suchen: sortieren, filtern und in einer Hilfsspalte Menge mal Einzelpreis rechnen, dann mit dem Umsatz vergleichen.
Bei der zweiten und dritten Aufgabe lädst du die unveränderte Datei in ChatGPT oder Copilot. Vergleich Zeilenzahl, Gesamtumsatz und den Umsatz je Filiale mit deiner eigenen Rechnung. Schreib auf: Welche Fehler hat die KI gefunden, die du übersehen hast? Welche hast du gefunden, die sie übersehen hat? Hat sie still etwas verändert?
Für Deep Research formulierst du eine Frage, nicht fünf, und baust daraus den Auftrag mit Thema, Zweck, Zeitraum, Quellenarten, Aufbau und Ausschlüssen. Prüf danach drei Quellen: Gibt es sie, steht dort, was der Bericht behauptet, und wie aktuell sind sie? Ins Kursbuch gehören unter anderem Garbage in, garbage out, Datenqualität, Dublette, Ausreißer, Data Owner, Aufbewahrungsfrist, Plausibilitätsprüfung, Code-Ausführung, RAG und Deep Research. Nachschlagen kannst du im Glossar.
Prüf dich selbst
„Süd“ und „Sued“ in einer Spalte: Welches Merkmal fehlt?
Antwort
Einheitlich.
Ein Gutachten als PDF ist strukturiert, halbstrukturiert oder unstrukturiert?
Antwort
Unstrukturiert.
Wie heißt die Person, die für einen Datenbestand geradesteht?
Antwort
Data Owner.
Woran erkennst du eine gerechnete KI-Zahl?
Antwort
Am aufklappbaren Code. Und auch dann rechnet der Code nur mit den Daten, die drinstehen.
Zwei Versionen einer Richtlinie liegen im SharePoint. Welche nimmt RAG?
Antwort
Zufall. Deshalb aufräumen.
Was spart Deep Research, und was nicht?
Antwort
Suchzeit, aber nicht die Prüfung der Quellen.
Erklärung zur Folie
Beantworte die Fragen zuerst ohne nachzuschauen, dann klapp die Antworten auf. Warst du bei einer Frage unsicher, geh zur passenden Folie zurück.
Die fünf Gedanken, die du aus diesem Teil mitnimmst: Schlechte Daten erzeugen überzeugend falsche Ergebnisse. Jeder Datenbestand braucht jemanden, der dafür zuständig ist. KI-Zahlen übernimmst du erst nach einer Gegenrechnung. RAG heißt: erst nachschlagen, dann antworten. Und Deep Research spart dir Suchzeit, aber nicht die Prüfung.
In Teil 5 geht es um Ethik, Bias und den EU AI Act. Du wirst sehen: Auch Bias fängt oft bei den Daten an.
Weiter im Kurs
- LernpfadLerntage zum Nachklicken4 · Datenanalyse und Datenmanagement
- GlossarKI-Glossar mit 93 Begriffen
- Nächster TeilTeil 5: Ethik, Bias und der EU AI Act
ErikDir reicht Selbstlernen nicht? Dann lernst du das mit mir 1:1. Auf Wunsch bringe ich es auch Unternehmerinnen, Unternehmern und ganzen Teams bei. Schreib mir, was du brauchst.
Erstgespräch anfragen