Zum Inhalt springen

Daten & Wissen

Start7 · Daten & Wissen

Daten & Wissen – wie KI an dein Wissen kommt

Ein Modell kennt nur, was es im Training gesehen hat – dein Firmenwissen gehört nicht dazu. Diese Seite zeigt die Kette, mit der eigenes Wissen nutzbar wird: Datenablage → Embeddings → Vektor-Datenbank → RAG.

PHASE 1 · VORBEREITEN (einmalig / bei Änderungen) Deine Dokumente PDFs · Wiki · E-Mails aus Data Lake / DMS Zerlegen in Abschnitte („Chunks“) Embedding-Modell übersetzt Bedeutung in Zahlen-Vektoren [0.12, −0.87, …] Vektor-Datenbank speichert Vektoren + Textstellen findet Ähnliches blitzschnell Chroma · Qdrant · pgvector · Pinecone PHASE 2 · ANTWORTEN (bei jeder Frage, in Millisekunden) Frage: „Wie lang ist die Kündigungsfrist?“ Frage → Vektor gleiches Embedding- Modell wie oben Ähnlichkeits-Suche holt die 3–10 passendsten Textstellen („Retrieval“) LLM bekommt beides: Frage + gefundene Textstellen im Prompt („Augmented Generation“) → Antwort mit Quellenangabe ✓ Wissensbasis wird durchsucht Ergebnis: Das Modell antwortet mit deinem aktuellen Wissen — ohne neu trainiert zu werden, und mit zitierbaren Quellen.
Schaubild 8: RAG in zwei Phasen – oben die einmalige Vorbereitung (Dokumente → EmbeddingsVektor-DB), unten der Ablauf bei jeder Frage. „Retrieval-Augmented Generation“ = Erzeugen mit vorherigem Nachschlagen.

RAG Retrieval-Augmented Generation Antworten mit Nachschlagen

Die wichtigste Technik, um KI mit eigenem Wissen zu versorgen: passende Textstellen suchen (Retrieval), in den Prompt legen (Augmented), dann antworten lassen (Generation) – siehe Schaubild 8.

Vorteile
  • Eigenes, aktuelles Wissen nutzbar
  • Weniger Halluzinationen, Quellen zitierbar
  • Änderungen ohne Neutraining
Nachteile
  • Datenbasis muss gepflegt werden
  • Qualität steht & fällt mit der Suche
  • Mehr Tokens pro Anfrage
RAG — Retrieval-Augmented Generation — Antworten mit Nachschlagen: dein Wissen in die KI, ohne Training

Embedding Bedeutung als Zahlen-Vektor

Die Übersetzung von Text (oder Bildern) in einen Zahlen-Vektor, der die Bedeutung einfängt: Ähnliche Inhalte bekommen ähnliche Vektoren. „Urlaubsantrag“ und „Ferien beantragen“ landen nah beieinander – obwohl kein Wort übereinstimmt.

Analogie: Eine Landkarte der Bedeutungen: Jeder Text bekommt Koordinaten, verwandte Themen wohnen im selben Viertel.
Embedding — Bedeutung als Zahlen-Vektor — die Grundlage semantischer Suche

Vektor-Datenbank Vector Database Ähnlichkeits-Speicher

Eine Datenbank, die auf das Speichern und blitzschnelle Durchsuchen von Embeddings spezialisiert ist: „Gib mir die 5 ähnlichsten Einträge zu diesem Vektor“ – über Millionen Dokumente in Millisekunden.

Vektor-Datenbank — Der Ähnlichkeits-Speicher hinter RAG & Co.

Data Lake · Warehouse · Lakehouse Die großen Datenspeicher

Wo Unternehmensdaten wohnen, bevor KI sie nutzt: Der Data Lake („Datensee“) sammelt alles roh und unsortiert; das Data Warehouse („Datenlager“) hält geprüfte, strukturierte Daten für Auswertungen; das Lakehouse kombiniert beides.

Analogie: Lake = Dachboden (alles reinwerfen, billig, chaotisch) · Warehouse = Apotheker-Schrank (sortiert, beschriftet, teurer) · Lakehouse = Dachboden mit Regalsystem.
Data Lake · Data Warehouse · Lakehouse — Wo Unternehmensdaten wohnen, bevor KI sie nutzt
Die Kette im Kopf behalten: Rohdaten (Lake/Warehouse) → aufbereitet & zerlegt → als Embeddings in die Vektor-DB → per RAG ins Kontextfenster des Modells. So kommt „dein Wissen“ in die KI – ganz ohne Training.