
Automatisierte Textklassifizierung Wie man Dokumente, Tickets und Nachrichten mit überwachtem Lernen automatisch kategorisiert
By Sloane GarrettLength7h 40m
About this audiobook
Du sitzt vor einem Berg unklassifizierter Support-Tickets. Dein Team hat aufgegeben. Der Feierabend ist um 22 Uhr vorbei. Das war 2019 — und genau dort begann die Reise, die zu diesem Buch führte.
Automatisierte Textklassifizierung ist keine theoretische Abhandlung. Es ist die Essenz dessen, was funktioniert, wenn echte Daten auf den Tisch kommen: chaotisch, unvollständig, mit Tippfehlern in den Labels. Kein Proof-of-Concept, kein Spielzeug — sondern ein System, das in Produktion läuft und deine Nächte rettet.
Die meisten Tutorials sagen: „Nimm BERT, fertig." Die Papers behaupten, Textklassifizierung sei ein gelöstes Problem. In der Praxis scheitern Projekte an der Encoding-Frage, verlieren sich in Hyperparameter-Optimierung mit dreißig handgelabelten Beispielen oder bauen neuronale Netze, die ein simpler linearer Klassifikator mit TF-IDF auf einem Raspberry Pi schlägt.
Dieses Buch zeigt den direkten Weg von rohen Textdaten zu einer produktionsreifen Klassifizierung. Du lernst, wie du Texte lädst und bereinigst — auch wenn sie aus 17 Quellen kommen und in drei Encoding-Formaten vorliegen. Du extrahierst Merkmale von einfachen Wortzählungen bis zu TF-IDF-Vektorisierung, ohne dass dir jemand erklären muss, was eine Sparse-Matrix ist. Du trainierst Klassifikationsmodelle mit Methoden, die auf realen Datensätzen funktionieren — nicht auf „Iris" oder „MNIST". Du evaluierst und vergleichst Modelle mit Metriken, die deinem Chef zeigen, warum dein System besser ist als der Praktikant, der bisher die Tickets sortiert hat. Und du bringst das Ganze in Produktion — als API, Batch-Job oder integriertes Feature in deiner bestehenden Anwendung.
Jedes Kapitel enthält ausführbaren Code, echte Beispiele und Übungen, die du in 20–30 Minuten lösen kannst. Wir arbeiten mit Python, scikit-learn, spaCy und Hugging Face Transformers — Tools, die sich in tausenden Produktionssystemen bewährt haben.
Du brauchst keine Mathematik jenseits von Schulniveau. Kein tiefes Verständnis von linearer Algebra. Kein GPU-Cluster. Nur Python-Grundlagen, einen Rechner mit 8 GB RAM und ein konkretes Problem, das automatisch gelöst werden muss.
Audiobook details
GenreTechnology
Length7 hrs 40 mins
Narrated byListen with 1,000+ voices
FormateBook with Audio
LanguageEnglish
Table of contents
1Vorwort
2Warum ich dieses Buch schreibe
3Für wen ist dieses Buch?
4Was dich erwartet
5Meine Versprechen an dich
Show all chaptersShow less
6Ein Wort zu den Technologien
7Danksagung
8Für wen dieses Buch ist
9Für wen dieses Buch ist
10Wer du bist
11Was du mitbringen solltest
12Was du lernen wirst
13Was dieses Buch nicht ist
14Wie du dieses Buch lesen solltest
15Los geht’s
16Was Sie brauchen
17Was Sie brauchen
18Technische Voraussetzungen
19Hardware – was brauchst du wirklich?
20Daten – woher nehmen?
21Was du mitbringen solltest – und was nicht
22Arbeitsumgebung
23Ein letzter Hinweis
24Kapitel 1 — Einführung in die Textklassifizierung
25Was ist Textklassifizierung?
26Überwachtes Lernen verstehen
27Erste Schritte mit Python und scikit-learn
28Zusammenfassung
29Kapitel 2 — Datenaufbereitung für Textklassifizierung
30Datenquellen und Formate
31Textbereinigung mit regulären Ausdrücken
32Trainings- und Testaufteilung
33Zusammenfassung und nächste Schritte
34Kapitel 3 — Merkmalsextraktion: Bag-of-Words und TF-IDF
35Bag-of-Words-Modell
36TF-IDF-Gewichtung
37Stoppwörter und N-Gramme
38Zusammenfassung und Ausblick
39Kapitel 4 — Klassifikationsalgorithmen: Naive Bayes und Logistische Regression
40Naive Bayes für Text
41Logistische Regression
42Modellvergleich und Entscheidungsgrenzen
43Zusammenfassung und Entscheidungshilfe
44Kapitel 5 — Evaluierung und Metriken
45Konfusionsmatrix
46Precision, Recall, F1-Score
47Kreuzvalidierung
48Zusammenfassung und nächste Schritte
49Kapitel 6 — Support Vector Machines für Text
50Lineare SVMs trainieren und interpretieren