💬 Chatbot-Intent-Klassifikator — TF-IDF-Ähnlichkeit live
Beobachten Sie live, wie ein echter TF-IDF-Vektorisierer und ein Kosinus-Ähnlichkeitsabgleich eine eingehende synthetische Benutzernachricht gegen eine Sammlung von Intent-Vorlagen bewerten und dabei laufend die am besten passende Absicht ermitteln, während Sie tippen.
Über diese Simulation
Dieser Simulator führt einen echten TF-IDF-Vektorisierer (Term-Frequenz, inverse Dokumenthäufigkeit) und einen Kosinus-Ähnlichkeitsabgleich vollständig im Browser aus — dieselbe Algorithmenfamilie, die leichtgewichtiges, erklärbares Intent-Routing bei Chatbots vor (oder neben) einem neuronalen Modell antreibt. Jede Intent-Vorlage — „Bestellstatus prüfen", „Rückerstattung anfordern", „Passwort zurücksetzen" und so weiter — wird als Dokument behandelt; der Wortschatz des Korpus und die IDF-Gewichte werden live aus diesen Dokumenten neu berechnet. Wenn Sie eine Nachricht eingeben oder den synthetischen Nachrichtenstrom abspielen lassen, wird die Nachricht tokenisiert, anhand derselben IDF-Tabelle gewichtet und mit jedem Intent-Vektor über echte Skalarprodukte und Vektornormen verglichen.
Das Hauptpanel zeigt drei Live-Ansichten: ein Rangdiagramm der Kosinus-Ähnlichkeitswerte über alle Absichten hinweg, eine 2D-PCA-Projektion jedes Intent-Vektors und des aktuellen Abfragevektors (berechnet mit echter Mittelwertzentrierung, Kovarianz und Potenziterations-Eigenvektoren — kein festes Layout) sowie ein Beitrags-Diagramm pro Begriff, das genau aufschlüsselt, welche gemeinsamen Wörter den Gewinner-Treffer ausgemacht haben. Die Konfidenzlücke zwischen den beiden besten Absichten ist ein echtes Maß dafür, wie eindeutig der Treffer ist: Eine kleine Lücke bedeutet, dass die Nachricht wirklich mehrdeutig zwischen zwei Vorlagen ist, nicht ein Darstellungsfehler.
Häufig gestellte Fragen
Wird die TF-IDF-Mathematik tatsächlich berechnet, oder ist es eine vorgefertigte Demo?
Sie wird live berechnet. Tokenisierung, Term-Dokument-Häufigkeitszählungen, die geglättete IDF-Formel ln((1+N)/(1+df))+1 und L2-normalisierte TF-IDF-Vektoren werden alle aus den aktuell im Korpus vorhandenen Intent-Vorlagen erstellt, einschließlich derer, die Sie selbst hinzufügen.
Wie wird das Vektorraum-Diagramm erzeugt?
Der TF-IDF-Vektor jeder Absicht (eine Dimension pro Vokabularbegriff) wird mittelwertzentriert, und die beiden obersten Eigenvektoren der resultierenden Kovarianzmatrix werden mit Potenziteration und Deflation gefunden — eine standardmäßige, echte Implementierung der Hauptkomponentenanalyse. Die 2D-Positionen sind die Projektionen jedes hochdimensionalen Vektors auf diese beiden Eigenvektoren.
Warum erhält eine unbekannte Nachricht manchmal für jede Absicht einen niedrigen Konfidenzwert?
Die Kosinus-Ähnlichkeit ist beschränkt und hängt vollständig vom gemeinsamen Vokabular ab. Wenn eine eingegebene Nachricht fast keine Wörter mit den Beispieläußerungen einer Absicht teilt, sind alle Ähnlichkeitswerte niedrig und die „Lücke zum Zweitbesten" schrumpft — ein zuverlässiges Signal, dass der Klassifikator unsicher ist, genau so, wie sich eine produktive TF-IDF-Baseline verhalten würde.
Was passiert, wenn ich eine neue Intent-Vorlage hinzufüge?
Der Wortschatz und die Dokumenthäufigkeits-Zählungen werden über alle Absichten hinweg (einschließlich der neuen) neu erstellt, wodurch sich die IDF-Gewichte jeder bestehenden Absicht leicht ändern. Alle Vektoren, die PCA-Projektion und die Ähnlichkeitswerte der aktuellen Abfrage werden dann gegen den neuen Korpus neu berechnet.
Beobachten Sie live, wie ein echter TF-IDF-Vektorisierer und ein Kosinus-Ähnlichkeitsabgleich eine eingehende synthetische Benutzernachricht gegen eine Sammlung von Intent-Vorlagen bewerten und dabei laufend die am besten passende Absicht ermitteln, während Sie tippen.
3D · Three.js / WebGL-Renderer · Ziel 60 FPS · läuft vollständig clientseitig, keine Installation nötig