Neuronales Netz
Einen kleinen Klassifikator trainieren, Training und Holdout vergleichen und ein echtes Gradientenupdate untersuchen.
About this tool
Modell. Zwei versteckte Schichten mit der gewählten Aktivierung führen zu einem Softmax-Ausgang mit zwei Klassen. Die Kreuzentropie verwendet natürliche Logarithmen und wird stabil aus Logits berechnet. Gewichte starten mit U(−√(2/fan-in), √(2/fan-in)), Biases bei null. Die fünf synthetischen Datensätze behalten ihre ursprünglichen Koordinaten und ihr Rauschen.
Training und Holdout. Jeder Datensatz hat 180 Punkte. Eine gesäte Mischung teilt je Klasse abgerundet 80 % dem Training und den Rest dem Holdout zu. Die Verluste sind getrennte mittlere Datenverluste, Trefferquoten die korrekten Anteile. Holdout-Beispiele gehen nie in SGD ein. Wer bei der Parameterwahl wiederholt Holdout-Ergebnisse betrachtet, schränkt deren Aussage als unabhängigen Generalisierungstest ein. Punktwolken enthält zwei Zentren der Klasse 0 und eines der Klasse 1.
Updates und Regularisierung. SGD zieht Trainingspunkte mit Zurücklegen. Ein Update pausiert und verarbeitet genau ein Beispiel; laufendes Training verwendet Pakete mit acht Updates. Das Ziel lautet mittlere Trainings-CE + λ[αΣ|w| + (1−α)Σw²]. Nur Gewichte werden regularisiert. α = 0 wählt quadriertes L2, α = 1 L1; sign(0) = 0 ist der gewählte L1-Subgradient. Lernrate 0 zählt Updates, ohne Gewichte zu ändern. Ein Paket wird erst übernommen, wenn Updates und beide Kennzahlengruppen endlich sind.
Inspektor. Ausgabe, Verlust und Gradientennormen des letzten Beispiels beziehen sich auf den Zustand vor seinem Update. Ein Gewicht zeigt Daten- und Regularisierungsgradient, Lernrate sowie tatsächliche Vorher-/Nachherwerte. Gewählt wird der größte absolute Gesamtgradient, bei Gleichstand lexikografisch. Die Hauptkennzahlen und die Wahrscheinlichkeitsgrafik zeigen den Zustand nach dem Paket.
Reproduzierbarkeit. Getrennte Zufallsströme steuern Daten, Initialisierung, Aufteilung und Beispielwahl. Zurücksetzen stellt das Anfangsmodell wieder her und pausiert. Jede Parameteränderung verwirft den Lauf; Eingabeentwürfe bleiben beim Navigieren erhalten. Verborgene Ansichten pausieren ohne Aufholen. Bei Bewegungsreduktion bereitet ein frischer Start ein pausiertes Anfangsmodell vor. Blau steht für Klasse 0, Rot für Klasse 1; Kreise/Dreiecke kennzeichnen Klassen, gefüllte/hohle Marker Training/Holdout. Alle Daten passen in die Modellachsen.
Referenz. Kreuzentropie aus Klassenlogits. Dieses Browsermodell verwendet den kleinen Netzkern des Repositorys.