lossy-vae — Training Monitor

Lauf: —    ■ refresh in 10:00

Takte: Status alle 10 min · Rekonstruktionsbogen alle 2 500 Schritte (≈ 18 min) · Konvergenzmessung bei jedem Checkpoint, alle 20 000 Schritte (≈ 2,5 h)

StepAuflösungBildvorlagenTemporecfflKLAktualisiert
————————

Rekonstruktion — aktueller Stand

obere Reihe Original, untere Reihe Rekonstruktion · Checkpoint — · Klick: groß

Noch kein Bild.


Konvergenz

2 000 zurückgehaltene Bilder, bei jedem Checkpoint neu gemessen · schwarz: PSNR (links) · grau: SSIM (rechts)

L1, PSNR und SSIM belohnen Glätte. Sie taugen zum Verfolgen des Fortschritts, nicht zum Beurteilen der Schärfe — dafür sind die Bilder da.


Verlauf

je Checkpoint ein Bogen · Klick: groß

Noch kein Verlauf.


Trainingsparameter

ParameterWert
ArchitekturKL-Autoencoder, f=8, 8 Latent-Kanäle (vorher 4) · ch 128, ch_mult 1/2/4/4
VerlustL1 + KL (1e-6) + Focal Frequency Loss (Gewicht 10) · kein Diskriminator · kein LPIPS
Warum kein GANzwei Läufe zerstört: Magenta-Blöcke ab 50k (disc_weight 0.5), weiße Ringe ab 70k (0.15). Ohne LPIPS lenkt nichts die Textur, die der Diskriminator fordert.
FrequenztermJiang et al., ICCV 2021 · reine FFT-Arithmetik, keine gelernten Gewichte · bestraft Unschärfe 6× härter als Rauschen (gemessen) · Ersatz für LPIPS (VGG/ImageNet), das wir aus Herkunftsgründen nicht verwenden
Daten4 776 810 ganze Bilder · megalith-cc0 (2 232 762) + PD12M (2 535 849) · keine Auswahl, kein Ästhetikfilter, kein Unschärfefilter
Zuschnittkurze Seite skaliert, dann Zufallscrop + Spiegelung · Validierung mittig
Holdout2 000 Bilder, nie im Training
Lernrate—
Batch—
GPURTX PRO 6000 Blackwell Max-Q · 96 GB · 300 W (leistungsbegrenzt)
Vorgeschichtealter VAE: 400 000 pd-extended-Crops, 4 Kanäle, 50k@256 + 20k@512 → Neubau ab 22.09.2026 auf ganzen Bildern beider Pools

http://lossy-vae.viewcount.org/ — aktualisiert sich alle 5 Minuten.   LOSSY-512