Tag
SimLoss uses embedding-space contrastive supervision to enable single-pass fine-grained image captioning that matches multi-stage quality at much lower latency, with variants like SimLoss FFT achieving high precision.
Introduces stationary representations learned via d-Simplex fixed classifiers to ensure model compatibility during sequential fine-tuning, enabling continuous retrieval services without reprocessing. Combines cross-entropy and contrastive losses to capture higher-order dependencies.