llm-ranking

Tag

Cards List
#llm-ranking

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

arXiv cs.AI · yesterday Cached

This paper compares natively multimodal embedding models (Gemini Embedding 2, Amazon Nova 2) against frontier LLMs (GPT-4.1, Claude Sonnet 4.6) for hard-negative text-to-image retrieval, finding comparable accuracy but much lower latency for embedding-based ranking.

0 favorites 0 likes
#llm-ranking

How come artificialanalysis.ai ranks Gemma4 above Qwen3.6 27b in SciCode

Reddit r/LocalLLaMA · 2026-08-06

A discussion about how Artificial Analysis ranks Gemma 4 above Qwen3.6 27b on the SciCode benchmark, questioning whether the ranking reflects real-world coding ability or reveals a benchmarking issue.

0 favorites 0 likes
#llm-ranking

The current state of language models and human preference based rankings [R]

Reddit r/MachineLearning · 2026-08-06

Max Planck Institute for Intelligent Systems has launched Comparity AI, a research platform for human preference-based LLM rankings that provides free access to frontier models and a personal leaderboard.

0 favorites 0 likes
← Back to home

Submit Feedback