标签
本文提出了一种基于注意力分散的无监督指标,用于检测大型语言模型中的幻觉,在使用Qwen2.5模型家族的数学推理基准测试中显示出显著的AUC提升。
分布式LLM推理框架ShardFlow通过推测解码与CUDA图缓解WAN延迟,在云区域间对Qwen2.5-7B实现28 TPS。
Comrade-7B是一款经过微调的Qwen2.5模型,专为多语言效率和多功能性设计,支持俄语、英语和中文。