标签
《连线》杂志2026年最佳智能眼镜排行榜,涵盖 Meta、Viture、Even Realities 和 RayNeo 的型号,并附有各自的优缺点和规格。
一张图表根据2025年5月至2026年4月的估计网页访问量对前20个访问量最高的AI工具进行排名,显示ChatGPT以647亿次访问量占据主导地位,遥遥领先于Canva、Gemini等。该排名基于对9,531个AI工具的研究。
CNBC和Statista发布了2026年全球40家顶级金融科技公司的年度榜单,涵盖8个子垂直领域。
本文提出了一种以评分标准为导向的框架,用于评估和优化面向大语言模型的文档集,包括一个新的基准测试和一个无需训练的方法,该方法能提升下游生成性能。
本文提出了一种基于偏好的学习框架,用于抗体表达排序,将稀缺的定量数据与来自免疫序列的大规模弱正监督相结合。该方法通过引入联合掩码对数似然近似和基于IMGT的比对,将直接偏好优化(DPO)适配到蛋白质语言模型,从而在多样化的内部数据集上实现了改进的排序性能。
Kimi K3在Agent Arena排行榜上获得了与opus thinking同等的排名。
中国AI模型在OpenRouter上周和本周用量Top6中霸榜,其中腾讯混元3免费版排名第一,小米MiMo-V2.5和DeepSeek-V4-Flash分别位居前列,反映出国产模型在开源社区的影响力显著提升。
RUBRIC是一个与生成器无关的过滤框架,用于不平衡分类,通过平衡实况(通过判别器)和效用(基于边界的评分)来选择合成样本,在信用卡欺诈检测等基准上提高了F1宏观和召回率。
引入SALT,一个具有确定性真实标签的基准,用于在长文本生成中评估LLM在细粒度原子级别的不确定性。对超过50个LLM的分析揭示了关于置信函数、错误传播以及与推理权衡的见解。
一个基于Hugging Face下载量和点赞数的LLM排行榜,经过分组、筛选和时间平均,突出了Qwen和Gemma等最受欢迎的模型。
WIRED揭露,彼得·蒂尔旗下的私人俱乐部Dialog依据财富和声望,使用隐藏的A、B、C分级系统秘密对成员进行排名,追踪人际关系并运用算法管理出席和座位安排,依据一份泄露的包含近200位知名人士的数据档案。
OneRank提出了一种原生Transformer的多任务排序框架,该框架将特征编码与预测相结合,以减少任务间干扰并提升推荐系统中的排序性能。
本文提出Representation Curriculum (RC),一种训练时干预方法,通过分阶段利用特征来减少对曝光混杂历史信号的过度依赖,并改善排序系统中的冷启动泛化能力。该方法经过了理论分析,并在公开基准和大规模eBay搜索实验中得到了验证。
本文提出TOPSIS-RAD,这是TOPSIS方法的一种改进版本,引入了决策者定义的参考水平(VPL和DPL),以解决与偏好不一致、异常值敏感性和排名逆转等问题。
本文介绍了一种面向决策的生存分析学习方法,该方法通过NDCG优化将预测模型与后续分配决策对齐。应用于美国心脏移植数据后,排名性能提升了50-100%,每年可能带来数千额外生命年。
根据早期结果,Mixedbread 的重排序器在 OBLIQ-bench 上达到了 GPT 5.5 级别性能,同时速度快 27 倍。