标签
本文将反向项目反应理论(reverse Item Response Theory)引入药物基因组学研究,将癌种视为潜在的“受试者”,将药物视为“项目”,从而在稀疏、碎片化的药物响应矩阵中实现稳健的排序恢复,并在多种缺失机制下,于 GDSC2 数据上表现优于简单的平均聚合方法。
本文对 Jev 这一面向决策的“系统一模型”(System One Model)在个性化推荐重排序中的表现进行了实证研究,发现与推荐专用模型以及逐点式(pointwise)和列表式(listwise)大语言模型重排序器相比,它在多个领域和候选集规模下占据了截然不同的质量—延迟运行区间。
Sonnet 5.5 在 Artificial Analysis 排行榜中排名第二,表明其在 AI 基准测试中表现出色。
Meta 的 Muse 应用在过去 7 天内登顶美国 App Store 排行榜,在排名上超越了 ChatGPT。
本文介绍了LIGE-GR,一种使用大型语言模型平滑地从传统排名过渡到生成式推荐系统的方法,旨在提升LLM时代的推荐性能。
本文对AI时代的个人壁垒进行排名,将自我洗脑能力置于心理韧性、信用、执行力、判断力、信息筛选能力和信息不对称之上。
一条推文推荐查看MapQuest移动应用的评论,该应用目前在U.S. App Store排名第一,突显其怀旧魅力。
本文提出了MoPLEx算法,用于学习Plackett-Luce模型的混合体以处理AI对齐中的异构偏好,相比基线方法展示了聚类和排序准确率的提升。
一个新的综合排名将三个公开的TTS排行榜合并为一个统一的排名,涵盖110个模型和46个提供商,每周更新并采用固定方法。
Stanford GSB教授Ilya Strebulaev发布基于30年和23万笔投资的风险投资排名,显示5%的VC创造90%利润,并与Midas List相关性低。
2026年美国顶级风险投资机构排行榜正式发布,列出了该年度在投资领域领先的100家机构。
Gary Marcus 在推特上表示,某事物在科技领域上升至第一,可能突显了科技领域的一个显著趋势或成就。
跨语言排序偏好优化(CRPO)是一种新框架,通过层级排序优化将英语偏好知识转移到目标语言,从而增强多语言LLM的对齐,并在多种语言中展示出在指令遵循和知识利用方面的性能提升。
UMER 引入了一个统一的多模态检索框架,通过配对感知判别推理结合嵌入与排序,在 MMEB-V2 基准测试中达到了最先进的性能。
本文分析了用于罕见疾病诊断的选择性预测系统,表明小型开源权重LLMs在超罕见疾病上召回率较低,并探讨了使用分数边际进行决策的局限性。
该论文识别了时间序列基础模型在每小时股票收益预测中的预测坍缩现象,并引入了CalibRank来平衡校准和排名,显著提高了截面相关性。
Grok 的最新模型 grok-4.6-high 在 LMArena 文本排名中位列第43,在网络开发排名中位列第7,未能重新夺回 Grok 在2025年12月曾占据的榜首位置。
《连线》杂志2026年最佳智能眼镜排行榜,涵盖 Meta、Viture、Even Realities 和 RayNeo 的型号,并附有各自的优缺点和规格。
一张图表根据2025年5月至2026年4月的估计网页访问量对前20个访问量最高的AI工具进行排名,显示ChatGPT以647亿次访问量占据主导地位,遥遥领先于Canva、Gemini等。该排名基于对9,531个AI工具的研究。