标签
本文报告了Grok 4.6相对于4.5的性能退化,通过率降低且延迟增加,对实际业务任务产生了影响。
本文测试了由人类和前沿语言模型评定的消费科技产品感知属性,是否比上市年数更能预测普及率,结果发现虽有适度改进,但在短期预测方面存在局限。
本文提出一种新的非对称鲁棒有界稀疏平滑(aR)损失函数,用于l1范数惩罚的几何孪生支持向量机(aRSGTSVM),以处理带有标签噪声和特征噪声的分类与回归任务,实现特征选择并提高鲁棒性。在合成数据集、UCI数据集以及中国股市指数跟踪上的实验表明了其优越性。
本文介绍了TS2TabPFN,这是一个将显式特征提取与TabPFN 2.5表格基础模型相结合用于时间序列分类和外部回归的框架。实验表明,它在TSER任务上优于最先进的模型,并在TSC任务上取得了具有竞争力的结果。
本文系统比较了表格基础模型(TabPFN)与经典回归方法在85项土壤光谱任务中的表现,发现TabPFN结合PLSR衍生特征在从田间尺度到全球光谱库的预测性能上均达到最优。
本文研究了多种图神经网络消息传递层在回归场景中的效能,发现深度卷积GNN(尤其是GEN)的表现优于基于注意力机制的GNN。
本文评估了从 Gemini 3.5 Flash 升级至 3.6 Flash 的情况,指出整体基准测试有提升,但某些任务可能存在回归,并建议在升级前进行严格评估并预设失败门槛。
本文提出一种两阶段在线学习框架,通过对正常流量动态进行建模并分析残差,检测移动核心网中影响业务的故障,相比静态阈值取得了更优的精确率-召回率权衡。
本文对ESA的φ-lab开发的两个地理空间基础模型TerraMind和THOR进行了系统比较,分析了补丁大小和解码器类型等架构选择如何影响地球观测任务中十个用例的性能。
本文提出了一种轻量级方法,通过将连续目标离散化为区间,将基于回归的隐式神经表示训练重新表述为分类任务,从而在科学数据压缩中实现灵活的分布建模,用于误差感知的不确定性估计。
Zer0Fit 提供了一个MCP服务器,该服务器封装了Google的TabFM和TimesFM基础模型,用于零样本预测、分类和回归任务,完全在本地运行。
本文研究了OLS回归中的分布式草图化方法,该方法不是对整个数据集构建草图,而是基于分区子集构建,从而降低计算成本。作者刻画了平均估计量的精确超额损失,并表明当子集协方差散度较小时,该损失与全数据草图化的损失相当。
介绍了一种用于预测回归的高效贝叶斯深度集成方法,该方法结合了低维集成表示、闭式贝叶斯聚合和独立集成训练,以在保持计算效率的同时获得校准的不确定性估计。
Linux 7.0 移除了 PREEMPT_NONE 内核抢占模式,在特定配置下导致 PostgreSQL 基准测试性能下降,但大多数用户不会注意到这一变化。
较新的Anthropic模型(如Opus 4.8和Sonnet 5)在使用第三方编辑工具(例如Pi的工具)方面比旧模型更差,这可能是因为它们通过强化学习训练使用Claude Code的内置编辑工具,导致它们在工具调用中发明了额外的字段。
较新的Claude模型(Opus 4.8和Sonnet 5)在工具调用行为上表现更差,它们会在工具调用参数中发明额外的字段,导致验证失败,与旧模型相比是一种倒退。
第三方测试显示回归后的Fable 5模型在BridgeBench基准测试中性能大幅下降,Debugging得分从86.2降至25.9,Refactoring从73.6降至38.4,Hallucination从75.9降至61.7,推测是新增安全护栏导致许多任务转由Opus 4.8代打。
提出几何感知R结构KAN(GRS-KAN),一种将R函数集成到KAN中以编码几何和逻辑约束的混合神经架构,在含不连续性的回归基准上实现了高达67%的RMSE降低。