标签
本文为次优势(极小极大)超度量发展了一套 ℓ0 型稳定性理论,证明了稀疏编辑仅通过最小生成树传播,并导出了变更超度量条目的 Hamming-Lipschitz 界。在深度嵌入图和聚类任务上的实验表明,所得结构评分作为脆弱性诊断具有实用价值。
本文引入了一个基于分布的框架,通过量化特征排名的可分离性并识别在随机运行中保持可靠的最大top-k排名,来衡量归因方法(解释器)的稳定性。
一篇反思性博客文章,驳斥了 Mac OS X Snow Leopard 是完美稳定且精良版本的神话,引用了作者自己的降级经历和其他批评,同时指出为什么“雪豹”版本的理念至今仍能引起共鸣。
Introduces CACHE-UK, a stability-aware memory editing framework for sequentially updating quantized LLMs in finance, reducing knowledge degradation on 4-bit OpenLLaMA-3B while improving generalization rates on a UK financial corpus.
本文测试了不同LLM系列在不同时间和界面上如何评估族裔民族主义伪科学,发现认知立场取决于部署配置而非稳定的模型属性,引发了关于认知问责性的关切。
Vellium v1.0.0 已发布,包括安全增强、壁纸主题、JSON 聊天导出以及桌面稳定性重大改进。
本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。
Bun,这个JavaScript运行时和工具链,正在从Zig重写为Rust,以提高内存安全性和稳定性,解决一系列use-after-free和内存泄漏错误。
Odin编程语言宣布将于2027年1月发布1.0版本(Odin 2027),并公布了完整规范、内联汇编、新标准库等路线图。
本文研究了大型语言模型在多选题问答(MCQA)任务中角色驱动生成的不稳定性,提出了三个衡量指标来评估模型族、模型规模和问题域的性能、结果和正确性稳定性。研究发现,不稳定性的变化具有一致性,数学和常识问题表现出更大的不稳定性,并且任务提示格式比其他超参数(如温度)引入了更多的不稳定性。
损失平滑在自适应过程中在源目标和目标目标之间进行插值,在保留有用特征的同时实现专门化。在监督偏移、强化学习和语言模型微调中的实验显示一致的改进。
循环Transformer通过直接在架构中设计递归来实现内部推理,避免思维链必须通过生成离散token来模拟迭代的低效性,最新研究表明它在多跳推理上表现出色,并可通过稳定技术和自适应递归进一步提升。
BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。
本文建模了多智能体LLM系统中延迟验证的影响,揭示了延迟校正会破坏共识稳定并引发振荡。它推导出闭式稳定性阈值,并提供了一种用于最优校正器放置的贪心近似算法,在五个开放模型上的实验验证了该结果。
来自Qwen背后的阿里巴巴团队的GEOALIGN指出,LLM强化学习中的不稳定性通常源于少数不良的rollout导致更新方向冲突,并提出了一种基于方向一致性来筛选rollout的轻量级方法,从而提升训练稳定性和性能。
本文系统研究了常见变异来源下,大型语言模型评估中提示排名的稳定性,发现表现最佳的提示经常发生变化。为此,提出了一种基于下置信界的稳定性感知选择策略,以提高鲁棒性。
文章介绍了BeefAPI作为AI API中转服务的实际使用体验,强调了其稳定性、副模型一键配置、额度计算器等功能,并提及端午节优惠活动。
本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。
GHC团队概述了使GHC升级更简单的进展,重点关注Big Stability Goal和Base Package Goal,以将基础包从编译器发布中解耦。