performance-degradation

标签

Cards List
#performance-degradation

大型AI企业实验室提供的模型,按FTC定义构成欺诈

Reddit r/ArtificialInteligence · 昨天

文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。

0 人收藏 0 人点赞
#performance-degradation

你的智能体在长时间会话中表现会下降

Reddit r/AI_Agents · 2026-06-29

本文讨论了AI智能体在长会话中性能下降的问题,原因是上下文窗口被原始历史、工具输出和重复推理所充斥,并提出了通过总结旧轮次和修剪工具输出来延长有效运行长度的解决方案。

0 人收藏 0 人点赞
#performance-degradation

Pigeonholing:不良提示导致模型崩溃并犯错

arXiv cs.CL · 2026-06-24 缓存

本文介绍了“Pigeonholing”这一现象,即不良提示导致大语言模型崩溃并重复错误,造成38-40%的性能下降。跨越10个任务和10个模型的实验表明,随着对话轮次增加,问题恶化,并提出了结合合成错误的RLVR作为缓解措施。

0 人收藏 0 人点赞
#performance-degradation

@sairahul1: https://x.com/sairahul1/status/2067171101978071501

X AI KOLs Timeline · 2026-06-17 缓存

本帖子全面介绍了AI代理的上下文工程技术,阐述了上下文管理对代理性能的关键作用,以及如何优化Token使用以避免性能退化。

0 人收藏 0 人点赞
#performance-degradation

LLM作为噪声通道:模型容量与缩放定律的香农视角

Hugging Face Daily Papers · 2026-05-22 缓存

该论文提出了一种香农缩放定律,将LLM训练建模为通过噪声通道的信息传输,解释了灾难性过训练和量化退化等非单调性能现象,并展示了相比传统缩放定律更优越的预测精度。

0 人收藏 0 人点赞
#performance-degradation

技能库漂移:诊断与修复自进化LLM技能库中的隐性故障模式

arXiv cs.AI · 2026-05-20

本文识别了'技能库漂移'作为自进化LLM技能库中的一种隐性故障模式,其中无限制的技能积累导致检索退化与性能停滞。它提供了踪迹级诊断及经过验证的治理方案,将MBPP+ hard-100上的pass@1从0.258提升至0.584。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈