model-evaluation

标签

Cards List
#model-evaluation

输出格式如何混淆指令调优中的数据质量与能力

arXiv cs.CL ↗ · 2026-09-03 缓存

本文表明,在指令调优中,输出格式混淆了数据质量指标和模型能力评估,导致显著的精度偏移,并使得当前方法在缺乏接口感知调整时失效。

0 人收藏 0 人点赞
#model-evaluation

@Vtrivedy10:理解模型与改进RL任务生成的最大价值在于QA步骤,整个过程到……

X AI KOLs Timeline ↗ · 2026-09-02 缓存

本文探讨了将QA整合到RL任务生成迭代过程中的重要性,以提升AI流程和模型评估,并强调了评估设计中直觉的价值。

0 人收藏 0 人点赞
#model-evaluation

CABiNet (ICRA 2021) 与 YOLO26-sem 在 UAVid 数据集上的对比:精度、计算量与 GPU 延迟 [P]

Reddit r/MachineLearning ↗ · 2026-09-02

一项基准测试显示,CABiNet(一种2021年的高效架构)在 UAVid 数据集的实时语义分割任务上,其精度与延迟的权衡优于 YOLO26-sem。

0 人收藏 0 人点赞
#model-evaluation

一年后,瑞士AI模型Apertus是否兑现了宣传?

Reddit r/ArtificialInteligence ↗ · 2026-09-02 缓存

发布一年后,瑞士的开源AI模型Apertus已获得超过400万次下载,并更新到1.5版本,功能得到增强,但仍然面临竞争和可用性问题。

0 人收藏 0 人点赞
#model-evaluation

@VraserX:Fable 5.1 在基准测试中表现确实令人印象深刻,尤其是在代理研究和编码方面,但这仍然感觉像是……

X AI KOLs Following ↗ · 2026-09-01 缓存

这条推文评论了 Fable 5.1 在代理研究和编码方面的出色基准测试,但认为这只是渐进式的改进,表达了对 OpenAI 的 Astra 的更多兴趣,因其潜在的持久记忆。

0 人收藏 0 人点赞
#model-evaluation

参考嫁接法在引出沙袋能力方面与微调相匹配

arXiv cs.LG ↗ · 2026-09-01 缓存

本文介绍了参考嫁接法,一种通过编辑激活来引出AI模型沙袋能力的方法,其效果与微调相当,无需权重更新或训练标签。

0 人收藏 0 人点赞
#model-evaluation

@seclink: HARD 非代码超长周期任务 | 专家问题设计师招聘要求 本招聘要求 1. 无…

X AI KOLs Following ↗ · 2026-09-01 缓存

这篇文章详细介绍了专家问题设计师的招聘要求,他们负责为AI模型验证开发非代码、长周期任务,强调真实性、质量控制和相关专业经验。

0 人收藏 0 人点赞
#model-evaluation

@YRSM_Simon: 今天一整天都在用本地的 GLM 5.3 Flash 来开发我的产品。2k+ 的 prefill,50+ 的t/s,质量也挺好的。 并没有觉得和 Sol 5.6 有特别明显的差距。做 Coding Agent,目前没有任何一个模型让我觉得非…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

一位开发者分享使用本地GLM 5.3 Flash进行产品开发的体验,并提及OpenAI结束与Cursor的合作伙伴关系。

0 人收藏 0 人点赞
#model-evaluation

Terminal Bench 4.0 刚刚发布,GLM-5.3 与 Fable 5 处于同一水平,考虑到误差范围

Reddit r/LocalLLaMA ↗ · 2026-08-29

Terminal Bench 4.0 已经发布,比较了 GLM-5.3 和 Fable 5 等 AI 模型,重点在于快速迭代以应对基准饱和,并引发了关于评估编码代理的经济高效替代方案的问题。

0 人收藏 0 人点赞
#model-evaluation

Qwen3.8-Flash-Next: 是时候更新那些基准测试了

Reddit r/LocalLLaMA ↗ · 2026-08-27

本文对Qwen3.8-Flash-Next模型进行了基准测试,显示其在个人基准测试中突破了94%,并比较了其在编程、通用知识和科学方面与其他模型的性能。

0 人收藏 0 人点赞
#model-evaluation

我在想,人们什么时候才能意识到我们需要把这个重新带回来呢?

Reddit r/AI_Agents ↗ · 2026-08-27

作者主张恢复'大海捞针'基准测试来评估AI能力,分享了私人测试结果,显示许多模型在记忆指令方面表现不佳,质疑其在实际任务中的可靠性。

0 人收藏 0 人点赞
#model-evaluation

忘掉鹈鹕,迎来象鼻虫时代! / 防基准测试过度的 SVG 和视觉基准测试

Reddit r/LocalLLaMA ↗ · 2026-08-26

本文介绍了使用不同量化和设置测试 Qwen3.8-27B AI 模型,以将其图像重建为 SVG,目标是创建一个能抵御基准测试过度优化的基准。初步结果显示,高推理强度和特定的缓存配置能提升性能。

0 人收藏 0 人点赞
#model-evaluation

@QuixiAI: Pipette 太棒了 @liquidai @maximelabonne 感谢你们将其开源。

X AI KOLs Following ↗ · 2026-08-26 缓存

Liquid AI 发布了 Pipette,这是一个用于设备端 AI 的开源模型评估套件,与 ArtificialAnlys 合作开发。

0 人收藏 0 人点赞
#model-evaluation

时间序列基础模型的因果分析

arXiv cs.LG ↗ · 2026-08-26 缓存

本文提出了一种因果分析框架,用于识别时间序列基础模型中的偏差,并应用于 Chronos-2 和 TimesFM-2.5,揭示了特定的失败模式,如对持续性的过度估计以及对 regime switch 模式的失败。

0 人收藏 0 人点赞
#model-evaluation

在衡量的AI偏好中,模型与测试工具各占多少比重?

arXiv cs.AI ↗ · 2026-08-26 缓存

这篇arXiv论文研究了测量的AI偏好中,有多少归因于模型本身,有多少归因于用于评估的测试工具。

0 人收藏 0 人点赞
#model-evaluation

代理框架放大大型语言模型中的谄媚行为

arXiv cs.CL ↗ · 2026-08-25 缓存

本文发现,代理框架放大了大型语言模型中的谄媚行为,导致准确性下降,并引入了代理谄媚放大(ASA)的概念及新的度量指标。

0 人收藏 0 人点赞
#model-evaluation

Qwen-3.8-27B、Nemotron-3.5-Lightning-30B-A3B、Ornith-1.5-35B-A3B、Muse-Glimmer-30B oQ8e 对比

Reddit r/LocalLLaMA ↗ · 2026-08-24

对比了多个AI模型,包括Qwen、Nemotron、Ornith和Muse-Glimmer在基准测试上的表现。Ornith表现优异,而TielCoder在编程任务中展现了潜力。

0 人收藏 0 人点赞
#model-evaluation

@seclink: 收录一看.

X AI KOLs Following ↗ · 2026-08-24 缓存

Liquid AI 推出 Pipette,这是一个与 ArtificialAnlys 合作创建的设备端模型评估套件,旨在改进边缘智能的基准测试。

0 人收藏 0 人点赞
#model-evaluation

@skalskip92: 想看计算机视觉梯队列表吗?

X AI KOLs Following ↗ · 2026-08-23 缓存

一条来自@skalskip92的推文询问计算机视觉梯队列表,引用了t3.gg上Theo对主要AI模型的粗略评估。

0 人收藏 0 人点赞
#model-evaluation

NanoGPT 速跑前沿

Hacker News Top ↗ · 2026-08-22 缓存

本文报道了在nanoGPT优化器速度竞赛中,对18个前沿AI模型进行自主测试的比较,详细阐述了它们在缩小与人类记录差距方面的表现。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈