model-evaluation

标签

Cards List
#model-evaluation

LLM压缩的非对称危害

arXiv cs.CL ↗ · 2026-08-21 缓存

本文系统评估了LLM压缩方法,并揭示了非对称危害,例如头部知识的不成比例损失和错误答案的置信度增加,这些被标准聚合指标所掩盖。

0 人收藏 0 人点赞
#model-evaluation

棉花糖 AI 基准测试

Reddit r/singularity ↗ · 2026-08-21

一项基准测试通过提示 AI 模型在图像中数棉花糖来评估它们,结果从 472 到 539 个不等。

0 人收藏 0 人点赞
#model-evaluation

Qwen 3.8 进入大学。ACT 得分 34

Reddit r/AI_Agents ↗ · 2026-08-20

一项实验测试了 Qwen 3.8 27B AI 模型在使用视觉能力进行 ACT 模拟考试时的表现,取得了 34-36 分的高综合分,展示了在标准化测试中的强大性能。

0 人收藏 0 人点赞
#model-evaluation

量化ASR模型中的基准优化

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。

0 人收藏 0 人点赞
#model-evaluation

流体模拟 Qwen3.8 27B IQ3_XXS

Reddit r/LocalLLaMA ↗ · 2026-08-19

作者在流体模拟任务上测试了 Qwen3.8 27B 模型,通过迭代提示取得了成功,并分享了实现过程,包括跟踪记录和 GitHub 仓库。

0 人收藏 0 人点赞
#model-evaluation

我是不是哪里做错了?Qwen 3.8 27B 在代理式编程中似乎毫无用处

Reddit r/LocalLLaMA ↗ · 2026-08-19

一位用户报告在使用 Qwen 3.8 27B 模型进行代理式编程任务时遇到困难,指出与其他模型相比效率低下和错误,并寻求关于潜在设置问题的建议。

0 人收藏 0 人点赞
#model-evaluation

思考的代价:推理努力作为模型特定的API契约

arXiv cs.AI ↗ · 2026-08-19 缓存

本论文研究了AI模型API契约中推理努力参数的影响,基于对Sonnet 5的实验,表明显式高努力导致更高成本,而未检测到准确性提升。

0 人收藏 0 人点赞
#model-evaluation

GLM5.3 Artificial Analysis 基准测试

Reddit r/LocalLLaMA ↗ · 2026-08-18 缓存

本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。

0 人收藏 0 人点赞
#model-evaluation

Rippling的2100次评分运行实验与Stripe OpenRouter 70亿美元交易的对比

Reddit r/AI_Agents ↗ · 2026-08-18

Rippling对15个AI模型在工资单任务上进行了基准测试,发现Anthropic的Opus 4.6表现最佳,但失败率为9%,同时Stripe以70亿美元收购了OpenRouter,以帮助开发者选择AI模型。

0 人收藏 0 人点赞
#model-evaluation

本地 Qwen 3.8 27B 对比 GPT-5.6 Terra 与 Grok 4.6

Reddit r/artificial ↗ · 2026-08-18

本文对比了三个AI模型——Qwen 3.8 27B、GPT-5.6 Terra和Grok 4.6——在构建Three.js香水发布网站方面的能力,详细阐述了它们的实施优势和潜在问题。

0 人收藏 0 人点赞
#model-evaluation

针对单一模型设防,对下一个开放:法律多项选择基准中的仅选项可解性

arXiv cs.CL ↗ · 2026-08-18 缓存

本文证明法律多项选择基准易受仅选项可解性影响,即模型无需题目即可正确作答,并且基于单一模型性能的过滤并不能提高对其他模型的有效性。

0 人收藏 0 人点赞
#model-evaluation

HarmProfile:刻画前沿LLMs中的有害分布

arXiv cs.CL ↗ · 2026-08-18 缓存

HarmProfile是一个基准数据集,用于分析前沿LLMs的有害输出,涵盖超过80,000个生成内容,跨23个模型和15个有害类别,以定义模型风险配置文件。

0 人收藏 0 人点赞
#model-evaluation

dig.bench(网站)

TLDR AI ↗ · 2026-08-18 缓存

dig.bench 是一个基准,用于评估 AI 模型在文本游戏中发现未知规则的能力,通过 70 个交互式游戏和一个比较前沿模型的排行榜来衡量科学发现能力。

0 人收藏 0 人点赞
#model-evaluation

Qwen3.8 vs Qwen3.6 vs Gemma 4 在24GB GPU上的对比(阅读时长约10分钟)

TLDR AI ↗ · 2026-08-18 缓存

本文在24GB GPU上对Qwen3.8-27B、Qwen3.6-27B和Gemma 4 31B的性能进行了基准测试和比较,推荐Qwen3.8-27B作为大多数用户的最佳默认选择,因其具备更优的编码和推理能力。

0 人收藏 0 人点赞
#model-evaluation

@reach_vb: GPT-5.6 Luna Max在DeepSWE v1.1测试中比Sonnet 5 Max高出13.3分,而Sonnet的成本是其44倍。DeepSWE测试co…

X AI KOLs Following ↗ · 2026-08-16 缓存

GPT-5.6 Luna Max在DeepSWE v1.1编码基准测试中以更低的成本优于Sonnet 5 Max,并且与Gemini 3.7 Flash Medium相比也表现出强劲性能。

0 人收藏 0 人点赞
#model-evaluation

Qwen3.8-27B FP8抹除版本:拒绝率从64–99%降至0–6%,且MMLU/GSM8K变化不超过1.3分

Reddit r/LocalLLaMA ↗ · 2026-08-16

本文评估了抹除处理后的Qwen3.8-27B FP8 AI模型,结果显示其拒绝率从64-99%大幅下降到0-6%,而MMLU和GSM8K等性能指标变化微小,仅作为红队测试材料公开。

0 人收藏 0 人点赞
#model-evaluation

@no_stp_on_snek: 我测量过的最佳完整度。它还会给你命令来清除泄露API密钥的git历史记录并…

X AI KOLs Following ↗ · 2026-08-15 缓存

一条推文强调,在Qwen3.8 AI模型上最大化推理设置会降低其完整性,导致其提供虚假命令,并建议使用特定的提示来解决这个问题。

0 人收藏 0 人点赞
#model-evaluation

Qwen3.8 27B vs Qwen3.6 27B vs Qwen3.5 27B,代际间在单次提示能力上的轻微提升。

Reddit r/LocalLLaMA ↗ · 2026-08-15

对Qwen 27B模型跨代比较显示单次提示能力有轻微提升,平均评分从2.46提高到3.00。

0 人收藏 0 人点赞
#model-evaluation

@rohanpaul_ai:Meta的新论文,危险的失败模式不仅仅是错误的裁判,而是正确的裁判可以被说服成为……

X AI KOLs Timeline ↗ · 2026-08-15 缓存

Meta的新论文表明,在适应性攻击下,对抗性LLM能够在62–91%的案例中说服裁判模型改变决策,这通常会使判断恶化,并对AI代理系统构成实际风险。

0 人收藏 0 人点赞
#model-evaluation

@no_stp_on_snek: 在X上进行的5.5小时直播测试。文章总结要点。节省你的时间,去看看非官方使用说明…

X AI KOLs Following ↗ · 2026-08-14 缓存

一条推文总结了在X上进行的5.5小时直播测试,重点关注Qwen3.8 AI模型,其中最大推理设置导致说谎行为,同时强调其强大的完整性支柱。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈