model-evaluation

标签

Cards List
#model-evaluation

@omarsar0: 一个27B代理在预留研究复制任务中击败了Claude Opus 4.8和GPT-5.5。Replica将论文复制转化为……

X AI KOLs Following ↗ · 2026-08-14 缓存

一个名为Faraday的27B参数AI科学家代理通过使用一种名为Replica的可扩展强化学习方法,在论文复制任务上超越了Claude Opus 4.8和GPT-5.5。

0 人收藏 0 人点赞
#model-evaluation

@no_stp_on_snek: Qwen3.8 lands in tomorrw, so I went back and finished the 3.6-27B card first. No point measuring a successor against a …

X AI KOLs Following ↗ · 2026-08-13 缓存

The author presents an off-label evaluation card for Qwen3.6-27B, covering quantization, reasoning mode effects, bias probes, and jailbreak resistance, and compares reasoning effects with Nemotron 3.5 Lightning, finding that thinking mode is net-negative for Qwen but positive for Nemotron.

0 人收藏 0 人点赞
#model-evaluation

Certifying What Helps Customer-Return Timing: A Screen-and-Confirm Test for Conditioning Signals, and Why Decay Is Nearly Enough

arXiv cs.LG ↗ · 2026-08-13 缓存

This paper introduces a screen-and-confirm protocol to certify whether conditioning signals improve temporal point process models of customer return timing, finding that continuous-time decay is nearly sufficient and added conditioning is redundant or harmful.

0 人收藏 0 人点赞
#model-evaluation

看到了那个用玫瑰花瓣讲归纳法的段子在流传。这是古德曼那个古老的“grue”问题的一个变体:你见过的每一颗祖母绿都是绿色的。那规则是“绿色”,还是“grue”——意思是直到某个日期之前是绿色,之后是蓝色?两种规则都符合你的所有观察。没有任何东西

Reddit r/AI_Agents ↗ · 2026-08-11

文章讨论了古德曼的“grue”问题如何适用于生产环境中的AI智能体:在历史数据上表现完美并不能保证在未来数据上的正确性,而且更多数据也无法解决这种根本性的歧义。

0 人收藏 0 人点赞
#model-evaluation

标题很难

Reddit r/singularity ↗ · 2026-08-08

精选链接,指向近期关于模型评估期间AI安全事件的报告,包括一起OpenAI/Hugging Face事件、Anthropic的网络安全评估,以及英国AISI关于未经授权的智能体行为的报告。

0 人收藏 0 人点赞
#model-evaluation

@gdb:对我们下一个主要模型Astra的评估表明,在智能体编码和网络安全方面有显著的能力提升……

X AI KOLs Following ↗ · 2026-08-07 缓存

OpenAI的下一代主要模型Astra在智能体编码和网络安全方面展现出显著的能力提升,并且根据《准备框架》被视为网络安全领域的“关键”模型,计划实施额外的控制措施。

0 人收藏 0 人点赞
#model-evaluation

@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……

X AI KOLs Timeline ↗ · 2026-08-07 缓存

一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。

0 人收藏 0 人点赞
#model-evaluation

我测试了32个模型的提取能力,结果令人惊讶

Reddit r/AI_Agents ↗ · 2026-08-06

一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。

0 人收藏 0 人点赞
#model-evaluation

我将 GPT 5.6、Opus 5 和 minimax-M3 放入同一个模拟世界中经营餐馆。它们都以同样的 3 种方式失败。

Reddit r/AI_Agents ↗ · 2026-08-05

一位开发者描述了在模拟餐馆世界中运行 AI 智能体的经历,发现尽管模型和框架各不相同,但同样的三个与 API 相关的错误占主导地位:猜测不存在的端点、超出预算、以及基于过时的 ID 进行操作。展示了即使修复系统后,失败模式依然持续存在。

0 人收藏 0 人点赞
#model-evaluation

核查问题:AI在受监管企业上线前必须满足什么条件

arXiv cs.CL ↗ · 2026-08-03 缓存

本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。

0 人收藏 0 人点赞
#model-evaluation

@googledevs: Agent and Model Evaluations in Gemini Enterprise Agent Platform are now Generally Available (GA)! Measure, test, and mo…

X AI KOLs Following ↗ · 2026-07-31 缓存

Google announces GA of Agent and Model Evaluations in Gemini Enterprise Agent Platform, enabling consistent measurement and monitoring of AI agents in dev and production with pre-built metrics, adaptive rubrics, simulators, and online monitors.

0 人收藏 0 人点赞
#model-evaluation

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL ↗ · 2026-07-31 缓存

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

0 人收藏 0 人点赞
#model-evaluation

基准测试上25%的差异——只是运行方式的一个错误😬

Reddit r/AI_Agents ↗ · 2026-07-30

讨论了ARC-AGI上25%的差异如何由测试框架设置导致,显示GPT-5.6 Sol在正确评估下得分38%,并批评了行业内天真的基准测试报告方式。

0 人收藏 0 人点赞
#model-evaluation

@LangChain: Brand new Max Agency with @cognition President @russelljkaplan + @hwchase17. YouTube: https://youtu.be/bBUotstDLdk?si=F…

X AI KOLs Timeline ↗ · 2026-07-30 缓存

Cognition 总裁 Russell Kaplan 在访谈中回顾编码代理 Devon 的发展,讨论模型智能饱和、成本优化,并介绍新评估 Frontier Code 如何衡量代码可合并性。

0 人收藏 0 人点赞
#model-evaluation

为何通过所有评估的智能体在真实生产流量下仍会漂移

Reddit r/ArtificialInteligence ↗ · 2026-07-29

AI智能体在通过评估后常因分布偏移和上游变更在生产环境中漂移;持续评估和实时监控可缓解此问题。

0 人收藏 0 人点赞
#model-evaluation

大家都在争论新模型是否更差,真正的问题在于没人能回答

Reddit r/AI_Agents ↗ · 2026-07-28

文章强调了关于新AI模型是否实际上比以前更差的激烈争论,指出真正的问题在于缺乏可靠的评估方法。

0 人收藏 0 人点赞
#model-evaluation

)

TLDR AI ↗ · 2026-07-28 缓存

Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。

0 人收藏 0 人点赞
#model-evaluation

Qwen 3.6 27B 的量化是否会破坏 pelican?

Reddit r/LocalLLaMA ↗ · 2026-07-27 缓存

本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。

0 人收藏 0 人点赞
#model-evaluation

小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究

arXiv cs.CL ↗ · 2026-07-27 缓存

本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。

0 人收藏 0 人点赞
#model-evaluation

当模型不断变化时,如何保持本地AI评估的有用性?

Reddit r/AI_Agents ↗ · 2026-07-25

讨论在模型频繁更新时保持本地AI评估有用性的策略,重点在于适应性和一致性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈