model-evaluation

标签

Cards List
#model-evaluation

标题很难

Reddit r/singularity · 昨天

精选链接,指向近期关于模型评估期间AI安全事件的报告,包括一起OpenAI/Hugging Face事件、Anthropic的网络安全评估,以及英国AISI关于未经授权的智能体行为的报告。

0 人收藏 0 人点赞
#model-evaluation

@gdb:对我们下一个主要模型Astra的评估表明,在智能体编码和网络安全方面有显著的能力提升……

X AI KOLs Following · 昨天 缓存

OpenAI的下一代主要模型Astra在智能体编码和网络安全方面展现出显著的能力提升,并且根据《准备框架》被视为网络安全领域的“关键”模型,计划实施额外的控制措施。

0 人收藏 0 人点赞
#model-evaluation

@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……

X AI KOLs Timeline · 昨天 缓存

一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。

0 人收藏 0 人点赞
#model-evaluation

我测试了32个模型的提取能力,结果令人惊讶

Reddit r/AI_Agents · 2天前

一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。

0 人收藏 0 人点赞
#model-evaluation

我将 GPT 5.6、Opus 5 和 minimax-M3 放入同一个模拟世界中经营餐馆。它们都以同样的 3 种方式失败。

Reddit r/AI_Agents · 4天前

一位开发者描述了在模拟餐馆世界中运行 AI 智能体的经历,发现尽管模型和框架各不相同,但同样的三个与 API 相关的错误占主导地位:猜测不存在的端点、超出预算、以及基于过时的 ID 进行操作。展示了即使修复系统后,失败模式依然持续存在。

0 人收藏 0 人点赞
#model-evaluation

核查问题:AI在受监管企业上线前必须满足什么条件

arXiv cs.CL · 6天前 缓存

本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。

0 人收藏 0 人点赞
#model-evaluation

@googledevs: Agent and Model Evaluations in Gemini Enterprise Agent Platform are now Generally Available (GA)! Measure, test, and mo…

X AI KOLs Following · 2026-07-31 缓存

Google announces GA of Agent and Model Evaluations in Gemini Enterprise Agent Platform, enabling consistent measurement and monitoring of AI agents in dev and production with pre-built metrics, adaptive rubrics, simulators, and online monitors.

0 人收藏 0 人点赞
#model-evaluation

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL · 2026-07-31 缓存

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

0 人收藏 0 人点赞
#model-evaluation

基准测试上25%的差异——只是运行方式的一个错误😬

Reddit r/AI_Agents · 2026-07-30

讨论了ARC-AGI上25%的差异如何由测试框架设置导致,显示GPT-5.6 Sol在正确评估下得分38%,并批评了行业内天真的基准测试报告方式。

0 人收藏 0 人点赞
#model-evaluation

@LangChain: Brand new Max Agency with @cognition President @russelljkaplan + @hwchase17. YouTube: https://youtu.be/bBUotstDLdk?si=F…

X AI KOLs Timeline · 2026-07-30 缓存

Cognition 总裁 Russell Kaplan 在访谈中回顾编码代理 Devon 的发展,讨论模型智能饱和、成本优化,并介绍新评估 Frontier Code 如何衡量代码可合并性。

0 人收藏 0 人点赞
#model-evaluation

为何通过所有评估的智能体在真实生产流量下仍会漂移

Reddit r/ArtificialInteligence · 2026-07-29

AI智能体在通过评估后常因分布偏移和上游变更在生产环境中漂移;持续评估和实时监控可缓解此问题。

0 人收藏 0 人点赞
#model-evaluation

大家都在争论新模型是否更差,真正的问题在于没人能回答

Reddit r/AI_Agents · 2026-07-28

文章强调了关于新AI模型是否实际上比以前更差的激烈争论,指出真正的问题在于缺乏可靠的评估方法。

0 人收藏 0 人点赞
#model-evaluation

)

TLDR AI · 2026-07-28 缓存

Vercel 发布了 DeepsecBench 基准测试,用于评估 AI 模型在应用程序代码中查找网络安全漏洞的能力,结果显示开源权重模型在安全扫描方面正变得更具成本效益。

0 人收藏 0 人点赞
#model-evaluation

Qwen 3.6 27B 的量化是否会破坏 pelican?

Reddit r/LocalLLaMA · 2026-07-27 缓存

本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。

0 人收藏 0 人点赞
#model-evaluation

小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究

arXiv cs.CL · 2026-07-27 缓存

本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。

0 人收藏 0 人点赞
#model-evaluation

当模型不断变化时,如何保持本地AI评估的有用性?

Reddit r/AI_Agents · 2026-07-25

讨论在模型频繁更新时保持本地AI评估有用性的策略,重点在于适应性和一致性。

0 人收藏 0 人点赞
#model-evaluation

@jakevin7: Claude Code删掉了80%系统提示词! 而实际上 Maka 早就已经提到了过了这点。 https://github.com/maka-agent/maka-agent… 这个结论我们几周前在 Maka 上跑 benchmark 的…

X AI KOLs Timeline · 2026-07-25 缓存

本文讨论了Anthropic关于提示词精简的发现,以及Maka Agent在Terminal Bench 2.1上的验证结果,表明更强模型下过于冗长的系统提示词反而降低性能。

0 人收藏 0 人点赞
#model-evaluation

英国AISI/美国CAISI对Kimi K3网络安全能力的初步评估

Hacker News Top · 2026-07-25 缓存

英国AISI与美国CAISI联合评估了Moonshot AI的Kimi K3模型在网络安全方面的能力,发现其在漏洞利用开发基准测试中与前沿美国模型具有竞争力。

0 人收藏 0 人点赞
#model-evaluation

REGARD:大型语言模型中的区域情感差异

arXiv cs.CL · 2026-07-24 缓存

本文介绍REGARD,一项使用Valence-Arousal-Dominance画像法测量LLM对后苏联实体情感框架差异的研究,揭示模型按情感强度和通用回答率聚类,而非按来源或规模聚类。

0 人收藏 0 人点赞
#model-evaluation

立场:停止每次被动修补模型,开始主动测试驱动的AI开发

arXiv cs.LG · 2026-07-24 缓存

本文主张从被动的AI飞轮维护(出现错误时修补)转向主动的测试驱动方法,将反馈映射到任务条件的测试空间,并从数学上证明主动方法能以更少的迭代实现更好的长期扩展。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈