model-evaluation

标签

Cards List
#model-evaluation

从GPT-3.5到GPT-4有什么变化?相同的提示。GPT-3.5:0/30 空响应。GPT-4:30/30。自己运行试试。

Reddit r/ArtificialInteligence ↗ · 昨天

研究发现,GPT-4能对空提示产生空响应,而GPT-3.5不能;跨供应商研究证实其他模型也有类似行为,并引入了一个开源工具来控制EOS令牌行为。

0 人收藏 0 人点赞
#model-evaluation

预训练模型在新型AI辅助教育问题教学评估中的应用评估

arXiv cs.AI ↗ · 昨天 缓存

本文评估了预训练模型用于AI辅助教育问题的教学评估,发现大语言模型优于传统模型,且战略性增强可提升分布外性能。

0 人收藏 0 人点赞
#model-evaluation

相同分数,不同决策:评估JEV和语言模型在法律文档理解中的应用

arXiv cs.CL ↗ · 昨天 缓存

本文在ContractNLI上比较了JEV与九种语言模型,评估了不同请求配置下的推理成本、响应时间和正确性,发现JEV具有更低的成本和响应时间,而语言模型达到了更高的基线准确率。

0 人收藏 0 人点赞
#model-evaluation

@kentcdodds: 我最喜欢对新模型做的事情:> 我希望你进行一次审计,涵盖安全性、性能、可访问性、维护……

X AI KOLs Timeline ↗ · 昨天 缓存

Kent C. Dodds 分享了他使用新 AI 模型进行安全、性能等审计的做法,并指出 Opus 5.5 发现了一个其他模型遗漏的重大安全问题。

0 人收藏 0 人点赞
#model-evaluation

@LiorOnAI: Fireworks 刚刚推出了 Specialized Intelligence Index。它在医疗保健、法律等领域的实际工作中对模型进行基准测试…

X AI KOLs Timeline ↗ · 昨天 缓存

Fireworks 推出了 Specialized Intelligence Index (SII),这是一个基准测试工具,用于评估 AI 模型在医疗保健、法律和网络安全等行业真实世界任务中的表现,专注于实际工作表现而非标准化测试。

0 人收藏 0 人点赞
#model-evaluation

有人能解释一下为什么我们认为90%以上的基准被视为饱和吗?

Reddit r/ArtificialInteligence ↗ · 昨天

本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。

0 人收藏 0 人点赞
#model-evaluation

@RayanKrishnan: 在对Opus 5.5进行评估后,我们将完整递归自我改进的时间线从8月更新为2027年7月。这表明…

X AI KOLs Following ↗ · 2天前 缓存

Rayan Krishnan在评估Claude Opus 5.5后,将完整递归自我改进的时间线更新至2027年7月,突显了人工智能发展中节奏与竞赛之间的紧张关系,以及协调的必要性。

0 人收藏 0 人点赞
#model-evaluation

GPT-6 Sol 在复杂任务上确认弱于 5.6 Sol,但在成本与效率方面胜出

Reddit r/singularity ↗ · 2天前

GPT-6 Sol 在复杂任务上被确认弱于 GPT-5.6 Sol,但在成本与效率方面具有优势

0 人收藏 0 人点赞
#model-evaluation

前沿模型的智能成本比图表。Opus 5.5 实现显著跃升。

Reddit r/singularity ↗ · 2天前

本文讨论了比较前沿AI模型智能与成本的图表,强调Opus 5.5在该指标上代表了显著改进。

0 人收藏 0 人点赞
#model-evaluation

@anshnanda: 当前的基准测试不再适用于新模型。这就是我们看到这样的结果的原因。

X AI KOLs Timeline ↗ · 2天前 缓存

@anshnanda的推文指出,现有的AI基准测试不适合评估新模型,这解释了模型性能中出现意外结果的原因。

0 人收藏 0 人点赞
#model-evaluation

MiMo-v2.6-Pro: 智能、性能与价格分析

Hacker News Top ↗ · 3天前 缓存

基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。

0 人收藏 0 人点赞
#model-evaluation

@kunchenguid: grok 4.7 第一天观察:忽略那些称其糟糕的报告,他们仅引用公开基准…

X AI KOLs Following ↗ · 3天前 缓存

用户分享了Grok 4.7第一天的观察,强调其对系统提示的严格遵守、稳定性和保守行为,同时指出其比前代版本更慢且成本更高。

0 人收藏 0 人点赞
#model-evaluation

快速且准确的文本内容文件类型识别

arXiv cs.LG ↗ · 4天前 缓存

本文提出了一种神经网络模型,用于快速且准确地识别文本内容文件类型,在准确性和速度上超越了现有的工具,如 Magika,同时体积更小。

0 人收藏 0 人点赞
#model-evaluation

我在相同Web开发提示下测试了9个LLM约8小时 — RTX 3060 12GB结果(请为最佳打分!)

Reddit r/LocalLLaMA ↗ · 4天前

本文呈现了在一个Web开发提示下对比9个LLM的8小时测试结果,重点关注哪些本地模型能在RTX 3060 12GB GPU上匹配前沿AI性能,包括详细的生成时间和实用见解。

0 人收藏 0 人点赞
#model-evaluation

@jerryjliu0: 我们评估了100多个模型在文档解析上的表现,涵盖前沿VLMs、开源权重VLMs、OCR工具和OSS解析器,请查看p…

X AI KOLs Timeline ↗ · 5天前 缓存

对超过100个模型在文档解析方面的评估,涵盖前沿VLMs、开源权重VLMs、OCR工具和开源解析器,结果通过parsebench分享。

0 人收藏 0 人点赞
#model-evaluation

Brood War 基准测试

Hacker News Top ↗ · 5天前 缓存

本文对 AI 模型在 Brood War 中的表现进行基准测试,Codex Astra 领跑排行榜。讨论了模型性能,指出较新的模型更好地处理实时策略,而较旧的模型将其视为回合制。

0 人收藏 0 人点赞
#model-evaluation

[讨论] 微调与继承基础模型行为——以消融后的 Qwen 基础模型为例

Reddit r/artificial ↗ · 6天前

关于在消融的基础模型上进行微调如何继承安全行为的讨论,评估结果显示混合结果,并与 Claude 模型进行比较,强调了审计的必要性。

0 人收藏 0 人点赞
#model-evaluation

全双工语音模型在被问及时发言,而非在需要时

arXiv cs.CL ↗ · 2026-09-18 缓存

本文评估了全双工语音模型在决定何时发言方面的能力,发现像Moshi和PersonaPlex这样的模型主要响应被提及或沉默,而不是内容驱动的触发器,如错误声明或危险,从而识别出内容理解上的差距。

0 人收藏 0 人点赞
#model-evaluation

APort Vault:使用Open Agent Passport对AI代理支付授权进行基准测试

Hugging Face Daily Papers ↗ · 2026-09-18 缓存

本文介绍了APort Vault,这是一个用于评估AI代理支付授权的基准测试,涵盖了超过225,000个评估,涉及14个模型,以测试安全策略和Open Agent Passport规范。

0 人收藏 0 人点赞
#model-evaluation

LLMs的幽默品味是什么?

Reddit r/LocalLLaMA ↗ · 2026-09-16

研究报告揭示,LLMs在幽默品味上共识程度不一,总体偏好荒谬幽默和吐槽笑话格式,Gemini则是最一致的评判者。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈