benchmark

标签

Cards List
#benchmark

@cline: Pixel Canary(隐身模型)刚刚发布,在 Cline 中免费提供。它与 GPT-6 Astra 持平,并在 Next.js Agent Evals 上击败了 Kimi K3

X AI KOLs Timeline ↗ · 14小时前 缓存

Pixel Canary,一款隐身 AI 模型,已在 Cline 中免费发布。它在 Next.js Agent Evals 基准测试中与 GPT-6 Astra 性能持平,并在 Web 和移动开发任务上优于 Kimi K3。

0 人收藏 0 人点赞
#benchmark

@BenKoska: 我们在所有四条赛道上均为NVIDIA的SOL-ExecBench第一名。在B200上运行的235个真实生产内核中,我们击败了……

X AI KOLs Timeline ↗ · 15小时前 缓存

一个团队宣布他们在NVIDIA的SOL-ExecBench基准测试中所有赛道均获得第一名,使用B200 GPU的真实生产内核击败了583个团队。

0 人收藏 0 人点赞
#benchmark

Kev 4B 在我运行的所有俄罗斯方块游戏中都堆顶了。Mica v0.1 4B 清除了约4倍多的方块行,并在其中两局游戏中坚持到了最后

Reddit r/LocalLLaMA ↗ · 16小时前

Mica v0.1 4B 在俄罗斯方块游戏中表现优于 Kev 4B,清除约4倍多的方块行,并在某些情况下坚持到了最后,仅使用棋盘描述,无需搜索或前瞻。

0 人收藏 0 人点赞
#benchmark

对于那些在1980年代玩Hack(以及更早的Rogue)成长起来的人,在现代实时战略时代之前……

X AI KOLs Timeline ↗ · 20小时前 缓存

一个名为GPT 6 Astra的LLM代理在NetHack游戏中实现了飞升,标志着首次有LLM通过自主构建工具击败这款复杂游戏的记录实例。

0 人收藏 0 人点赞
#benchmark

@VraserX:小米的MiMo-V2.6-Pro拥有MIT许可权重,并在OpenRouter上以每百万输出令牌0.87美元的价格列出。它……

X AI KOLs Timeline ↗ · 20小时前 缓存

小米的MiMo-V2.6-Pro,一款具有MIT许可权重的AI模型,在OpenRouter上以每百万输出令牌0.87美元的价格列出,突显了其与昂贵前沿模型相比的成本效益。

0 人收藏 0 人点赞
#benchmark

Jev vs. Kev:开源Jev替代方案并排测试

Reddit r/LocalLLaMA ↗ · 21小时前 缓存

本文比较了TypeSafe的Jev模型与开源Kev替代方案,在一个新的数据集上测试了它们的准确性、令牌使用量和速度,以避免数据泄漏,发现性能相似,但实现上有差异。

0 人收藏 0 人点赞
#benchmark

@omarsar0: 推荐基准。我预计语音将成为人们与机器人和物理AI交互的主要方式之一。那个…

X AI KOLs Timeline ↗ · 昨天 缓存

BRIDGE ASR 2.0 是一个基准,评估语音识别模型在21种语言的真实双人对话中的表现,重点关注语码转换和多语言性能,以增强AI和机器人中的语音交互。

0 人收藏 0 人点赞
#benchmark

AGI (/j) Gemini 4 pro 新检查点(重传因为上次图片搞砸了)

Reddit r/singularity ↗ · 昨天

宣布了 Gemini 4 pro 的一个新检查点,显示在 6 分钟内有详细输出,并在 ArenaAI 上超越了 Gemini 3.8 flash。

0 人收藏 0 人点赞
#benchmark

最后的人类关卡:面向治理自动化的前置部署工程

arXiv cs.AI ↗ · 昨天 缓存

本文提出一个任务替代框架,利用AI代理和软件自动化企业治理审查。基准测试如DGF-Bench显示,Gemini 3.8 Flash等模型在替代指定审查任务的人类执行方面可取得高成功率。

0 人收藏 0 人点赞
#benchmark

IndicBankBench: 评估印度零售银行语言模型助手的安全性与可靠性

arXiv cs.AI ↗ · 昨天 缓存

介绍了IndicBankBench,一个包含799个案例的基准测试,用于评估印度零售银行语言模型助手的安全性和可靠性,采用多阶段评估,并公开发布代码和数据。

0 人收藏 0 人点赞
#benchmark

RECLAIM:智能体能否复现机器学习论文的主张?

arXiv cs.AI ↗ · 昨天 缓存

RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。

0 人收藏 0 人点赞
#benchmark

TWIST:一个用于对话记忆干预质量的人工验证草稿对齐提议基准

arXiv cs.AI ↗ · 昨天 缓存

TWIST 是一个用于评估对话记忆系统中干预质量的提议基准套件,具有人工验证的轨道,用于检测未解决的张力和过时事实等故障,揭示了传统指标忽略的召回率与特异性之间的权衡。

0 人收藏 0 人点赞
#benchmark

EnSiTa - 一个面向特定领域机器翻译的三语多领域平行数据集与基准

arXiv cs.CL ↗ · 昨天 缓存

EnSiTa 是一个支持英语、僧伽罗语和泰米尔语的三语多领域平行数据集和基准,包含人工后编辑的训练数据,并进行了大量领域特定机器翻译的实验,以应对低资源语言的挑战。

0 人收藏 0 人点赞
#benchmark

BanglaTurn: 一个用于 Bangla 语音回合结束检测的基准与 Whisper 基础模型

arXiv cs.CL ↗ · 昨天 缓存

论文介绍了 BanglaTurn,这是一个用于 Bangla 语音回合结束检测的基准语料库和基于 Whisper 的模型,实现了 84.33% 的准确率,而基线为 69.28%。

0 人收藏 0 人点赞
#benchmark

COILD:一个以印度语言为中心的平行语料库与跨语言机器翻译基准

arXiv cs.CL ↗ · 昨天 缓存

本文介绍了COILD,这是一个以印度语言为中心的平行语料库,包含超过116万对句子,覆盖20对印度语言,并提供了一个以领域为中心的基准。研究结果表明,在微调多语言模型时,机器翻译性能得到了显著提升。

0 人收藏 0 人点赞
#benchmark

一个财务基准测试要求智能体完成整个任务(阅读时长18分钟)

TLDR AI ↗ · 昨天 缓存

由Surge AI推出的名为DAYJOB的财务基准测试评估AI代理在完成财务预测任务时的表现,其详细的通过/失败标准重点关注净销售额计算和收入增长预测中的错误。

0 人收藏 0 人点赞
#benchmark

Dailychained PLX 88096 交换机,四路 RTX 5070 Ti + 四路 RTX 5060 Ti

Reddit r/LocalLLaMA ↗ · 昨天

一位用户分享了使用 RTX 5070 Ti 和 5060 Ti 构建多 GPU 系统的经验,该系统用于在 Linux 上通过 vLLM 运行 Qwen3.8-27B-FP8 等 AI 模型,详细介绍了硬件设置、基准测试和挑战。

0 人收藏 0 人点赞
#benchmark

@svpino:在将音频发送到语音转文本模型之前降低噪声会带来巨大改进。语音隔离是…

X AI KOLs Timeline ↗ · 昨天 缓存

Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。

0 人收藏 0 人点赞
#benchmark

Claude Opus 5.5 在 SimpleBench 上以 88.4% 的分数拔得头筹。

Reddit r/singularity ↗ · 昨天

Claude Opus 5.5 在 SimpleBench 基准测试中取得了 88.4% 的最高分,表明其在 AI 评估中具有卓越性能。

0 人收藏 0 人点赞
#benchmark

@_philschmid: Gemini 3.8 Flash. 直接使用Gemini进行多模态理解。

X AI KOLs Following ↗ · 2天前 缓存

一条推文建议使用Gemini 3.8 Flash进行多模态理解,并引用了一个视觉测试,该测试比较了AI模型从绘画中识别人物的能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈