performance-benchmark

标签

Cards List
#performance-benchmark

一款名为 Ox-Alpha 的隐秘模型已经发布,在 SWE 上表现优于 Fable。

Reddit r/singularity · 6小时前 缓存

一款名为 Ox-Alpha 的隐秘AI模型据报告已经发布,在 SWE 基准测试中优于 Fable,并且可以免费使用,具备多模态支持和零数据保留等功能。

0 人收藏 0 人点赞
#performance-benchmark

我实测了:将密集27B模型换成30B-A3B MoE模型如何改变本地并发上限(与先前测试相同平台,仅改变一个变量)

Reddit r/AI_Agents · 15小时前

作者在MacBook Pro上测试并比较了密集与MoE AI模型的并发性能,发现由于每个token的内存带宽使用更低,MoE模型的扩展性显著更好。

0 人收藏 0 人点赞
#performance-benchmark

@cline: 公开提醒:使用中等思考努力而不是xhigh。Opus 5 中等努力在 FrontierCode 上排名第2,准确率53.4%,每任务成本4.31美元,而…

X AI KOLs Timeline · 15小时前 缓存

一份公共服务公告建议对 Opus 5 AI 模型使用中等思考努力,该模型在 FrontierCode 基准测试中排名第二,比 xhigh 努力设置具有更好的成本效率。

0 人收藏 0 人点赞
#performance-benchmark

@Chris_Wozniczek:Qwen 3.8 27B 对比 Ornith-1.5-35B [4 Bit MLX] 提示词:Bioluminescent Abyssal Temple (完整提示词在页面上) 工具:Grok…

X AI KOLs Timeline · 22小时前 缓存

推文对比了Qwen 3.8 27B和Ornith-1.5-35B模型在生成生物发光深渊神庙动画的提示词上的表现,指出Qwen在视觉效果上更优,而Ornith在构建速度和完成时间上更快。

0 人收藏 0 人点赞
#performance-benchmark

@elonmusk:Grok 4.6 在医疗问题中排名第一

X AI KOLs Timeline · 昨天 缓存

Grok 4.6 在 MedAgentBench 上登顶,在现实世界的医疗 AI 任务中超越了 GPT-5.6 Sol 和 Grok 4.5。

0 人收藏 0 人点赞
#performance-benchmark

Ling-3.0-tiny 是个非常有趣的模型。它可以在 NVIDIA Orin Nano Super 8GB 上运行,支持 128K 上下文并采用 IQ4_NL 量化技术。

Reddit r/LocalLLaMA · 2天前

本文展示了在NVIDIA Orin Nano Super 8GB设备上运行Ling-3.0-tiny AI模型的实例,采用IQ4_NL量化方案,实现33 tok/s解码速度与完整128K上下文长度,体现了边缘AI的实际部署能力。

0 人收藏 0 人点赞
#performance-benchmark

Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA · 3天前

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。

0 人收藏 0 人点赞
#performance-benchmark

@LinusEkenstam: Unitree超凡预览:2米立定跳高,速度达12.66米/秒,这是非凡的成就。

X AI KOLs Following · 4天前 缓存

Unitree展示了超越人类的机器人能力,实现了2米立定跳高和12.66米/秒的速度,展现了机器人技术的非凡进步。

0 人收藏 0 人点赞
#performance-benchmark

在Strix Halo上运行的Qwen3.8-27B Q8_0令人印象深刻

Reddit r/LocalLLaMA · 4天前

作者在配备Ryzen AI Max+ 395的ROG Flow Z13上测试了Qwen3.8-27B Q8_0 AI模型,使用Lemonade Server和llama.cpp进行推测解码,实现了令人印象深刻的本地推理性能,生成了一个飞行模拟器。

0 人收藏 0 人点赞
#performance-benchmark

我刚刚用Q4量化的Qwen 3.8 27与GPT 5.6 Sol high进行测试——在复杂动画SVG任务中轻松获胜

Reddit r/LocalLLaMA · 4天前

一名用户在复杂动画SVG任务中测试了Q4量化的Qwen 3.8 27B和GPT 5.6 SOL,发现Qwen表现更好,错误更少,突显了其在空间推理和编码方面的优势。

0 人收藏 0 人点赞
#performance-benchmark

Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s

Reddit r/LocalLLaMA · 4天前

NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。

0 人收藏 0 人点赞
#performance-benchmark

1.7B模型在strict-7形式推理上超越Qwen3-8B和Gemma-4-26B - 专业模型蚕食通用模型领域?

Reddit r/artificial · 4天前

TwIL-LM2,一个专门针对形式逻辑翻译微调的1.7B模型,在严格评分基准上超越了更大的通用模型如Qwen3-8B和Gemma-4-26B,突显了专用AI模型在高效推理方面的潜力。

0 人收藏 0 人点赞
#performance-benchmark

@gregpr07: Grok 4.6 性能与 Opus 5 差距在1分以内,成本降低约40%。在7次运行中,解决了106个高难度浏览器任务中的105个。还有一点 …

X AI KOLs Following · 6天前 缓存

Grok 4.6 在成本降低40%的条件下,性能接近Opus 5,成功解决106个高难度浏览器任务中的105个,预示着通过强化学习可能实现进一步突破。

0 人收藏 0 人点赞
#performance-benchmark

LiquidAI LFM2.5-VL-3B:一款3.1B本地视觉语言模型超越Gemma-4 E4B——屏幕理解从2.5提升至82.2

Reddit r/artificial · 6天前

LiquidAI发布了LFM2.5-VL-3B,这是一款3.1B本地视觉语言模型,性能超越Gemma-4 E4B,并在屏幕理解上展现了显著提升,使得设备端AI更加实用。

0 人收藏 0 人点赞
#performance-benchmark

好的,我们有了Qwen3.8-27B。现在轮到社区来让它变得更好更快。

Reddit r/LocalLLaMA · 6天前

社区关于Qwen3.8-27B发布的讨论,重点关注与Qwen3.6-27B和Qwen3.5-27B等前版本的性能比较、内存使用和创意写作能力。

0 人收藏 0 人点赞
#performance-benchmark

Lean中快速的DEFLATE压缩

Lobsters Hottest · 2026-07-26 缓存

一篇博客文章展示,经形式化验证的Lean实现的DEFLATE压缩算法在典型级别上,其速度和压缩比均优于纯Rust实现。作者将此归因于能够安全地让AI代理优化代码,并依赖形式化证明来保证正确性。

0 人收藏 0 人点赞
#performance-benchmark

原生速度 vLLM transformers 建模后端

Hugging Face Blog · 2026-07-08 缓存

Hugging Face 发布了 transformers vLLM 建模后端,相比自定义 vLLM 实现能达到原生甚至更快的速度,使模型作者无需移植代码即可自动利用超快推理。

0 人收藏 0 人点赞
#performance-benchmark

内存的物理原理(即 JavaScript ECS 能行吗?)

Lobsters Hottest · 2026-07-02 缓存

本文介绍了一份详细的基准测试,比较了 JavaScript 中用于二维物理模拟的 ECS 和 OOP 架构,测试了内存局部性和多维性能,包括 broad-phase 算法和排序策略,结果基于 M4 Mac。

0 人收藏 0 人点赞
#performance-benchmark

优化一个设计上为二次的算法

Lobsters Hottest · 2026-07-01 缓存

本文详细介绍了 WhatChord 排名算法的优化过程,该算法使用非传递比较器和线性化来处理循环偏好,尽管算法是二次设计的,但仍能实现高效的和弦名称排名。

0 人收藏 0 人点赞
#performance-benchmark

@KyleHessling1: 使用我们即将发布的 Qwopus-Coder-35B-A3B 模型,在 @opencode 中完全制作了一款 RTS 游戏,已启用思考功能,设定了思考上限……

X AI KOLs Following · 2026-06-26 缓存

Kyle Hessling 宣布即将发布 Qwopus-Coder-35B-A3B 编程模型,并通过与 OpenCode 配合使用开发出一款功能完整的实时策略游戏来展示其能力。该模型在 GeForce RTX 5090 上实现了高速和草稿接受率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈