benchmark-results

标签

Cards List
#benchmark-results

@QuixiAI: ChatGPT 未通过, Claude 未通过, Deepseek 未通过, Qwen3.8 通过, GLM 5.3 通过, Grok 通过

X AI KOLs Timeline · 2026-08-27 缓存

这条推文报告称,ChatGPT、Claude 和 Deepseek 未通过测试或基准,而 Qwen3.8、GLM 5.3 和 Grok 通过,基于一个链接的来源。

0 人收藏 0 人点赞
#benchmark-results

@MaxForAI: 笑死了,刚才我的tl上面都是这个哥的惊讶 有人直接把 Qwen3.8-27B 的安全护栏拆了。 OrcaRouter 之前在 Hugging Face 放出了一个 Qwen3.8-27B-Uncensored-FP8。 他们通过 Abli…

X AI KOLs Timeline · 2026-08-21 缓存

有人通过Abliteration技术修改权重,发布了Qwen3.8-27B的无审查版本,大幅降低拒答率,同时保持模型性能,引发对AI安全的讨论。

0 人收藏 0 人点赞
#benchmark-results

我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。

Reddit r/LocalLLaMA · 2026-08-21

作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。

0 人收藏 0 人点赞
#benchmark-results

FlowEvo:通过工作流与可执行技能的协同演化实现自演化智能体

Hugging Face Daily Papers · 2026-08-20 缓存

FlowEvo是一个免训练框架,使得大语言模型智能体能够在推理时协同演化可复用技能和工作流,在ALFWorld、HumanEval和GSM8K等基准测试中实现了最先进的准确性和效率。

0 人收藏 0 人点赞
#benchmark-results

DeepSeek v4 Flash 能力显著提升

Reddit r/LocalLLaMA · 2026-07-31

DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。

0 人收藏 0 人点赞
#benchmark-results

人工智能分析:Muse Spark 1.1 结果

Reddit r/singularity · 2026-07-10

人工智能分析报告了 Muse Spark 1.1 AI 模型的基准测试结果,并提供了性能指标。

0 人收藏 0 人点赞
#benchmark-results

ZAYA1-8B 技术报告

arXiv cs.AI · 2026-05-08 缓存

本报告介绍了 ZAYA1-8B,这是一款在 AMD 硬件上训练的混合专家推理模型,使用少于 10 亿的激活参数在数学和编程基准测试中取得了具有竞争力的性能。报告还详细介绍了马尔可夫式 RSA(Markovian RSA),这是一种用于聚合并行推理轨迹的新型测试时计算(test-time compute)方法。

0 人收藏 1 人点赞
#benchmark-results

Claude 3.5 Sonnet 在 SWE-bench Verified 上再创新高

Anthropic Engineering · 2026-05-08 缓存

Anthropic 升级后的 Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中达到了 49% 的全新最优成绩,展现了在自主软件工程任务方面的显著能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈