benchmark-performance

标签

Cards List
#benchmark-performance

@QuixiAI: MiMo-V2.6 有音频/语音功能,太激动了!嗯,他们说它能重写不对齐的对话轮次,让我看看我能做些什么!

X AI KOLs Timeline · 昨天 缓存

小米推出MiMo-V2.6,一款具备音频/语音功能的全模态AI模型,声称其性能与Claude Opus 5和GPT-5.6 Sol等领先模型不相上下。

0 人收藏 0 人点赞
#benchmark-performance

@rohanpaul_ai: 法律工作见证了Grok 4.7最大的跃升之一。在Harvey Legal Agent Benchmark上,Grok 4.7得分19.6%,而GPT-5…

X AI KOLs Following · 昨天 缓存

Grok 4.7在法律工作和终端任务方面显示出显著改进,在Harvey Legal Agent Benchmark和Terminal-Bench 4.0等基准测试中超越竞争对手,同时保持代币价格不变。

0 人收藏 0 人点赞
#benchmark-performance

Benzi:编程工具/AI代理在基准测试中超越巨头,且源代码读取更少

Reddit r/ArtificialInteligence · 6天前

Benzi是一个AI编程代理,通过读取更少源代码并使用确定性工具调用,在基准测试中超越竞争对手,在代码智能任务中实现高效率。

0 人收藏 0 人点赞
#benchmark-performance

一位来自比哈尔邦的20岁独立开发者如何打造一个开源全能AI模型(5.84B),在MATH-500基准测试中超越Apple的AFM 3B模型(74.2% vs 48.0%)

Reddit r/ArtificialInteligence · 2026-09-11

来自比哈尔邦的20岁独立开发者Abhinav Anand发布了Arcle V1,这是一个开源权重的5.84B参数统一全能AI模型,在包括MATH-500在内的多个基准测试中优于Apple的AFM 3B模型。

0 人收藏 0 人点赞
#benchmark-performance

@nazranf_: H3 Max 正在以不到3秒的速度生成5秒的768p视频,带有原生立体声音频。这比实时还快,而且i…

X AI KOLs Timeline · 2026-08-29 缓存

H3 Max 是一个AI模型,能在不到3秒内生成5秒的768p视频,带有原生立体声音频,比实时更快,并在Design Arena和Artificial Analysis的图转视频类别中排名第一。一个演示展示了其在Twitch上的连续视频流应用。

0 人收藏 0 人点赞
#benchmark-performance

Meta^n:通过涌现深度实现递归自我改进

Hugging Face Daily Papers · 2026-08-25 缓存

本文介绍了Meta^n,这是一种通过应用固定元操作来扩展推理深度的递归自我改进方法,在ARC-AGI-2等基准测试上超越了先前方法。

0 人收藏 0 人点赞
#benchmark-performance

AutoSaddler:基于智能体执行轨迹的持久化更新自动套件优化

Hugging Face Daily Papers · 2026-08-24 缓存

AutoSaddler是一个自动套件优化框架,通过使用失败信号迭代更新套件,提升LLM智能体在长期任务上的表现,在GAIA2和SWE-Bench等基准测试中实现了显著提升。

0 人收藏 0 人点赞
#benchmark-performance

@AdinaYakup: 这令人印象深刻!Ornith 是新的,但每次发布都产生影响 这次:- 397B 在 Terminal-Bench 2 上达到 86.1…

X AI KOLs Timeline · 2026-08-19 缓存

Ornith-1.5 发布了一系列参数从 9B 到 397B 的开源大语言模型,在可比模型中实现了最先进的性能,并提供多种部署友好的格式。

0 人收藏 0 人点赞
#benchmark-performance

嵌入空间中的结构保留作为基准性能的预测指标

arXiv cs.CL · 2026-05-22 缓存

本文表明,通过最近邻重叠和ICA差异测量的嵌入空间结构保留,与多个任务上的基准性能强相关,为模型有效性提供了预测指标。

0 人收藏 0 人点赞
#benchmark-performance

AntAngelMed - 100a6b 医疗大模型

Reddit r/LocalLLaMA · 2026-05-13 缓存

AntAngelMed 是由浙江省卫生健康信息中心、阿里健康(Ant Healthcare)以及安贞儿医疗 AI(Anzhen'er Medical AI)联合开发并开源的全新 1000 亿参数医疗大模型。该模型采用高效的 MoE(混合专家)架构以实现高性能推理,并在 HealthBench 和 MedAIBench 基准测试中取得了领先排名。

1 人收藏 1 人点赞
#benchmark-performance

Perceptron Mk1 震撼发布高性能视频分析AI模型,比Anthropic、OpenAI和Google便宜80-90%(8分钟阅读)

TLDR AI · 2026-05-13 缓存

Perceptron公司发布了其旗舰视频分析模型Mk1,声称成本比竞争对手低80-90%,同时在空间和视频推理基准上表现出色。

0 人收藏 0 人点赞
#benchmark-performance

Interfaze:专为规模化场景下高准确率而构建的新型模型架构

Hacker News Top · 2026-05-11 缓存

Interfaze 推出了一种混合 AI 模型架构,结合 CNN/DNN 的专项优势与 Transformer 能力,在 OCR 和翻译等确定性任务上实现卓越精度,同时在规模化应用中保持成本效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈