model-capabilities

标签

Cards List
#model-capabilities

我运营着一个包含1000多个AI工具的工具目录。以下是我注意到的哪些AI工具真正存活下来、哪些消失了的现象。

Reddit r/ArtificialInteligence · 2026-07-27

AI Parabellum(一个收录了1000多个AI工具的工具目录)的运营者分享了大多数工具在一年内失败的模式——薄弱的API封装、缺乏更新以及来自主流模型的竞争——而成功的工具则解决特定工作流程问题,并提供超越原始API的独特价值。

0 人收藏 0 人点赞
#model-capabilities

Ask HN: 哪项任务只有前沿模型才能完成?

Hacker News Top · 2026-07-10 缓存

一位Hacker News用户询问哪项任务只有前沿模型才能完成,引发了关于当前AI能力局限性的讨论。

0 人收藏 0 人点赞
#model-capabilities

有没有人测试过量化对不同能力的影响?我的结果令人惊讶。

Reddit r/LocalLLaMA · 2026-07-09

作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。

0 人收藏 0 人点赞
#model-capabilities

@FinanceYF5: 有人根据r/LocalLLaMA一张图表算了笔账:云端顶尖模型的能力,从发布到普通笔记本能就地跑出同等水平,平均要等24.8个月。 GPT-3那批用了37个月才追上,GPT-3.5是17个月,GPT-4大概24个月。 照这个节奏推算,Fa…

X AI KOLs Following · 2026-07-07 缓存

根据r/LocalLLaMA图表估算,云端顶尖AI模型从发布到普通笔记本能运行同等水平平均需24.8个月,GPT-3用了37个月,GPT-3.5用了17个月,GPT-4约24个月,预计Fable/Mythos 5级别能力可能在2028年7月普及到高端消费电脑。

0 人收藏 0 人点赞
#model-capabilities

能力前沿:基准测试遗漏了82%的模型性能

arXiv cs.AI · 2026-06-26 缓存

本文提出了能力前沿(Capability Frontier),这是一个针对模型的帕累托前沿,用于纠正单模型和单次运行评估中的偏差,表明标准基准测试遗漏了高达82%的模型性能,并且集体LLM能力被严重低估。

0 人收藏 0 人点赞
#model-capabilities

推理计算如何影响前沿LLM的评估

arXiv cs.AI · 2026-06-17 缓存

本文系统研究了推理时计算(token预算、上下文压缩、重复提交)如何影响前沿LLM在具有挑战性的基准上的性能,表明得分是协议相关的,并提倡评估应将能力表示为推理计算的函数。

0 人收藏 0 人点赞
#model-capabilities

Mythos-class 模型将在2029年前扩散至全球(7分钟阅读)

TLDR AI · 2026-06-12 缓存

Saagar Pateder分析了人工智能在消费者和企业任务中的边际收益递减,并基于模型性能和成本的历史趋势,预测开源权重模型将在2029年前普及全球。

0 人收藏 0 人点赞
#model-capabilities

Anthropic和OpenAI声称,他们的模型强大到足以“突破”其沙盒……但他们的智能体实现到底有何特别之处?

Reddit r/AI_Agents · 2026-05-16

一场讨论,质疑Anthropic和OpenAI的智能体实现有何特别之处,认为它们可能只是基础的ReAct循环配合工具使用,并询问与本地Ollama模型实现之间的差距。

0 人收藏 0 人点赞
#model-capabilities

@SebastienBubeck:他所谈论的不可能在GPT-5.5之前实现

X AI KOLs Following · 2026-05-10 缓存

一则推文提及AI研究员Sebastien Bubeck,暗示某些讨论中的能力需要使用像假想中的GPT-5.5这样的先进模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈