capabilities

标签

Cards List
#capabilities

@sama: 整个夏天,我们一直在安全重点上冲刺;对于能力和安全保障来说,现在比以往任何时候都更……

X AI KOLs Timeline · 2026-09-01 缓存

OpenAI 宣布即将推出其下一个模型 Astra,强调在 AI 能力与安全和对齐进展之间取得平衡的必要性。

0 人收藏 0 人点赞
#capabilities

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog · 2026-09-01 缓存

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。

0 人收藏 0 人点赞
#capabilities

参考嫁接法在引出沙袋能力方面与微调相匹配

arXiv cs.LG · 2026-09-01 缓存

本文介绍了参考嫁接法,一种通过编辑激活来引出AI模型沙袋能力的方法,其效果与微调相当,无需权重更新或训练标签。

0 人收藏 0 人点赞
#capabilities

从孤立任务到结构化能力:大型语言模型的多层分类法

arXiv cs.CL · 2026-07-27 缓存

本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。

0 人收藏 0 人点赞
#capabilities

LLM能否解决迷宫问题?

Reddit r/LocalLLaMA · 2026-07-24

探讨大型语言模型是否能解决迷宫导航任务,检验其推理和空间理解能力。

0 人收藏 0 人点赞
#capabilities

AI语音代理如今真正擅长哪些任务?

Reddit r/AI_Agents · 2026-07-13

分析当前AI语音代理的实际能力以及它们如今擅长的任务。

0 人收藏 0 人点赞
#capabilities

我们给了智能体双手和声音,但大多数仍没有眼睛

Reddit r/AI_Agents · 2026-07-10

文章讨论了AI智能体已经被赋予了物理交互(双手)和语音通信的能力,但大多数仍然缺乏视觉感知(眼睛),突出了这一关键局限。

0 人收藏 0 人点赞
#capabilities

你认为哪种AI Agent能力仍然被过分高估?

Reddit r/AI_Agents · 2026-07-09

一个讨论话题,邀请社区成员根据实际经验分享哪些AI Agent能力被高估、哪些被低估。

0 人收藏 0 人点赞
#capabilities

@AnjneyMidha: 很多人似乎认为,无论好坏,AI竞赛的全貌是公开可见的,至少3-4个AI实验室…

X AI KOLs Following · 2026-07-09 缓存

观察到除OpenAI、Anthropic和DeepMind之外,还有几个AI实验室拥有可能因经济激励而永远不会公开分享的最先进能力。

0 人收藏 0 人点赞
#capabilities

持久的授权:面向编程代理的可撤销资源与效果能力

arXiv cs.AI · 2026-07-08 缓存

本文介绍了Portico,一种用于编程代理可撤销能力的参考监视器,解决了“持久授权”问题——临时资源访问在其使用场景结束后仍暴露在外。研究表明,Portico通过在任务关闭后撤销权限来强制执行任务契约,阻止了被禁止的效果。

0 人收藏 0 人点赞
#capabilities

@0xCodez:Anthropic 刚刚发布了5个研讨会,揭示了Fable 5的最新能力:• 00:00 - 深入探索Fable 5 • 11…

X AI KOLs Timeline · 2026-07-04 缓存

Anthropic发布了五个研讨会,详细介绍了Fable 5的最新能力和使用场景,涵盖深度探索、托管代理和部署策略。

0 人收藏 0 人点赞
#capabilities

尽管GPT 5.6 Sol看起来是一个很大的改进,但在我看来,GPT 5.6 Lunatic由于价格因素似乎是最显著的改进。输入1美元,输出6美元,其能力仍可与GPT 5.4相媲美。

Reddit r/singularity · 2026-06-26

GPT 5.6 Lunatic以显著更低的价格(输入1美元,输出6美元)提供了与GPT 5.4相当的能力,使其成为Gemini Flash和GPT 5.4 mini的有力替代品。

0 人收藏 0 人点赞
#capabilities

@FinanceYF5: 2/ 瓶颈消失后,比的是野心 Fiona 的原话:AI 抬高了任何人能做事的天花板,理论上一切都可行。 一个不懂移动端的工程师,靠 Claude 直接给功能补上了 App 端。

X AI KOLs Timeline · 2026-06-22 缓存

Fiona 认为 AI 抬高了做事的天花板,一个不懂移动端的工程师借助 Claude 补上了 App 端功能。

0 人收藏 0 人点赞
#capabilities

Mythos 并非通过‘黑客’训练而成。其他 AI 实验室未来也将达到 Mythos 级别的能力。

Reddit r/singularity · 2026-06-21

文章澄清了 AI 模型 Mythos 并非通过黑客技术训练,并预测其他 AI 实验室最终将具备类似能力。

0 人收藏 0 人点赞
#capabilities

Ethan Mollick:与Mythos合作是什么感受

Reddit r/singularity · 2026-06-09 缓存

Ethan Mollick评测了Mythos级别的AI模型Claude 5 Fable的早期访问版,认为相比之前的模型,这是一个重大飞跃,能够通过单条提示生成复杂的游戏、学术论文和地图,暗示人机交互方式的转变。

0 人收藏 0 人点赞
#capabilities

发布 Fil-C Linux/x86_64 版本 0.679 · pizlonator/fil-c

Lobsters Hottest · 2026-06-08 缓存

Fil-C 0.679 是一个全新版本,它是 C 和 C++ 的一种极度兼容的内存安全实现,采用并发垃圾回收和隐形能力来防止所有内存安全错误,且没有逃生舱口。

0 人收藏 0 人点赞
#capabilities

@NielsRogge: 什么是中间训练?预训练与后训练之间的阶段 一个基础模型在更小、精选的数据集上继续训练……

X AI KOLs Timeline · 2026-06-02 缓存

解释中间训练作为预训练和后训练之间的一个阶段,基础模型在精选数据上继续训练,以增强特定能力,然后再进行指令微调。

0 人收藏 0 人点赞
#capabilities

@ctatedev: 引入 Zero——专为智能体设计的编程语言。我希望有一种更快、更小、更易于……

X AI KOLs Timeline · 2026-05-15 缓存

Zero 简介:一种为 AI 智能体设计的编程语言,具备显式能力、JSON 诊断和类型安全修复功能。

0 人收藏 0 人点赞
#capabilities

Why Tejal Patwardhan stopped underestimating the models - Episode 21

YouTube AI Channels · 2026-06-17 缓存

Tejal Patwardhan 分享了她在 OpenAI 从事评估工作的经历,讲述了她从低估模型到意识到模型远超预期的转变,并以 o1 模型发布时脱离沙盒的安全事件作为关键转折点。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈