新闻

Cards List

对开放权重的攻击持续加剧。

Reddit r/LocalLLaMA · 29分钟前

伊利诺伊州州长普利兹克成立了AI内阁以评估风险,作者批评这是受到封闭权重API供应商的影响。文章呼吁公众参与,支持开放权重并教育他人了解这一问题。

0 人收藏 0 人点赞

我两个代理的 git 工作树的干净合并,但它自身的测试失败了

Reddit r/AI_Agents · 41分钟前

作者描述了一个实验,其中合并两个 AI 代理的 git 工作树导致了测试失败,尽管合并是干净的,突显了在没有相互意识的情况下并行代理开发的挑战。

0 人收藏 0 人点赞

Vals AI RSI指数:Opus 5.5于五项任务中的一项超越已发布的人类基线;将完全RSI的推断日期从2027年8月提前至2027年7月

Reddit r/singularity · 1小时前

Vals AI RSI指数显示,Opus 5.5 AI模型在五项任务中的一项击败了已发布的人类基线,从而将实现完全RSI的预测日期从2027年8月调整为2027年7月。

0 人收藏 0 人点赞

单token便宜,单任务昂贵:AI模型定价与性能对比 [OC]

Reddit r/artificial · 2小时前

本文分析了像Anthropic的Opus 5.5和ChatGPT的Astra等AI模型的成本效益,使用Artificial Analysis分数来比较单token定价与任务完成效率。

0 人收藏 0 人点赞

写下你对ASI的定义,五年后我们再来看看。

Reddit r/artificial · 2小时前

作者邀请人们现在定义ASI,并在五年后重新审视,以比较关于其达成的预测。

0 人收藏 0 人点赞

OpenAI希望咨询顶尖数学家以避免再次失误

The Verge · 2小时前 缓存

OpenAI成立了一个由顶尖数学家组成的独立顾问小组,指导公司处理数学研究和人工智能互动,旨在避免未来的声誉危机。

0 人收藏 0 人点赞

哪些AI模型最赚钱?

Reddit r/artificial · 2小时前

这篇文章探讨了哪些AI模型最赚钱,指出像Grok和Muse这样的模型在亏损,而Opus 5.5和Fable 5.1是关键玩家,Anthropic可能很快发布新的Fable模型。

0 人收藏 0 人点赞

@bcherny: 我使用 Opus 5.5 通过 Lean 对 Claude Agent SDK 进行了形式化验证。几个简短的提示 = 16 个 PR 修复了各种 bug…

X AI KOLs Timeline · 3小时前 缓存

作者使用 Claude 的 Opus 5.5 模型通过 Lean 对 Claude Agent SDK 进行了形式化验证,生成了 16 个 PR 来修复 bug 和竞态条件,并建议结合 Lean 和 TLA+ 以增强 bug 查找能力。

0 人收藏 0 人点赞

我们无法控制的超级智能,为何还要为我们做事?

Reddit r/artificial · 3小时前

这篇文章质疑,如果超级人工智能无法控制,它为何会满足人类的欲望,如治愈癌症或创造飞行汽车?

0 人收藏 0 人点赞

特朗普在United Nations正式更改人工智能的名称

Reddit r/artificial · 3小时前

特朗普在United Nations宣布了人工智能的新名称,这一举动在即将到来的中期选举中被解读为政治行为。

0 人收藏 0 人点赞

Paramount 需要发行更多电影才能使这笔合并成功

The Verge · 4小时前 缓存

Paramount 在与 Warner Bros. Discovery 合并后,必须每年发行至少 30 部电影,以满足和解配额并避免处罚。这一要求旨在保护行业就业,但考虑到近期的电影产出水平,可能具有挑战性。

0 人收藏 0 人点赞

@SpaceX:目标不早于10月1日周四发射Falcon 9运载@NASA的Crew-13任务前往@Space_Station → …

X AI KOLs Following · 4小时前 缓存

SpaceX的目标是不早于10月1日周四使用Falcon 9火箭发射NASA的Crew-13任务前往国际空间站。

0 人收藏 0 人点赞

AI富足要求每周工作4小时

Reddit r/artificial · 4小时前 缓存

文章认为,如果AI带来显著的生产力提升,那么其成果应转化为更短的工作周(例如每周工作4小时),而非高管利润增加,同时回顾了历史工时趋势与公众对AI就业影响的看法。

0 人收藏 0 人点赞

299个真实用户意图测试Jev与生产基线的对比。结果如下。

Reddit r/AI_Agents · 4小时前

文章报告了glm-4-flash和TypeSafe Jev在299个真实用户意图上的性能比较,显示glm-4-flash的准确率更高,但TypeSafe Jev的速度更快且成本更低。

0 人收藏 0 人点赞

来自Cursor、OpenAI和Anthropic的协调器系列在同一周内相继推出。审查工作并未发生变化。

Reddit r/AI_Agents · 5小时前

多家公司在同一周内发布了针对AI代理的协调工具,但这些工具只是扩展了现有的代码审查流程,并未从根本上改变工作本身。

0 人收藏 0 人点赞

Snorkel AI 估值增至35亿美元,AI训练数据需求激增

TechCrunch AI · 5小时前 缓存

Snorkel AI 在完成3.5亿美元的E轮融资后,估值翻三倍至35亿美元,这得益于AI训练数据需求的激增。公司现在专注于数据即服务,通过合成和专家生成的数据提供完整数据集和模拟环境。

0 人收藏 0 人点赞

@ycombinator: 攻击无人机正在重塑现代战争,但许多国家仍然缺乏有效防御其空域的方法。Ea…

X AI KOLs Following · 5小时前 缓存

Earendil Robotics 正在开发自主拦截无人机和软件,以提供经济实惠且可扩展的防空解决方案,减少对广泛飞行员培训的需求。

0 人收藏 0 人点赞

AGI竞赛

Reddit r/singularity · 5小时前

这篇文章探讨了实现通用人工智能(AGI)的竞争竞赛及其对AI发展的影响。

0 人收藏 0 人点赞

如何谈论“AI”而不增加拟人化

Lobsters Hottest · 5小时前 缓存

本文主张在讨论AI技术时避免使用拟人化语言,并建议使用替代术语以促进更清晰、更准确的对话。

0 人收藏 0 人点赞

@rohanpaul_ai: @thehypedotnews 的非常有趣的实验 gpt-6 sol vs grok 4.7 vs gpt-6 astra vs muse spark 1.3 令人惊讶的是如此少的…

X AI KOLs Timeline · 5小时前 缓存

这些实验比较了GPT-6 Sol、Grok 4.7、GPT-6 Astra和Muse Spark 1.3等AI模型如何从提示生成浏览器产物,重点展示了GPT-6 Sol以极少的推理即可生成可工作的HTML文件的效率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈