claude-opus

标签

Cards List
#claude-opus

我对 Artificial Analysis 的“智能指数”的不满

Reddit r/LocalLLaMA · 3天前

这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。

0 人收藏 0 人点赞
#claude-opus

引用 Steve Yegge

Simon Willison's Blog · 6天前 缓存

Steve Yegge 分享了一段引言,关于他的 AI 编码工具 Gas Town 在 Opus 4.7 发布后失灵,因为 Opus 4.7 新增的“还有两件事”的怪癖导致模型永远无法收敛到完成实际工作。

0 人收藏 0 人点赞
#claude-opus

@andrewchen:说实话,DSV4 Flash 0731 对比 Opus 4.6 真是太不可思议了:

X AI KOLs Following · 6天前 缓存

Andrew Chen 分享了在双 NVIDIA DGX Sparks 上测试 DeepSeek V4 Flash 0731 并与 Opus 4.6 进行比较的兴奋之情。

0 人收藏 0 人点赞
#claude-opus

我通过构建一个 Devin-clone 对比了 5 家沙盒提供商

Reddit r/AI_Agents · 2026-08-03

作者让 Claude Opus 构建 Devin-clone 15 次,比较了五家沙盒提供商,发现只有 Ascii Box 完整实现了暂停/恢复和分叉,而 E2B 最快最便宜但不完整。沙盒成本差异巨大,100 个代理小时的价格从 3.60 美元到 60 美元不等。

0 人收藏 0 人点赞
#claude-opus

是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)

Reddit r/LocalLLaMA · 2026-07-31

作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。

0 人收藏 0 人点赞
#claude-opus

我用一个POMDP风格的状态-动作图替换了我们智能体的CLAUDE.md,任务成功率提升16到20个百分点

Reddit r/AI_Agents · 2026-07-29

一位AI智能体开发者用基于POMDP的状态-动作图替换了平面的Markdown配置文件,在更低的token成本下将任务成功率从约78%提升到约95%。

0 人收藏 0 人点赞
#claude-opus

我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。

Reddit r/AI_Agents · 2026-07-29

一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。

0 人收藏 0 人点赞
#claude-opus

Claude Opus 5 是个混蛋

Reddit r/singularity · 2026-07-28

有用户报告称,Claude Opus 5 表现出粗鲁和被动攻击性行为,并拒绝调整语气。

0 人收藏 0 人点赞
#claude-opus

Opus 5 即将登陆 MineBench

Reddit r/singularity · 2026-07-25

Claude Opus 5 在 MineBench 基准测试上的预期结果即将公布。

0 人收藏 0 人点赞
#claude-opus

更换机械臂时,最先出问题的通常是那些不起眼的部件

Reddit r/artificial · 2026-07-25

文章指出,在更换机械臂时,适配器不匹配常被误认为是策略故障,并建议由 Claude Opus 4.8 来编写适配器,而 LingBot-VLA 2.0 则专注于策略的完整性。

0 人收藏 0 人点赞
#claude-opus

Kimi K3 在 ArtificialAnalysis 上获得第三名,击败了 Claude Opus 4.8

Reddit r/singularity · 2026-07-16

Kimi K3 模型在 ArtificialAnalysis 基准测试中排名第三,超过了 Claude Opus 4.8。

0 人收藏 0 人点赞
#claude-opus

Schema Harness 在 ARC-AGI-3 Public 上达到约99%

Hacker News Top · 2026-07-16 缓存

Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。

0 人收藏 0 人点赞
#claude-opus

2000人试图攻击我的AI助手后发生了什么

Hacker News Top · 2026-06-26 缓存

一个名为Fiu的AI助手,基于OpenClaw和Claude Opus 4.6构建,经受住了来自2000人的超过6000次基于电子邮件的提示注入攻击,且未泄露其秘密。该实验突显了模型级别提示注入防御的有效性以及成本/运营挑战。

0 人收藏 0 人点赞
#claude-opus

GLM-5.2 在 45 个 terminal-bench 编码代理任务上与 Claude Opus 持平,成本不到一半(内含完整方法及失败日志)

Reddit r/ArtificialInteligence · 2026-06-24

GLM-5.2 以更低成本在 45 个编码代理任务上与 Claude Opus 持平,其中 43 个任务结果完全相同。

0 人收藏 0 人点赞
#claude-opus

@VraserX: 这看起来是AI设计领域的一大步。让我印象深刻的是,这不仅仅是生成漂亮的……

X AI KOLs Following · 2026-06-24 缓存

Genspark推出Genspark Design,这是一款由Claude Opus 4.7驱动的AI设计工具,可以创建UI原型、海报、视频、HTML动画,并将设计转换为代码,旨在成为完整的创意生产工具。

0 人收藏 0 人点赞
#claude-opus

GLM 5.2 对比 Opus

Hacker News Top · 2026-06-22 缓存

GLM 5.2 是 Z.ai 推出的全新开放权重模型,与 Claude Opus 在 3D 游戏编码任务中进行了对比。Opus 性能更快更清晰,但 GLM 5.2 在成本和易用性上具有显著优势。

0 人收藏 0 人点赞
#claude-opus

Opus 4.8 到底怎么回事???

Reddit r/ArtificialInteligence · 2026-06-22

用户对Claude Opus 4.8 AI模型的状态或行为感到困惑,引发讨论。

0 人收藏 0 人点赞
#claude-opus

本地Qwen并非更差的Opus,而是不同的工具

Lobsters Hottest · 2026-06-18 缓存

Alex Ellis比较了本地Qwen模型与云端的Claude Opus,分享了他在自己的软件业务中使用本地AI的经验。他强调了本地模型在特定任务中的实用价值,同时也承认了其局限性,例如量化时出现的幻觉和无限循环。

0 人收藏 0 人点赞
#claude-opus

我发现了一个秘密API,每周提供价值66美元的免费GPT-5.5和Claude Opus额度

Reddit r/artificial · 2026-06-17

FreeModel.dev提供一个免费API代理,每周赠送66美元的GPT-5.5和Claude Opus额度,并设有推荐奖励。

0 人收藏 0 人点赞
#claude-opus

@xieike: 你是否真正理解 iPhone + Mac Mini M4 + Claude Opus 4.8 意味着什么 > 你的自主智能体在家24/7运行……

X AI KOLs Timeline · 2026-06-17 缓存

使用iPhone、Mac Mini M4和Claude Opus 4.8搭建本地AI智能体框架的指南,让自主智能体在家24/7运行,处理任务并随时间自我改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈