ai-models

标签

Cards List
#ai-models

以前交给初级同事的活,现在 Opus 5.5 五分钟就干完了。我觉得大家还没意识到我们已经比 GDPval 前进了多远

Reddit r/singularity ↗ · 1小时前

作者认为,像 Opus 5.5 这样的前沿模型如今已经能完成大量以往交给初级同事的工作;在 GDPval 类任务上(GPT-5.2 → 5.5、Opus 4.7 → 5.5),基准测试成绩的飞速提升已经超出了公众讨论的节奏。他向社区提问:AI 委派正在如何重塑日常办公工作?

0 人收藏 0 人点赞
#ai-models

新模型过去每10周发布一次,现在每11天就有一次

Reddit r/ArtificialInteligence ↗ · 1小时前

一篇评论指出,AI模型的发布节奏已大幅加快——从大约每10周一次缩短到约每11天一次。

0 人收藏 0 人点赞
#ai-models

GPT-6 模型是有史以来训练最高效的模型之一。[ObviousBench]

Reddit r/singularity ↗ · 8小时前

据 ObviousBench 称,GPT-6 模型是有史以来训练最高效的 AI 模型之一。

0 人收藏 0 人点赞
#ai-models

我不明白为何总是对GPT 6/6.1 Sol相对于5.6和Astra的性能提出批评。我们为何忽略了那个明显的问题——其荒谬的价格和效率优势?它的成本仅为Sonnet 5.5的一半、5.6 Sol的三分之一、Opus 5.5的五分之一,以及Astra的1.7倍。

Reddit r/singularity ↗ · 15小时前

一位Reddit用户认为,GPT 6/6.1 Sol在性能上相对于其他模型受到不公平的批评,并强调了其显著的成本优势和效率提升。

0 人收藏 0 人点赞
#ai-models

@OpenAI: Codex Security Cloud 正在进行一次重大升级,通过 Daybreak Blue 默认包含访问具备网络功能模型的能力 …

X AI KOLs ↗ · 18小时前 缓存

Codex Security Cloud 迎来重大升级,默认通过 Daybreak Blue 访问网络能力模型,并提供持续的 GitHub 仓库扫描、提交审查和自动化修复准备功能,作为插件形式。

0 人收藏 0 人点赞
#ai-models

每次新模型发布,我们究竟在为什么欢呼?

Reddit r/AI_Agents ↗ · 23小时前

作者批评了对新AI模型发布的庆祝现象,指出虽然代码生成速度提升,但代码审查和决策中的瓶颈依然存在,导致输出增加但代码理解度下降。

0 人收藏 0 人点赞
#ai-models

我们取得了多大进展?比较LLMs:Sonnet 4 vs. GPT-5.5

Reddit r/ArtificialInteligence ↗ · 23小时前

本文通过为Flappy Bird游戏生成代码,比较Claude Sonnet 4和GPT-5.5,展示了LLM能力在1.5年内的显著进步。

0 人收藏 0 人点赞
#ai-models

@FinanceYF5: xAI至今仅成立约3年。在此期间,它已经构建了:- Colossus 1 + Colossus…

X AI KOLs Following ↗ · 昨天

xAI在三年内迅速发展了一个全面的AI生态系统,包括大规模的GPU基础设施(Colossus 1和2)以及一系列Grok模型和应用程序,强调集成系统和持续加速。

0 人收藏 0 人点赞
#ai-models

@VraserX:在这个价格点上,Sonnet 5.5 几乎毫无用处。每任务$7.60对比GPT-6 Astra Max的$3.26,简直是疯了。除非Sonnet…

X AI KOLs Timeline ↗ · 昨天 缓存

这条推文批判了Sonnet 5.5的性价比,突显其每任务成本远高于GPT-6 Astra Max,并质问除非性能卓越,否则其价值何在。

0 人收藏 0 人点赞
#ai-models

@interjc: Claude Opus/Sonnet的调用外部资源的能力是前所未有的,而且其设计品味非常精准——它可以创造…

X AI KOLs Following ↗ · 昨天

这篇文章强调了Claude Opus/Sonnet调用外部资源和创建动画的前所未有的能力,突出了它在使产品或演示更具吸引力方面的价值。

0 人收藏 0 人点赞
#ai-models

每个Sonnet 5.5版本的努力水平都有更便宜的Sol或Opus替代品,其人工分析分数同等或更高

Reddit r/singularity ↗ · 昨天

本文比较了Anthropic的Sonnet 5.5模型与更便宜的替代品如Sol或Opus的成本与性能,表明后者具有同等或更高的人工分析分数。

0 人收藏 0 人点赞
#ai-models

Qwen next 3.8 与 3.8 27b 对比 Sonnet 5.5 low 和 Sonnet 5.5 medium.

Reddit r/LocalLLaMA ↗ · 昨天

本文基于个人经验和比较,探讨了像Qwen-Next 3.8这样的本地AI模型如何现在能与Sonnet 5.5等大型模型竞争。

0 人收藏 0 人点赞
#ai-models

@gabriel1: AI 模型的病毒式传播潜力被严重低估,如果你能一次生成前所未有的视觉内容…

X AI KOLs Following ↗ · 昨天 缓存

一条推文讨论了 AI 模型病毒式传播潜力的低估问题,比较了 sol 6 和 opus 5.5 模型在性价比智能方面的表现,并指出炫酷的演示能推动采用率。

0 人收藏 0 人点赞
#ai-models

Sonnet 5.5 比 Opus 5.5 更差,但成本更高??Sonnet 与 Fable 5.1 价格相同?原因:Sonnet 5.5 的 token 效率极低。别被骗了,继续使用 Opus!

Reddit r/singularity ↗ · 昨天

该帖子比较了 Sonnet 5.5 和 Opus 5.5,指出 Sonnet 5.5 的 token 效率较低且成本更高,建议用户继续使用 Opus。

0 人收藏 0 人点赞
#ai-models

@patio11:在最近的约两次大型实验室模型发布中,他们从“这将是来自中位数低资深同事的可接受输出”变为……

X AI KOLs Timeline ↗ · 昨天 缓存

Patrick McKenzie 观察到,主要实验室近期发布的AI模型在输出质量上有了显著提升,从平均同事水平跃升至令人印象深刻的好水平。

0 人收藏 0 人点赞
#ai-models

@VraserX: 这些据称是泄露的Gemini 4 Pro基准测试,所以,很可能都是胡扯。但如果它们是真的,Gemini 4 Pro w…

X AI KOLs Following ↗ · 昨天 缓存

本文讨论了泄露的Gemini 4 Pro基准测试,暗示其可能超越GPT-6 Astra和Claude Opus 5.5,但作者由于Google在基准测试操纵方面的历史而保持怀疑。

0 人收藏 0 人点赞
#ai-models

修改后的 Qwen 3.8 27B 模型改进 Windows 凭证转储工具以规避 EDR 检测

Reddit r/LocalLLaMA ↗ · 2天前

一位安全研究员使用了一个修改后的无审查 Qwen 3.8 27B 模型来创建一个可执行文件,用于转储 Windows LSASS 内存并同时规避 EDR 检测,突显了本地 AI 模型在无限制网络安全研究中的优势。

0 人收藏 0 人点赞
#ai-models

@rohanpaul_ai: Boris Cherny, Claude Code creator at Anthrpic: "更通用的模型总是比更具体的模型表现更好。……"

X AI KOLs Timeline ↗ · 2天前 缓存

Boris Cherny,Claude Code在Anthropic的创作者,建议优先选择通用AI模型而非具体模型,指出脚手架改进往往是临时的,并会被新模型取代。

0 人收藏 0 人点赞
#ai-models

Jev 思考 "我不知道",但未言明:介绍用于概率校准的 Sys1Cal-v1 数据集

Hugging Face Daily Papers ↗ · 2天前 缓存

介绍了 Sys1Cal-v1 数据集,用于评估 AI 模型的概率校准,表明像 Jev 这样的模型可能在二进制输出中抑制不确定性。

0 人收藏 0 人点赞
#ai-models

2026年的大语言模型(截至目前)

Simon Willison's Blog ↗ · 2天前 缓存

Simon Willison在WeAreDevelopers World Congress North America的主题演讲总结了2026年大语言模型的关键发展,包括可靠的编程智能体的兴起,以及像Claude Opus 4.5和GPT-5.1这样的模型发布。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈