llm-comparison

标签

Cards List
#llm-comparison

代码的 Token 签名:跨大型语言模型的编程行为比较

arXiv cs.CL ↗ · 5天前 缓存

本文提出了 CLIC,一个视觉分析系统,通过 token 频率分析来比较大型语言模型的编程行为,为 LLM 选择和提示工程提供见解。

0 人收藏 0 人点赞
#llm-comparison

看到人们对大型语言模型的提示方式如此不同,真有趣

Reddit r/LocalLLaMA ↗ · 6天前

作者幽默地对比了他对本地GLM 5.3 Flash模型使用的精确提示方式,与他兄弟在编程任务中对GPT-6-Astra的斥责方式,突出了不同的大型语言模型交互风格。

0 人收藏 0 人点赞
#llm-comparison

@LangChain:我们对 Jev 与 LLM 裁判在准确性、可重复性、延迟和成本方面进行了测试,以查看 System One 模型是否能够……

X AI KOLs Timeline ↗ · 2026-09-19 缓存

本文评估了来自 TypeSafe AI 的 System One 模型 Jev 作为一个新的代理评估器,显示它在一致性、速度和成本方面优于 LLM 裁判。

0 人收藏 0 人点赞
#llm-comparison

@akshay_pachaar: LLMs 与 Jev,清晰解释!简而言之,关键区别不在于 Jev 生成得更快。Jev 根本不生成文本 …

X AI KOLs Timeline ↗ · 2026-09-19 缓存

本文解释了 LLMs 与 Jev 的关键区别,强调 Jev 并行评估带有概率的预定义决策,而 LLMs 则是顺序生成文本。

0 人收藏 0 人点赞
#llm-comparison

AI大学 - 成本管理

Reddit r/AI_Agents ↗ · 2026-09-16

个人详细介绍了他们管理AI订阅成本的方法,通过基准测试模型并在它们之间动态切换,以优化性能和支出。

0 人收藏 0 人点赞
#llm-comparison

MiniCPM5-2B 对比 Spark-X2.5-4B / -64% 思考,x1.5 速度同时保持高准确性

Reddit r/LocalLLaMA ↗ · 2026-09-16

在一项多步骤客户服务代理任务上的对比测试中,MiniCPM5-2B 准确且高效地完成了任务,而 Spark-X2.5-4B 表现不佳,突出了代理在任务执行中的作用。

0 人收藏 0 人点赞
#llm-comparison

大语言模型与经典机器学习在分布偏移和对抗性规避下的网络入侵检测三轴压力测试

arXiv cs.LG ↗ · 2026-09-15 缓存

本文比较了XGBoost和RoBERTa-LoRA在相同数据集、跨数据集迁移和对抗性规避三个轴上的网络入侵检测性能,表明不存在通用的优胜者,性能取决于评估条件。

0 人收藏 0 人点赞
#llm-comparison

Base-10的Charlie O'Neill谈为何Kimi和GLM“几乎客观地”优于Opus 5

Reddit r/LocalLLaMA ↗ · 2026-09-14

本文推荐了一期YouTube节目,嘉宾是来自Baseten的Charlie O'Neill,讨论Kimi和GLM模型如何优于Opus 5,并针对AI进展和AGI的质疑进行回应。

0 人收藏 0 人点赞
#llm-comparison

GLM5.3 Flash 优于 DSV4 Flash 吗?

Reddit r/LocalLLaMA ↗ · 2026-09-03

用户基于基准测试比较了 GLM 5.3 Flash 和 DSV4 Flash,并寻求在 Mac Studio M3 Ultra 上实际用户反馈,以评估是否有显著提升。

0 人收藏 0 人点赞
#llm-comparison

AI视频生成模型仍需努力

Reddit r/artificial ↗ · 2026-08-25

作者批评了像Seedance 2.5这样的AI视频生成模型,指出它们对提示的理解很弱,并且存在拼写错误等问题,暗示这些模型与LLM相比仍面临重大挑战。

0 人收藏 0 人点赞
#llm-comparison

LLM-as-a-Judge测试:Gemini与Claude在生成单页HTML学习指南中的对比。

Reddit r/ArtificialInteligence ↗ · 2026-08-24

一项比较研究,通过LLM-as-a-Judge方法评估Gemini和Claude AI模型在生成单页HTML学习指南方面的能力。

0 人收藏 0 人点赞
#llm-comparison

@YRSM_Simon: 让 Claude Fable 5 和本地跑的 DeepSeek V4 Flash(DGX Spark,thinking 开满)下国际象棋,下出了年度最离谱对比: Fable:每步思考 ~2,600 token,50 秒落子 V4 Flas…

X AI KOLs Following ↗ · 2026-08-04 缓存

作者让 Claude Fable 5 和本地运行的 DeepSeek V4 Flash 下国际象棋,结果 DeepSeek 在长思考下每步消耗数万 token 甚至超时,但局面反而占优,一局耗时 5 小时尚未结束。

0 人收藏 0 人点赞
#llm-comparison

Qwen3.8-Max: Oneshots,少数能与Opus一样成功完成鱼缸破裂模拟的模型之一

Reddit r/LocalLLaMA ↗ · 2026-08-04

Qwen3.8-Max 被突出展示为少数几个与 Opus 一起成功完成鱼缸破裂模拟的模型之一,展示了其在复杂物理推理任务中的能力。

0 人收藏 0 人点赞
#llm-comparison

ChatGPT 与 Claude 在 2026 年数据科学领域的对比:从符号推理到程序执行的转变

Reddit r/ArtificialInteligence ↗ · 2026-07-30

本文比较了 2026 年数据科学工作流中的 ChatGPT 和 Claude,指出两个模型现在都依赖原生 Python 执行计算。ChatGPT 在原始数据处理和统计建模方面表现出色,而 Claude 在交互式可视化和大上下文整合方面占据主导地位。

0 人收藏 0 人点赞
#llm-comparison

比较Fable及其他10个LLM在重构LangGraph上帝节点方面的表现

Hacker News Top ↗ · 2026-07-02 缓存

详细比较11个LLM在重构LangGraph上帝节点方面的表现,包括提案、评估以及分析哪些模型作为生成器和评估器表现最佳。

0 人收藏 0 人点赞
#llm-comparison

@rohanpaul_ai: atomic[.]chat,一款本地运行LLM的桌面应用,对Claude Sonnet 5、Claude Opus 4……进行了一次极具揭示性的对比。

X AI KOLs Timeline ↗ · 2026-07-01 缓存

atomic.chat进行了一项对比,显示Claude Sonnet 5在三个物理编码演示中与GPT 5.5表现相当,但成本低6倍,且使用的token数少于其他模型。

0 人收藏 0 人点赞
#llm-comparison

部分模型一周内定价相同,于是我观察了人们实际使用的模型

Reddit r/ArtificialInteligence ↗ · 2026-06-25

当多个AI模型以相同价格运行一周时,实际的token使用量揭示了与排行榜排名不同的偏好差异,表明编码和通用聊天各有不同的顶级模型,且长上下文使用集中在两个受信任的模型上。

0 人收藏 0 人点赞
#llm-comparison

一个机器人正朝你冲刺。你希望它运行在Claude还是Grok上?

Hacker News Top ↗ · 2026-06-17 缓存

OpenRouter的一个实验将11个LLM投入一个2D大逃杀游戏,发现Grok 4.1 Fast以低成本赢得了43%的对局,而Claude Sonnet 4.6赢的较少但表现出更多合作行为,凸显了基准测试得分与真实游戏性能之间的差异。

0 人收藏 0 人点赞
#llm-comparison

Nemotron - 深度之王?4个≤120B模型的对比

Reddit r/LocalLLaMA ↗ · 2026-06-14

使用Strix Halo硬件对四个大型语言模型(≤120B参数)在深度上下文性能上的比较。与GPT-OSS和Qwen模型相比,Nemotron Super在深度上下文中的提示处理速度表现出色。

0 人收藏 0 人点赞
#llm-comparison

你真的能用本地模型替代付费模型吗?

Reddit r/LocalLLaMA ↗ · 2026-06-10

一位社区成员认为,尽管取得了令人瞩目的进展,但在复杂的代理任务上,本地开源模型仍然远远落后于前沿闭源模型,并警告不要过度吹嘘替代的说法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈