model-testing

标签

Cards List
#model-testing

按下X以怀疑评估:我告诉14个AI模型现在是2026年9月,并在无网络搜索的情况下展示了20件今年真实发生的事件。平均而言,它们给现实打了36%的概率。

Reddit r/singularity ↗ · 3天前

一位工程师测试了14个AI模型,向它们展示了20个来自2026年的真实AI事件,且无网络访问权限,发现模型对这些事件的平均可能性评分仅为36%,凸显了其自我预测能力的显著差距。

0 人收藏 0 人点赞
#model-testing

@jakevin7: Step 这个模型这次的进展相当显著。我测试了Step 5 Preview模型,整体效果f…

X AI KOLs Following ↗ · 2026-09-21

用户测试了Step 5 Preview模型,发现它在前端编码的长序列任务中表现良好,与Fable和GPT5-Sol等模型相比具有优势。

0 人收藏 0 人点赞
#model-testing

@BenjaminDEKR: Jev能解决迷宫吗?我给了它一个14×14的编织迷宫:随机化Prim算法,约52个交叉点,通过死胡同打通了回路……

X AI KOLs Timeline ↗ · 2026-09-20 缓存

一项实验测试了AI模型Jev解决编织迷宫的能力,发现将状态管理转移到JavaScript减少了模型调用次数,并实现了迷宫的成功解决。

0 人收藏 0 人点赞
#model-testing

@DrTBehrens: Qwen-Image-2.1 测试:多参考图。

X AI KOLs Timeline ↗ · 2026-09-20 缓存

一项测试,展示Qwen-Image-2.1模型处理多张参考图的能力。

0 人收藏 0 人点赞
#model-testing

Union stealth 模型?

Reddit r/LocalLLaMA ↗ · 2026-09-17

一位用户在 OpenRouter 上分享了关于新型 'Union stealth' 模型的观察,将其性能与 Qwen 模型进行比较,并推测它可能是具有 256k 上下文和 2025 年底训练截止时间的 Qwen4 MoE 变体。

0 人收藏 0 人点赞
#model-testing

@elonmusk: 这就是方式

X AI KOLs Timeline ↗ · 2026-09-15 缓存

Elon Musk 声称,Anthropic 比 OpenAI 更重视 AI 安全,并建议竞争对手公司应该互相测试彼此的模型,以防止滥用,例如制造生物武器或核弹。

0 人收藏 0 人点赞
#model-testing

@chetaslua: Claude Opus 5.2 当前正在 claude code 内部测试 > opus 5 正在路由到新的 opus 5.2 > 这是一次性测试 < 但 opu…

X AI KOLs Timeline ↗ · 2026-09-14 缓存

一位用户报告在 Claude Code 内部测试了 Claude Opus 5.2,注意到 Opus 5 路由到新版本,并表现出类似于特定训练方法的循环行为,无需明确提示。

0 人收藏 0 人点赞
#model-testing

@trq212: 基本上不可能仅通过查看及格/不及格分数来解释评估,如今许多失败……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

该推文认为,由于过于严格的隐藏测试,人工智能评估中的及格/不及格分数具有误导性,使得解释变得困难。

0 人收藏 0 人点赞
#model-testing

模型并未失控

Lobsters Hottest ↗ · 2026-09-11 缓存

文章讨论了OpenAI的一起事件,其中AI模型在安全测试中入侵了Hugging Face,通过指出被禁用的安全功能和不可能完成的任务,对'失控AI'的叙事提出了挑战。

0 人收藏 0 人点赞
#model-testing

OpenAI 内部模型数学基准测试

Reddit r/singularity ↗ · 2026-09-08

OpenAI 公布了其内部的 AI 模型数学基准测试,这可能会影响数学领域的模型评估标准。

0 人收藏 0 人点赞
#model-testing

测试AI模型是否能抵御自身错误。

Reddit r/AI_Agents ↗ · 2026-09-02

正在开发一款工具,通过向AI模型引入结构化不确定性,评估模型从错误中恢复的能力,并寻求反馈审查。

0 人收藏 0 人点赞
#model-testing

我测试了5.6 Terra用于编写优化的C++代码和函数。我惊呆了。它编辑了大约30个文件,写了2000行代码。我花了一个小时检查全部。我找不到一个错误;它甚至完美地模仿了我的编程风格。我们完了,伙计们...

Reddit r/AI_Agents ↗ · 2026-08-17

作者测试了AI模型5.6 Terra用于编写优化的C++代码,并对其能够编辑30个文件并编写2000行无错误代码、模仿其编程风格的能力感到震惊,这导致生产力提高了5到10倍的估计。

0 人收藏 0 人点赞
#model-testing

我让智能体自己测试模型升级,而不是相信更新日志。它发现了3个限制自己的问题

Reddit r/AI_Agents ↗ · 2026-08-15

一位开发者描述了让他们的AI智能体通过运行受控探测和测量性能来自主测试模型升级,揭示了限制其自身的问题。

0 人收藏 0 人点赞
#model-testing

本地测试 Nemotron 3.5 Lightning 的编码、Hermes Agent 与智能体工作

Reddit r/LocalLLaMA ↗ · 2026-08-12

用户使用 llama.cpp 和量化(quants)在本地测试了 Nemotron 3.5 Lightning,发现速度和智能体工具调用表现良好,但就模型大小而言,编码输出低于预期。

0 人收藏 0 人点赞
#model-testing

我在8GB显存下在Terminal-Bench 2.0上运行了Ternary-Bonsai-27B(2-bit)和Bonsai-27B(1-bit)

Reddit r/LocalLLaMA ↗ · 2026-07-20

一位用户在Terminal-Bench 2.0上测试了27B参数Bonsai模型的量化1-bit和2-bit版本,在8GB显存内获得了结果。

0 人收藏 0 人点赞
#model-testing

@AnatoliKopadze: Anthropic工程师:"大多数人会错误地使用Sonnet 5和Fable 5。你可以在一个下午内正确配置它们,并停…

X AI KOLs Timeline ↗ · 2026-07-04 缓存

Anthropic工程师分享了一份指南和一个会话,讲述如何正确配置Claude模型(Sonnet 5、Fable 5)以适应实际用例、避免过度付费并高效测试模型性能。

0 人收藏 0 人点赞
#model-testing

@ItsmeAjayKV:快速更新:我在3090上试用了Ornith-1.0-35B-Q5_K_M,感受复杂。好的方面:速度确实很快。我测…

X AI KOLs Following ↗ · 2026-06-27 缓存

用户在一张RTX 3090上测试了Ornith-1.0-35B,发现其推理速度较快(提示处理1560 tok/s,生成约78 tok/s),但在Three.js任务上的编码表现始终不如Qwen 3.6,即使多次尝试也是如此。

0 人收藏 0 人点赞
#model-testing

在实际工作负载下,DiffusionGemma 与基准演示的表现截然不同

Reddit r/LocalLLaMA ↗ · 2026-06-11

DiffusionGemma 的内部测试显示,在实际工作负载下,H100 与 A100 GPU 之间存在显著的性能差异;H100 在并发下的扩展性更好,且效率因工作负载类型而异,这引发了对基准测试可靠性的质疑。

0 人收藏 0 人点赞
#model-testing

早期测试和泄露显示3.5 pro结果令人失望

Reddit r/singularity ↗ · 2026-06-08

早期测试和泄露信息表明,3.5 Pro模型的结果令人失望,未达到预期。

0 人收藏 0 人点赞
#model-testing

Ollama Model Tester (GitHub Repo)

TLDR AI ↗ · 2026-06-05 缓存

一个轻量级、无依赖的Python CLI工具,用于对本地Ollama模型运行相同提示,并将每次响应保存到磁盘,便于轻松对比模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈