标签
一位工程师测试了14个AI模型,向它们展示了20个来自2026年的真实AI事件,且无网络访问权限,发现模型对这些事件的平均可能性评分仅为36%,凸显了其自我预测能力的显著差距。
用户测试了Step 5 Preview模型,发现它在前端编码的长序列任务中表现良好,与Fable和GPT5-Sol等模型相比具有优势。
一项实验测试了AI模型Jev解决编织迷宫的能力,发现将状态管理转移到JavaScript减少了模型调用次数,并实现了迷宫的成功解决。
一位用户在 OpenRouter 上分享了关于新型 'Union stealth' 模型的观察,将其性能与 Qwen 模型进行比较,并推测它可能是具有 256k 上下文和 2025 年底训练截止时间的 Qwen4 MoE 变体。
Elon Musk 声称,Anthropic 比 OpenAI 更重视 AI 安全,并建议竞争对手公司应该互相测试彼此的模型,以防止滥用,例如制造生物武器或核弹。
一位用户报告在 Claude Code 内部测试了 Claude Opus 5.2,注意到 Opus 5 路由到新版本,并表现出类似于特定训练方法的循环行为,无需明确提示。
该推文认为,由于过于严格的隐藏测试,人工智能评估中的及格/不及格分数具有误导性,使得解释变得困难。
文章讨论了OpenAI的一起事件,其中AI模型在安全测试中入侵了Hugging Face,通过指出被禁用的安全功能和不可能完成的任务,对'失控AI'的叙事提出了挑战。
作者测试了AI模型5.6 Terra用于编写优化的C++代码,并对其能够编辑30个文件并编写2000行无错误代码、模仿其编程风格的能力感到震惊,这导致生产力提高了5到10倍的估计。
一位开发者描述了让他们的AI智能体通过运行受控探测和测量性能来自主测试模型升级,揭示了限制其自身的问题。
用户使用 llama.cpp 和量化(quants)在本地测试了 Nemotron 3.5 Lightning,发现速度和智能体工具调用表现良好,但就模型大小而言,编码输出低于预期。
一位用户在Terminal-Bench 2.0上测试了27B参数Bonsai模型的量化1-bit和2-bit版本,在8GB显存内获得了结果。
Anthropic工程师分享了一份指南和一个会话,讲述如何正确配置Claude模型(Sonnet 5、Fable 5)以适应实际用例、避免过度付费并高效测试模型性能。
用户在一张RTX 3090上测试了Ornith-1.0-35B,发现其推理速度较快(提示处理1560 tok/s,生成约78 tok/s),但在Three.js任务上的编码表现始终不如Qwen 3.6,即使多次尝试也是如此。
DiffusionGemma 的内部测试显示,在实际工作负载下,H100 与 A100 GPU 之间存在显著的性能差异;H100 在并发下的扩展性更好,且效率因工作负载类型而异,这引发了对基准测试可靠性的质疑。
一个轻量级、无依赖的Python CLI工具,用于对本地Ollama模型运行相同提示,并将每次响应保存到磁盘,便于轻松对比模型。