标签
Antirez 通过质疑新款 Mac Studio M5 Ultra 在运行 GLM 5.3 时的性能来评估其价值,涉及最佳批处理和并行会话以实现终端用户速度。
Tiangong人形机器人在半决赛中将其100米短跑成绩从9.32秒提升至8.86秒,引发了对其未来表现能否突破7秒的疑问。
Apple 发布了新款 Mac Studio,搭载 M5 Max 和 M5 Ultra 芯片,提供高达 4.3 倍更快的 AI 性能和 512GB 统一内存,适用于设备端 AI 和专业工作流程。
苹果宣布推出搭载全新 M6 和 M5 Ultra 处理器的更新版 Mac Mini 和 Mac Studio,专注于人工智能性能和增强的连接性,现已开始预订,发货将于 2026 年 9 月 22 日开始。
苹果宣布更新款的Mac Mini搭载新M6芯片,Mac Studio搭载M5 Ultra芯片,特点是性能提升、AI功能增强,以及新的定价策略。
X Square Robot的WALL-B具身AI模型在5小时14分钟内分拣了10,000个包裹,实现了每小时1,911个包裹的吞吐量,展示了在物理AI和机器人技术用于物流任务方面的先进能力。
NVIDIA的编码代理在ARC-AGI-3交互式推理基准测试中取得了100%的满分,展示了先进的AI推理能力。
一位用户分享了Claude 3.5 Sonnet如何基于早期模型差异进行外推,准确预测了Qwen 3.8 27B的未来性能,基准测试结果非常接近。
Claude Opus 5,连同 Claude Code 和一个技能,在 ARC AGI 3 基准的公共集上得分 100%,表明该基准可能没有想象中那么具有挑战性。
本文介绍了 DeepSeek V4 Flash 0731 在 Strix Halo 硬件上的基准测试结果,展示了不同草稿模型和 n_max 设置下的性能,得出结论 n_max=3 提供了最佳的速度平衡。
用户分享了使用Qwen 3.8 27b模型搭配DeepSeek Harness的积极体验,赞扬其稳定性和长上下文处理能力,但提到速度限制,并期待未来的模型发布。
Molei Tao 介绍了 FLARE,这是一种扩散语言模型,其性能接近 GPT5,且推理速度显著更快。
一条推文指出基准测试很快就会饱和,并以模型 GPT-5.6 Sol Pro 为例,该模型在 prinzbench 上获得了 91/99 的分数,还有两个问题未解决。
GPT5.6 Sol Ultra 在 TerminalBench 编程基准测试中达到 91.9%,表明编程任务正在接近解决。
一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。
Claude Fable 在远程劳动自动化指数上取得 16.10% 的成绩,是次佳模型 Opus 的两倍
一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。
一条推文认为,GLM 5.2 和 Kimi 2.7 仅略微逊色于顶级模型,通过合理的规划/系统可以处理 95-99% 的复杂任务。并警告美国监管可能有利于中国 AI 参与者。