标签
Splish是Splash的一个非官方分支,专为Apple M5 Max芯片优化Metal内核,能够在不降低质量的情况下,将AI推理速度提升高达1.5倍,适用于Qwen3.8-27B等模型。
本文展示了如何将GLM-5.3-Flash转换为Jev式的System One决策模型,通过单次前向传播实现类型化决策,基准测试显示其在准确性和速度上与专用模型相当。
Tauon 是一种新型优化器,使用多项式和正交化技术,在小型 GPT-Mini 模型的初始基准测试中超越 Muon 和 AdamW,显示出更低的损失和更快的步长时间。
BenchBench是一个基准测试,挑战多模态LLMs竞争组装Ikea家具,以测试其实际AI能力。
据称性能超越 GPT-6 Sol 的 Sonnet 5.5,在发布前收到了最后一刻的升级,预计将于周一发布。
VSArena是一个用于评估交互式3D环境中AI代理的开放基准,提供远程执行和公共排行榜,无需物理机器人即可评估感知、推理和行动能力。
本文展示了如何调整 GLM-5.3-Flash 大型语言模型使其作为类似于 Jev 的类型化决策模型运行,在单次前向传播中实现可比的准确性和速度,并支持图像决策。
jevos 是一款开源工具,能在笔记本电脑 CPU 上通过一次前向传播处理带是/否问题的文本,并提供了与 Jev 和 Lay 的性能基准对比。
Pixel Canary,一款隐身 AI 模型,已在 Cline 中免费发布。它在 Next.js Agent Evals 基准测试中与 GPT-6 Astra 性能持平,并在 Web 和移动开发任务上优于 Kimi K3。
一个团队宣布他们在NVIDIA的SOL-ExecBench基准测试中所有赛道均获得第一名,使用B200 GPU的真实生产内核击败了583个团队。
Mica v0.1 4B 在俄罗斯方块游戏中表现优于 Kev 4B,清除约4倍多的方块行,并在某些情况下坚持到了最后,仅使用棋盘描述,无需搜索或前瞻。
一个名为GPT 6 Astra的LLM代理在NetHack游戏中实现了飞升,标志着首次有LLM通过自主构建工具击败这款复杂游戏的记录实例。
小米的MiMo-V2.6-Pro,一款具有MIT许可权重的AI模型,在OpenRouter上以每百万输出令牌0.87美元的价格列出,突显了其与昂贵前沿模型相比的成本效益。
本文比较了TypeSafe的Jev模型与开源Kev替代方案,在一个新的数据集上测试了它们的准确性、令牌使用量和速度,以避免数据泄漏,发现性能相似,但实现上有差异。
BRIDGE ASR 2.0 是一个基准,评估语音识别模型在21种语言的真实双人对话中的表现,重点关注语码转换和多语言性能,以增强AI和机器人中的语音交互。
宣布了 Gemini 4 pro 的一个新检查点,显示在 6 分钟内有详细输出,并在 ArenaAI 上超越了 Gemini 3.8 flash。
本文提出一个任务替代框架,利用AI代理和软件自动化企业治理审查。基准测试如DGF-Bench显示,Gemini 3.8 Flash等模型在替代指定审查任务的人类执行方面可取得高成功率。
介绍了IndicBankBench,一个包含799个案例的基准测试,用于评估印度零售银行语言模型助手的安全性和可靠性,采用多阶段评估,并公开发布代码和数据。
RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。
TWIST 是一个用于评估对话记忆系统中干预质量的提议基准套件,具有人工验证的轨道,用于检测未解决的张力和过时事实等故障,揭示了传统指标忽略的召回率与特异性之间的权衡。