@askalphaxiv: “Probabilistic Tiny Recursive Model” 本文通过在测试时添加高斯噪声使Tiny Recursive Models随机化…
摘要
本文介绍了一种方法,通过在测试时添加高斯噪声并进行并行推理,使Tiny Recursive Models随机化,在不重新训练的情况下,在PPBench和Sudoku-Extreme上取得了显著的性能提升。
“Probabilistic Tiny Recursive Model” 本文通过在测试时添加高斯噪声、运行并行推理,并利用已有的Q头选择最佳答案,使Tiny Recursive Models随机化。无需重新训练,无需任务特定技巧,其PPBench从62.6%跃升至91.2%,Sudoku-Extreme从87.4%跃升至98.75%。
相似文章
Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。
OpenAI 推出 Astra,其强大(且具争议性)的新模型
OpenAI 已发布 Astra,其最新且最强大的 AI 模型,以其强大的网络安全和编码能力而闻名,但也因其不透明的推理技术而具有争议性。
IFM/K2-Horizon-MoVA-36B-A4B-GGUF · Hugging Face
这是K2-Horizon-MoVA-36B-A4B模型的GGUF版本,一个具有36B总参数和每令牌4B活动参数的混合专家AI模型,针对llama.cpp使用进行了优化。它在代理和推理基准测试中展示了前沿级别的性能,与更大和封闭的模型竞争。
SALA: 面向复杂上下文学习的语义感知逻辑对齐框架
SALA 是一种语义感知逻辑对齐框架,通过自动学习特定任务的推理操作并使用动态时间规整进行灵活对齐,从而改进上下文学习中复杂推理的示例选择,性能优于现有方法。
Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 推出了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,新型 AI 模型,在编码、推理和网络安全方面有显著改进,以低成本提供前沿级性能。