标签
本文认为,预训练数据是大型语言模型在数学和编程方面表现出色的主要原因,而非可验证性。
在 RTX 5090 上实时运行 Qwen 3.8 27B 模型以解决覆盖设计数学问题的实验,展示了开源 AI 在消费级硬件上推动科学创新的潜力。
本文推导出一致性哈希系统中误差分布的数学公式,有助于跨服务器的工作负载优化。这是一个技术推导,包括WebAssembly演示,并引用了Cloudflare的一篇博客文章。
这条推文批评了关于AI灭绝风险的主张,敦促人们要求提供数学依据,暗示没有支持的百分比应当被摒弃。
本文提出在扩散语言模型中使用注册令牌来维护跨生成块的有界状态推理,在数学和代码基准测试中显示出显著的提升,而无需完整保留上下文。
ZGCM-1是一个完全开源的7B大语言模型,从头训练,采用FP8、MDP中期训练和AI4AI,在数学和智能搜索任务上达到了与Qwen3-235B相当的性能。
OpenAI接近解决一个千禧年大奖问题,但声称Levent/Buckmaster最近使用Codex并未影响其模型输出。
这条推文讨论了AI在推进数学和科学发现方面的激动人心的潜力,同时强调了谦逊和专注的必要性。
这篇文章阐述了强化学习的数学基础,推导了策略梯度、PPO和GRPO等算法,并探讨了这些算法通过RLHF和RLVR等技术在对齐大型语言模型中的应用。
Gauth AI Course是一款将任何学科转化为互动式AI驱动课程的产品。初期提供超过200门面向美国高中数学主题的课程,配有测验功能,并支持生成定制化课程。
freeCodeCamp在其移动应用上发布了新的编码挑战,要求用户计算从1到给定整数的平方和。
一个新的1.7B参数模型名为Mimir,声称在基准测试中优于Qwen 3.5和Gemma 4 E2B,在数学和编码方面具有优势,并基于Sapient的HRM-text架构。
本文提出在LLM后训练中使用进化策略(ES)而非强化学习,表明ES能提升解决方案覆盖率(pass@k),并在数学基准上取得更好结果。
陶哲轩的ICM 2026讲座《数学在AI时代》已上传至YouTube,探讨了AI、形式化验证和协作平台如何改变数学实践,同时也指出了它们目前的局限性。
一篇技术博客文章,解释了如何使用浮点除法和融合乘加来执行整数除法和取余,并给出了操作数位宽的限制,同时讨论了SIMD和舍入模式的实际注意事项。