标签
这篇文章讨论了对于 Qwen 3.8 模型,哪个工具最强大,从功能和可用性方面比较了 Qwen code 和 open code。
这篇博客文章分析了英语中基于语音使用'a'和'an'的规则,数据显示在32,455个单词中只有129个需要例外处理,并讨论了其在过程化文本生成代码中的应用。
这条推文分享了书籍《Machine Learning in Finance: From Theory to Practice》的免费代码,该书将机器学习与量化金融整合,用于数据建模和金融决策。
Chris Lomont 解释了在 C++ 中整数与浮点数颜色值之间准确转换的方法,突出常见陷阱,并提供一个往返安全且具有均匀映射的解决方案。
Qwen3.8-9B-Distill 是 Qwen3.8 2.4T A95B 模型的蒸馏版本,采用 9B 架构,基于精选的教师轨迹训练,以增强数学和代码推理能力,显示出基准性能的提升。
Hugging Face 发布了 The Stack v3,这是迄今为止最大的开源代码数据集,旨在增强针对代码的 AI 模型的训练。
A tweet humorously referencing a GPT-5.6-sol model, sarcastically questioning the code quality.
这项研究探讨了不同数据域在预训练期间的互动方式,发现加入代码可以提高数学性能,而某些组合则会相互影响,并提出将数据协同纳入缩放定律。
一段3小时的从零构建LLM实录视频,涵盖LLM入门、transformer架构、训练、模型现代化改造和扩展五个阶段,代码全程可见。
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
OpenReward 和 TRL 现在支持在超过 350 个强化学习环境中进行训练,只需极少代码。
识别了在线策略蒸馏中的监督保真度衰减(SFD),即随着学生序列变长,教师监督质量下降,并提出了前瞻组奖励(LGR)以缓解SFD,从而提升数学和代码基准测试的性能。
一条推文讨论是否应该用Python编写AI Agent,作者引用Shunyu Yao的ReAct源代码(仅几个Jupyter Notebook),认为这些代码开启了Agent时代,并批评鄙视特定编程语言的态度。
Greg Kamradt 提出了一个AI验证难度的7级谱系,范围从像数学和代码这样可即时验证的领域,到具有缓慢、嘈杂反馈的文明规模系统。
本文挑战了代码能提升语言模型推理能力的观点,通过受控的预训练实验发现,代码主要提升编程能力,而推理能力的提升来自结构化推理轨迹(如代码-文本混合和数学-文本混合)。
一条推文称,Renaissance Technologies的整个交易框架已在GitHub上泄露,采用Apache 2.0许可,已获得76,800个星标。
Yann LeCun 指出,LLMs 在语言作为推理基础的领域(如数学和代码)中最强,但它们并非有创造力的数学家、软件架构师或计算机科学家。