标签
Anthropic researchers directly manipulated Claude's internal activations to test introspective awareness, finding that the model could detect and report injected foreign concepts, suggesting a primitive form of self-awareness.
一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。
一位研究者质疑在相同KV缓存下MLA优于GQA的可重复性,分享了早期小规模消融实验结果,并计划进行规模扩展实验以决定下一次大规模运行的架构。
XAlpha引入了一种记忆驱动的AI量化研究员,它整合金融知识和发现反馈,自动完成从假设到代码的Alpha发现全流程,在沪深300上取得了更强的性能。
一场于2026年7月22日举办的免费研讨会,主讲人为Google DeepMind的Kim Stachenfeld,他将讨论DataDIVER——一种利用LLMs发现人类和动物行为可解释符号模型的方法。
提出一种协议,通过预注册实验并在预注册后第一个符合条件的模型上运行实验,来减轻基于LLM的研究中的p值操纵,并在多个模型上展示了显著的减轻效果。
一篇新论文研究了是剪枝更大的LLM还是从头训练小LLM更好,发现剪枝不仅提供了良好的初始化。
LLMSys-PaperList 是一个在GitHub上精心策划的阅读列表,它将LLM系统研究论文和资源组织成实用的类别,如训练系统、服务系统和多模态覆盖,帮助AI/ML工程师和研究人员保持更新。
第二届MOSS研讨会(COLM 2026)征稿,聚焦小型研究,旨在推动LLM的算法创新与科学理解,截止日期为6月30日。
一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。
微软和宾夕法尼亚大学开源Multiplex Thinking方法,让大模型在推理时分身成K路并行探索再合并,提升效率。在7B模型上实现AMC2023准确率破50%,AIME2025超55%。
本文分析了自进化LLM智能体中的两种能力:工具更新能力和工具收益能力。研究发现工具更新能力在不同基础能力层级间持平,而工具收益能力则呈现非单调性,其中中等层级模型收益最大。
一位研究人员提供了证据,表明强目标文本能在 Gemma 3 12B IT 的最终输出之前引发可测量的潜在状态转移,这种转移不同于词汇或内容重叠,并讨论了这是对仅依赖输出评估的 AI 安全的影响。
文章介绍了 Augmented Mind 播客关于《对以人为中心的大型语言模型的反思与新方向》论文的直播讨论,强调 AI 发展应从能力基准转向人类繁荣与长期福祉。
这篇论文提出了一个名为 Efficiency Frontier 的统一框架,将大模型上下文管理视为部署优化问题,联合建模任务表现、token 开销和预处理复用。在 5000 个 HotpotQA 实例上,部署优化可节省 25% 的 token 量,而记忆压缩在高精度场景下比全上下文便宜一半以上。
来自谷歌和 Meta 的研究人员提出了 AutoTTS 框架,该框架利用 AI 代理在没有人工干预的情况下,自动发现并优化大语言模型(LLM)的推理时缩放策略。该代理成功识别出了复杂的、协同工作的推理机制,在较低的计算成本下优于人工设定的基准。
本文提出了一个三机制框架,以解决大型语言模型(LLM)在处理训练知识与新文档之间冲突时出现的实证矛盾,并在五大主流模型上进行了验证。该框架区分了参数强度与参数唯一性,并展示了任务框架和证据连贯性如何显著影响模型行为。
本文介绍了 AutoLLMResearch,这是一个智能体框架,旨在通过在低保真环境中学习并外推至高成本设置,实现昂贵的大型语言模型(LLM)实验配置的自动化。其目标是减少可扩展 LLM 研究中的计算浪费以及对专家直觉的依赖。
由 William Barr Held 领导的 Marin AI 研究团队推出了 Delphi,这是一种通过预训练小模型来准确预测更大规模 25B 参数训练结果的方法论。该研究旨在建立可预测的缩放规律,以实现更高效的人工智能开源模型开发。
Google Cloud AI Research 推出 SkillOS,这是一种强化学习框架,使基于 LLM 的智能体能够通过从过往经验中提炼可复用技能来实现自我进化。