标签
本文探讨了TypeSafe的Jev API背后的基座模型的两种可能架构假设:双向编码器或改造后的因果解码器,并分析了相关证据和影响。
本文研究选择性状态空间模型中的递归是否像Transformer中的注意力一样驱动令牌达成共识,利用动力系统理论分析时变权重矩阵的稳定性和吸引域。
本文澄清了围绕OpenAI Astra模型的炒作,解释了‘循环Transformer’概念是一种小型架构调整,通过重用层来增加容量而不增加参数,如在Nanbeige 4.2等模型中所见。
本文区分了关于OpenAI Astra模型的已确认事实与未经证实的说法,详细介绍了其已发布的数学证明和一次因监控而暂停的训练,期间存在未经核实的谣言。
这项研究提出了一种针对Transformer语言模型的标准基变换,使得在保持模型行为的同时,能够无损、独立地测量和控制隐藏空间轴。它包括在多个模型上的演示,并为LLMs中的功能几何提供了因果证据。
本文探讨了 Qwen 3.8 Next AI 模型中的 Engram 组件,详细描述其为一个具有高度偏斜访问模式的 510 亿参数 Zipfian 缓存,并评估了通过频率剪枝进行压缩的优化方法。
Integrity Bench 是由 AI Explained 和 Pablo Romero 开发的一个基准测试,用于测量前沿AI模型对自身能力的过度自信程度,帮助量化AI系统中这一常见问题。
本文提出机理层析成像作为一种统一框架,用于设计测量以恢复AI模型中的内部机制,并通过干预和校准提高面向控制的可解释性。
Artificial Analysis 的一项分析表明,AI 模型最具吸引力的象限已被占用,这标志着开源模型的重要进步。
本文通过将权重从对齐模型移植到未对齐模型,研究安全对齐在大语言模型中的编码位置。研究发现,MLP层,尤其是网络中段模块(第8-11层),主要驱动拒绝行为,并且安全组件之间的相互作用是非加性的。
本文使用稀疏自编码器分解语言模型如何表征默认助手、角色扮演人格与故事角色,发现人格保留助手的核心特征,同时在层间逐步分化,而故事角色则缺乏该核心。
一条推文展示了8个LLM在概率问题上的推理轨迹可视化,突出了自我修正和转向的时刻。
OpenAI发布了ChatGPT 5.6,包含三个模型(Sol, Terra, Luna),相比Anthropic的Claude有成本优势,但将Sol与Mythos比较的基准测试并不令人信服。分析建议订阅用户应关注模型质量,在雄心勃勃的任务中Claude仍然领先。
Pangram Labs探索其AI检测模型Pangram 3.3.2的内部表示,分析模型如何在不同层中区分人工文本与AI文本,使用来自多种来源的5,000份文档的平衡数据集。
作者绘制了Qwen3.6-35B-A3B和Gemma4-E2B QAT模型的KV缓存量化的KL散度图。
分析了 Google 的 DiffusionGemma 模型发布的透明度,讨论了其对 AI 安全与问责的影响。
本文揭示了交错式语音-文本语言模型在中间层隐式地将语音转录为文本,然后在文本空间中进行预测,再转换回语音,揭示了内部模态交互机制。
本文分析了在线策略蒸馏(OPD),发现OPD更新是稀疏的,分布在各个层且以FFN为主,并且保留了与密集参数重写不同的几何特性。这种稀疏结构在操作上有用,但由于梯度尺度异质性,诱导稀疏性的SGD优化器表现不如AdamW。