如何分析探针的相对“强度”?[R]
摘要
作者询问如何分析神经网络中探针的相对“强度”,讨论了词汇量有限和模型容量等挑战,并以Google Gemini为例说明了失败情况。
这个问题与语言+模型(包括多模态)以及“电路”分析等主题相关。我认为在我的工作中(模型输出的事实性保证)可能会遇到类似的问题,所以我正在尝试了解当前的最新进展。我找到了这篇旧文章,其中试图推断,例如,基于Transformer的模型是否“知道”一个token属于哪个单词。即使在这个简单的例子中,我也注意到了一些有意义的问题(我在脚注1中详细说明,以免偏离我的问题)——而且我听说电路研究相当棘手。这篇文章声称训练了一个逻辑回归分类器。我好奇的是,如何在探针的能力和底层网络之间取得平衡?具体来说,我想知道:是否有理论基础可以将“你能学到什么”的探究具体化?(也许是在过拟合的可证明保证方面?或者是否有类似奈奎斯特的保证,基于语言语料库中模式的频率进行采样——即,我们能否说已经“看到了足够的数据”来知道网络在所有情况下都能可靠地完成某些事情?)现有的工作是否考虑了给示例标注“难度”的尝试?(也许是通过集成一些模型的训练并查看其准确率。我意识到对于语言模型来说,由于训练成本,自举法极其昂贵。)问题——首先,可能的单词数量非常少,以至于我怀疑性能看起来异常好。分类器在减弱后,对于单词5/6的性能似乎有所提升,但这可能只是学习了“所有足够‘极端’的token都应该是单词5或6”。另一方面,尽管文章中声称(Nanda得出结论,网络基本上学习了位置),但我碰巧有最近与Google Gemini互动并询问它“Google”中有多少个“r”和其他字母的截图。它不仅回答错误——声称有1个——而且更令人担忧的是,它在回答中拼写出了“G-o-o-g-l-e”。这暗示了“它无法准确学习如何分解token,因此这个问题从模型容量的角度来看是不公平的”这一假设,但*仍然*导致了错误的答案!
相似文章
使用合成查询探测比较嵌入模型 [R]
作者提出了合成查询探测(Synthetic Query Probing),这是一种简单而有效的方法,通过比较不同嵌入模型之间的相似度匹配分数,而非原始嵌入空间,来比较不同的嵌入模型。论文展示了如Ada和Titan等模型之间的非线性关系,为更换嵌入模型和设定检索阈值提供了实用指导。
Semianalysis 评析 Gemini 3.5 Pro
Semianalysis 对谷歌的 Gemini 3.5 Pro 进行了深入分析,探讨了其架构、能力以及对人工智能领域的影响。
自我判断混淆下正确性探测的诊断
本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。
What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model
A research paper analyzing what iterated self-feeding probes of language models actually measure, distinguishing model-dependent signals from construction artifacts using a ring of resampled token cells and common random numbers coupling.
Gemini与AI幻觉
讨论Google Gemini模型中的AI幻觉问题,突出大型语言模型在可靠性和准确性方面的挑战。