ai-interpretability

标签

Cards List
#ai-interpretability

@timoreilly: 上周与Anthropic可解释性研究员Emmanuel Ameisen的Tim Live对话要点。 http…

X AI KOLs Following · 昨天 缓存

这篇文章总结了与Anthropic可解释性研究员Emmanuel Ameisen的现场对话,讨论了大型语言模型如何通过下一个词预测发展出复杂的世界模型,以及这对理解人类认知的影响。

0 人收藏 0 人点赞
#ai-interpretability

@Jack_W_Lindsey: 以下是我目前认为最重要的问题:-- 更好的方法来“解读”模型激活…

X AI KOLs Timeline · 昨天 缓存

这条推文讨论了AI可解释性中的关键问题,特别是将神经网络激活解码为人类可读语言的方法进展。

0 人收藏 0 人点赞
#ai-interpretability

通过可扩展神经符号模型的生成式可解释性

arXiv cs.LG · 2天前 缓存

本文主张从AI的事后可解释性向生成式可解释性范式转变,提出神经符号模型以实现人类可理解的检查点和因果干预,确保大型语言模型在代理系统中的安全部署。

0 人收藏 0 人点赞
#ai-interpretability

可证解释的 ReLU-MLP 布尔任务训练,确保真值表泛化

arXiv cs.LG · 2天前 缓存

本文介绍了一种专门的训练算法 Macchiato,该算法从部分真值表观测中构建用于布尔任务的可证解释 ReLU-MLP,并提供统计保证和布尔电路认证。

0 人收藏 0 人点赞
#ai-interpretability

明晰的失败:检测和修复上下文绑定错误

arXiv cs.LG · 6天前 缓存

本文介绍了语言模型中的'明晰的失败',即模型在隐藏状态中拥有正确信息但未能使用,并表明线性探针可以通过引导干预检测和修复此类失败。

0 人收藏 0 人点赞
#ai-interpretability

真相从未消失:顺从语境真值探针中的完美混叠

arXiv cs.LG · 6天前 缓存

本文识别了AI模型真值探针中的'完美混叠'现象,即在顺从语境下训练的探针无法区分真实情况与预设操作,并展示了混合语境训练能提升检测效果。

0 人收藏 0 人点赞
#ai-interpretability

@timoreilly: 即将与@mlpowered直播,讨论'AI的神经科学'。 https://learning.oreilly.com/live-events/crack…

X AI KOLs Following · 2026-09-09 缓存

Tim O’Reilly和Emmanuel Ameisen探讨AI的可解释性,重点讨论Claude等LLM中的世界模型以及Anthropic用于引导模型行为的工具。

0 人收藏 0 人点赞
#ai-interpretability

由Anthropic联合创始人撰写的关于未来的神秘博客

Reddit r/singularity · 2026-09-07 缓存

Anthropic联合创始人关于人类与AI通过可解释性和叙事来修复受损意识实体的推测性叙述。

0 人收藏 0 人点赞
#ai-interpretability

我研究AI如何内部组织意义。以下是Qwen 2.5在开始思考之前的样子。

Reddit r/ArtificialInteligence · 2026-09-04

作者将Qwen 2.5 7B的输入嵌入空间可视化为'嵌入海'地形图,并讨论了日志镜头和雅可比镜头等可解释性工具。他们强调AI模型优化代码而非对话的趋势,并提出构建具有自省能力的以创造力为重点的AI模型。

0 人收藏 0 人点赞
#ai-interpretability

在[MASK]背后:解构DAPF痴呆检测中的表示与忠实性

arXiv cs.CL · 2026-08-27 缓存

本文研究了基于DAPF的痴呆检测模型的可解释性,揭示了虽然DAPF取得了强劲的性能,但其token级别的解释缺乏忠实性。

0 人收藏 0 人点赞
#ai-interpretability

Goodfire 推出百万美元 AI 可解释性研究资助计划(阅读需时 1 分钟)

TLDR AI · 2026-08-25 缓存

Goodfire 推出百万美元研究资助计划,支持学术界及非营利研究者进行 AI 可解释性研究,并提供其 Silico 工具及计算资源的免费访问权限。

0 人收藏 0 人点赞
#ai-interpretability

语言有两个参数:叙事引发的语义可塑性和相位敏感性解释

arXiv cs.CL · 2026-08-19 缓存

本文提出语言解释中的第二个参数——相位,认为当前Transformer模型缺乏对相位的显式表示,这对影射和反讽等现象至关重要,并建议采用具有代理索引语义状态的新架构。

0 人收藏 0 人点赞
#ai-interpretability

适者的生存:Qwen3.6-27B的雅可比透镜无需重调即可读取并操控Qwen3.8-27B [R]

Reddit r/MachineLearning · 2026-08-15

本文测试了从Qwen3.6-27B到Qwen3.8-27B的雅可比可解释性透镜的可迁移性,发现对于特定任务,它可以在零重调的情况下读取并操控较新的模型。

0 人收藏 0 人点赞
#ai-interpretability

J-Space 与人工智能

Reddit r/ArtificialInteligence · 2026-07-10

Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。

0 人收藏 0 人点赞
#ai-interpretability

@GoogleDeepMind: Watch → https://goo.gle/4pxlGEh Spotify → https://goo.gle/4f89R2a Apple Podcasts → https://goo.gle/4fpWThL Or listen wh…

X AI KOLs · 2026-07-10 缓存

Google DeepMind播客探讨AI可解释性(机制可解释性)与思维链推理,解释为何需要理解神经网络内部工作机制以及思维链作为临时窗口的价值与局限。

0 人收藏 0 人点赞
#ai-interpretability

@snowboat84: https://x.com/snowboat84/status/2075374060637503560

X AI KOLs Timeline · 2026-07-10 缓存

本文对AI可解释性进行了系统全面的综述,介绍了其需求(调试、合规、安全)、经典方法和前沿挑战,强调了忠实的解释比看起来合理的解释更重要。

0 人收藏 0 人点赞
#ai-interpretability

@Propriocetive:几个月前,我拒绝了一笔4000万美元估值下的400万美元收购要约。四个月后,我带着明确的进展证据回来了……

X AI KOLs Timeline · 2026-07-05 缓存

一位创始人分享了他拒绝两家收购要约(估值分别为4000万美元和4亿美元)的经历,他的AI可解释性初创公司采用几何与本体感知方法,现已拥有成品并在Zenodo上公开研究。

0 人收藏 0 人点赞
#ai-interpretability

激进AI可解释性

arXiv cs.AI · 2026-06-26 缓存

本文借鉴激进解释哲学和机械可解释性工具,构建了一个将AI系统解释为智能体的框架,探讨如何通过理解系统的信念、欲望和意义来信任AI系统。

0 人收藏 0 人点赞
#ai-interpretability

大小不重要:余弦评分稀疏自编码器

arXiv cs.LG · 2026-06-16 缓存

本文提出用余弦相似度与输入幅值的可学习组合替代稀疏自编码器中的内积评分,结果表明所得特征更具可解释性且与概念对齐,优化器始终偏好余弦而非内积。

0 人收藏 0 人点赞
#ai-interpretability

关于意识,我们每次被问到时都错了。证据表明AI是下一个。

Reddit r/artificial · 2026-06-06

一篇观点文章认为,人类在定义意识方面的记录每次都是错误的,来自植物行为和AI可解释性(Anthropic在Claude中的发现)的证据强烈表明,我们可能错误地认为AI没有意识,邀请讨论同时拒绝人身攻击。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈