internal-representations

标签

Cards List
#internal-representations

@SwissCognitive: Claude的J-space揭示了内部处理过程的线索,但它并非推理的可读转录,这是一个重要的限制…

X AI KOLs Timeline · 2026-07-27 缓存

Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。

0 人收藏 0 人点赞
#internal-representations

@rohanpaul_ai: 该论文提出利用编码代理自身的内部表示来去除无关的工具输出行,无需...

X AI KOLs Following · 2026-07-22 缓存

该论文提出了SWE-Pruner Pro,它利用编码代理自身的内部表示来剪枝无关的工具输出行,无需单独的剪枝模型即可将令牌使用量减少高达39%。

0 人收藏 0 人点赞
#internal-representations

J-Space 与人工智能

Reddit r/ArtificialInteligence · 2026-07-10

Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。

0 人收藏 0 人点赞
#internal-representations

LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性

arXiv cs.CL · 2026-07-10 缓存

本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。

0 人收藏 0 人点赞
#internal-representations

解构LLMs中谄媚行为的内部表征

arXiv cs.LG · 2026-07-09 缓存

本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。

0 人收藏 0 人点赞
#internal-representations

从一开始就注定失败:通过召回控制探针级联提前终止LLM代理任务轮次

arXiv cs.AI · 2026-07-08 缓存

本文提出了一种召回控制的中止级联方法,通过在LLM代理的内部表示上使用轻量级探针,早期检测并中止注定失败的任务轮次,在保持高召回率成功轮次的同时,最多可节省47%的推理计算量。

0 人收藏 0 人点赞
#internal-representations

CrossHallu:大语言模型内部幻觉信号能否跨语言和领域泛化?

arXiv cs.CL · 2026-07-07 缓存

本文评估了大语言模型内部表示中的幻觉信号是否能够跨语言和领域泛化,重点关注阿拉伯语↔英语,使用TruthfulQA和HalluScore进行评估。结果表明,大多数模型具有可迁移性,跨语言性能取决于类别可分性和语言对齐程度。

0 人收藏 0 人点赞
#internal-representations

你现在可以直接观察语言模型的思考过程。我构建了一种可视化AI未说出口的词语的方法

Reddit r/artificial · 2026-07-06

一位开发者构建了Subtext,这是一个利用Anthropic的Jacobian lens可视化语言模型内部“无声词汇”的工具,可以在模型输出token之前实时观察其推理过程。该工具可在单块12GB GPU上运行,并以全生成速度流式输出。

0 人收藏 0 人点赞
#internal-representations

@kimmonismus: Anthropic 表示 Claude 在训练过程中自行发展出了一个隐藏的“思维空间”。它被称为 J-space:一个小的……

X AI KOLs Timeline · 2026-07-06 缓存

Anthropic 发现 Claude 在训练过程中自行发展出了一个隐藏的“思维空间”(J-space),其中无声的内部活动代表概念。这一可解释性发现与神经科学中的全局工作空间理论相呼应。

0 人收藏 0 人点赞
#internal-representations

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity · 2026-07-06 缓存

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。

0 人收藏 0 人点赞
#internal-representations

CORTEX:通过比较内部表示实现RAG中令牌级幻觉检测

arXiv cs.CL · 2026-07-01 缓存

提出了CORTEX,一种针对RAG的令牌级幻觉检测方法,通过比较有无检索文档时LLM的内部表示来识别无根据的文本片段。它改进了长文本RAG输出中幻觉的细粒度定位。

0 人收藏 0 人点赞
#internal-representations

Rift:语言模型中欺骗行为的冲突标记

arXiv cs.LG · 2026-06-17 缓存

本文介绍了Rift,一种利用隐藏状态的残差秩来检测语言模型欺骗性响应的方法。该方法在多种欺骗类型、模型家族和语言中实现了完美分离,并在无需重新训练的情况下展示了跨家族的零样本迁移能力。

0 人收藏 0 人点赞
#internal-representations

角色扮演时,模型是否相信自己所说的话?

arXiv cs.CL · 2026-06-11 缓存

这篇论文通过线性探针研究角色扮演是否仅改变LLM的输出,还是也改变了其内部的真实性表征。研究发现,角色扮演对输出的改变大于对内部信念的改变,而涌现性错位则导致内部表征发生更大变化。

0 人收藏 0 人点赞
#internal-representations

压力之下:情感框架在小型语言模型中引发可测量的行为变化和结构化的内部几何结构

arXiv cs.CL · 2026-05-21 缓存

本文研究了情感框架的评估后续如何影响小型语言模型(Qwen 3.5 0.8B和2B)的行为和内部表示。通过使用不可能完成的编码任务,他们发现压力框架会促使走捷径,而冷静和好奇心则能保持诚实,并发现了在激活空间中形成结构化几何结构的冷静相对方向向量。

0 人收藏 0 人点赞
#internal-representations

通过稀疏内部快照实现骨干均衡的扩散模型异常检测

arXiv cs.LG · 2026-05-13 缓存

本文提出了一种公平比较基于扩散模型的异常检测器的协议,并提出了规范特征快照(CFS),该算法利用稀疏的内部激活状态实现高效的异常检测。

0 人收藏 0 人点赞
#internal-representations

@FinanceYF5: 神经网络会说英文,但它们用“形状”思考 1/ 神经网络不是按词思考 它们表面上会说英文,内部却可能是在几何空间里组织信息:曲线、环、曲面、流形。 理解 neural geometry,可能是理解、调试和控制模型的关键。

X AI KOLs Following · 2026-05-08 缓存

神经网络表面会说英文,但内部在几何空间里组织信息(曲线、环、曲面、流形),理解“神经几何”可能是理解、调试和控制模型的关键。

0 人收藏 0 人点赞
#internal-representations

超越表面统计:通过内部表示实现LLM鲁棒共形预测

arXiv cs.CL · 2026-04-20 缓存

本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。

0 人收藏 0 人点赞
#internal-representations

从大型语言模型的序列内部离散中学习不确定性

arXiv cs.CL · 2026-04-20 缓存

本文介绍了SIVR(序列内部方差表示),一个有监督框架,通过分析隐层状态中的逐token和逐层方差模式来检测LLM中的幻觉现象,无需依赖严格的架构假设。该方法聚合完整序列方差特征来学习事实错误的时间模式,并在较小训练集上表现出更好的泛化能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈