ablation

标签

Cards List
#ablation

chessformer_lens 演示:消融国际象棋 transformer 的 128 个注意力头中的一个,导致模型不再能找到 Morphy 的后牺牲 [P]

Reddit r/MachineLearning · 2026-08-13

chessformer_lens 的一个演示表明,消融国际象棋 transformer 中的一个注意力头,会导致模型停止识别 Morphy 的后牺牲,这展示了特定能力集中在单个注意力头中。

0 人收藏 0 人点赞
#ablation

KV缓存压缩的消融、统计推断与验证

arXiv cs.LG · 2026-07-14 缓存

本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。

0 人收藏 0 人点赞
#ablation

Nex-N2-Mini-Ultra-Uncensored-Heretic 现已发布,这是一款具有自主思维的自主型模型,现已无审查,拒绝率为5/100,KLD为0.0020,提供Safetensors和GGUF格式!

Reddit r/LocalLLaMA · 2026-06-24 缓存

名为 Nex-N2-mini-ultra-uncensored-heretic 的 Nex-N2-mini 模型的新无审查版本已发布。它在保持低KL散度的同时,将拒绝率降低了93%,并提供了safetensors和GGUF格式。

0 人收藏 0 人点赞
#ablation

新型消融算子 (apostate)

Reddit r/LocalLLaMA · 2026-06-22

介绍了一种名为apostate的新型对比消融算子,该算子将模型拒绝率从96%降低至5%,同时仅以0.081 KL散度保留无害行为,已在Granite 3.3-8B上测试。

0 人收藏 0 人点赞
#ablation

对比性目标SFT作为机制解释方法——有人用这种方式映射因果依赖关系吗?[D]

Reddit r/MachineLearning · 2026-06-17

一位研究人员分享了一项实验计划,旨在通过对比性目标SFT和电路追踪来识别31B模型中能力维度之间的因果依赖关系,并寻求关于方法论和相关工作的反馈。

0 人收藏 0 人点赞
#ablation

Tower-Plus-72B-Ultra-Uncensored-Heretic,一个支持22种语言的模型,非常适合多语言任务,在翻译相关工作中表现出色,且无需审查,现在超无审查,拒绝率仅5/100!

Reddit r/LocalLLaMA · 2026-06-15 缓存

Tower-Plus-72B-Ultra-Uncensored-Heretic 是 Unbabel/Tower-Plus-72B 的无审查版本,支持22种语言,擅长翻译任务,拒绝率极低。

0 人收藏 0 人点赞
#ablation

消融可逆的注意力头不转移:对Transformer中机制角色声明的压力测试

arXiv cs.AI · 2026-06-09 缓存

本文表明,满足机制角色声明常见标准(必要性、线性可解码性、消融可逆性)的注意力头,在跨提示词转移计算时常常失败,并引入了KID(Knowing/Intent/Doing)框架和一个三阶段流水线,用于更严格的角色分配。

0 人收藏 0 人点赞
#ablation

技能的递归自我改进 (Skill RSI)

Reddit r/AI_Agents · 2026-06-03

Skill RSI 是一个免费工具,通过程序化评估和研究代理,以递归方式评估和改进 AI 技能,支持独立使用或作为 Codex 插件使用。

0 人收藏 0 人点赞
#ablation

为什么我们排名第一的 LightGBM 特征反而让预测效果变差 [D]

Reddit r/MachineLearning · 2026-06-01

Flyback 的一篇博客文章展示了,一个在重要性排名第一的 LightGBM 特征实际上因为目标编码泄露导致预测效果变差,这凸显了仅依赖特征重要性指标的危害。

0 人收藏 0 人点赞
#ablation

测量、定位和消除LLM中的对齐特征

arXiv cs.LG · 2026-06-01 缓存

本文研究了LLM后训练如何引入类似AI的风格规律,并提出了PASTA,一种无需训练的方法来定位和消除这些对齐特征,从而在11个模型和6个检测器上降低AI检测率同时保持连贯性。

0 人收藏 0 人点赞
#ablation

@NousResearch: 为了检查CNA是否只隔离了预期行为,我们评估了MMLU上不同转向强度下的转向模型……

X AI KOLs Following · 2026-05-19 缓存

Nous Research 发布了对比神经元归因(CNA),这是一种通过识别和消融MLP神经元中稀疏电路来引导LLM行为的方法,无需训练稀疏自编码器或降低通用基准性能,已在多个大型语言模型上得到验证。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈