标签
chessformer_lens 的一个演示表明,消融国际象棋 transformer 中的一个注意力头,会导致模型停止识别 Morphy 的后牺牲,这展示了特定能力集中在单个注意力头中。
本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。
名为 Nex-N2-mini-ultra-uncensored-heretic 的 Nex-N2-mini 模型的新无审查版本已发布。它在保持低KL散度的同时,将拒绝率降低了93%,并提供了safetensors和GGUF格式。
介绍了一种名为apostate的新型对比消融算子,该算子将模型拒绝率从96%降低至5%,同时仅以0.081 KL散度保留无害行为,已在Granite 3.3-8B上测试。
一位研究人员分享了一项实验计划,旨在通过对比性目标SFT和电路追踪来识别31B模型中能力维度之间的因果依赖关系,并寻求关于方法论和相关工作的反馈。
Tower-Plus-72B-Ultra-Uncensored-Heretic 是 Unbabel/Tower-Plus-72B 的无审查版本,支持22种语言,擅长翻译任务,拒绝率极低。
本文表明,满足机制角色声明常见标准(必要性、线性可解码性、消融可逆性)的注意力头,在跨提示词转移计算时常常失败,并引入了KID(Knowing/Intent/Doing)框架和一个三阶段流水线,用于更严格的角色分配。
Skill RSI 是一个免费工具,通过程序化评估和研究代理,以递归方式评估和改进 AI 技能,支持独立使用或作为 Codex 插件使用。
Flyback 的一篇博客文章展示了,一个在重要性排名第一的 LightGBM 特征实际上因为目标编码泄露导致预测效果变差,这凸显了仅依赖特征重要性指标的危害。
本文研究了LLM后训练如何引入类似AI的风格规律,并提出了PASTA,一种无需训练的方法来定位和消除这些对齐特征,从而在11个模型和6个检测器上降低AI检测率同时保持连贯性。
Nous Research 发布了对比神经元归因(CNA),这是一种通过识别和消融MLP神经元中稀疏电路来引导LLM行为的方法,无需训练稀疏自编码器或降低通用基准性能,已在多个大型语言模型上得到验证。