标签
一条推文展示了8个LLM在概率问题上的推理轨迹可视化,突出了自我修正和转向的时刻。
OpenAI发布了ChatGPT 5.6,包含三个模型(Sol, Terra, Luna),相比Anthropic的Claude有成本优势,但将Sol与Mythos比较的基准测试并不令人信服。分析建议订阅用户应关注模型质量,在雄心勃勃的任务中Claude仍然领先。
Pangram Labs探索其AI检测模型Pangram 3.3.2的内部表示,分析模型如何在不同层中区分人工文本与AI文本,使用来自多种来源的5,000份文档的平衡数据集。
作者绘制了Qwen3.6-35B-A3B和Gemma4-E2B QAT模型的KV缓存量化的KL散度图。
分析了 Google 的 DiffusionGemma 模型发布的透明度,讨论了其对 AI 安全与问责的影响。
本文揭示了交错式语音-文本语言模型在中间层隐式地将语音转录为文本,然后在文本空间中进行预测,再转换回语音,揭示了内部模态交互机制。
本文分析了在线策略蒸馏(OPD),发现OPD更新是稀疏的,分布在各个层且以FFN为主,并且保留了与密集参数重写不同的几何特性。这种稀疏结构在操作上有用,但由于梯度尺度异质性,诱导稀疏性的SGD优化器表现不如AdamW。