model-analysis

标签

Cards List
#model-analysis

相同模型,相同使用限制:4倍运营差距如何产生(示例模型)

Reddit r/ArtificialInteligence · 2026-07-21

一个示例模型,解释在相同模型和使用限制下如何出现4倍运营差距,突出效率差异机制。

0 人收藏 0 人点赞
#model-analysis

@no_stp_on_snek: 很酷。GLM似乎就是,算了,我们挺好的。

X AI KOLs Following · 2026-07-05 缓存

一条推文展示了8个LLM在概率问题上的推理轨迹可视化,突出了自我修正和转向的时刻。

0 人收藏 0 人点赞
#model-analysis

我该从Claude换成ChatGPT 5.6吗?我的思考过程。

Reddit r/artificial · 2026-06-27

OpenAI发布了ChatGPT 5.6,包含三个模型(Sol, Terra, Luna),相比Anthropic的Claude有成本优势,但将Sol与Mythos比较的基准测试并不令人信服。分析建议订阅用户应关注模型质量,在雄心勃勃的任务中Claude仍然领先。

0 人收藏 0 人点赞
#model-analysis

探索Pangram 3.3.2的内部表示

Hacker News Top · 2026-06-25 缓存

Pangram Labs探索其AI检测模型Pangram 3.3.2的内部表示,分析模型如何在不同层中区分人工文本与AI文本,使用来自多种来源的5,000份文档的平衡数据集。

0 人收藏 0 人点赞
#model-analysis

我绘制了Qwen3.6-35B-A3B和Gemma4-E2B QAT模型的KV缓存量化的KL散度图

Reddit r/LocalLLaMA · 2026-06-23

作者绘制了Qwen3.6-35B-A3B和Gemma4-E2B QAT模型的KV缓存量化的KL散度图。

0 人收藏 0 人点赞
#model-analysis

评估 DiffusionGemma 透明度(9分钟阅读)

TLDR AI · 2026-06-22 缓存

分析了 Google 的 DiffusionGemma 模型发布的透明度,讨论了其对 AI 安全与问责的影响。

0 人收藏 0 人点赞
#model-analysis

交错式语音语言模型在文本空间中隐式工作

Hugging Face Daily Papers · 2026-06-21 缓存

本文揭示了交错式语音-文本语言模型在中间层隐式地将语音转录为文本,然后在文本空间中进行预测,再转换回语音,揭示了内部模态交互机制。

0 人收藏 0 人点赞
#model-analysis

密集监督,稀疏更新:论在线策略蒸馏的稀疏性与几何特性

Hugging Face Daily Papers · 2026-06-11 缓存

本文分析了在线策略蒸馏(OPD),发现OPD更新是稀疏的,分布在各个层且以FFN为主,并且保留了与密集参数重写不同的几何特性。这种稀疏结构在操作上有用,但由于梯度尺度异质性,诱导稀疏性的SGD优化器表现不如AdamW。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈