Muse-glimmer-30b 在创意写作中远超预期
摘要
作者测试了Muse-glimmer-30b模型在创意写作方面的表现,发现它令人印象深刻,在模仿作家风格方面优于其他本地模型如qwen3.8-27b。
在注意到它在EQ-Bench创意写作基准和Hemingway-bench中排名高于许多更大的前沿模型后,我决定尝试一下,结果印象深刻。我没有进行非常正式的测试,但我要求它模仿几位不同作家的风格,包括亨利·米勒、大卫·塞达里斯和斯蒂芬·金,它产生了尚可的散文,甚至在几种情况下让我笑了出来。下面的段落是提示“以大卫·塞达里斯的风格写一个幽默段落”的结果(第一次尝试,未经挑选)。
我最近努力成为一个更好的人,开始堆肥,这主要意味着我现在厨房里有一个小型的、潮湿的科学实验,我妈妈称之为“你未来的味道”。我买了一个带活性炭过滤器的台面垃圾桶,好像这能骗过谁似的,我开始对自己讲述我的食物残渣——“再见,牛油果皮,你是个错误”——而我的丈夫在门口看着,表情担忧,仿佛意识到他娶了一个会跟垃圾说话的女人。市政府寄来了一本关于正确堆肥的小册子,我像其他人读星座运势一样读它,划掉那些说“不要放肉”的部分,心想,嗯,这真是无礼。
相比之下,以下是qwen3.8-27b用相同提示产生的内容。
我的叔叔埃德,整个旅程都在仔细解释如何正确折叠一张床笠,发现我们的酒店房间有两张床,每张都有一张床笠。“这是一个考验,”他说,坐在靠近浴室的床边,面容镇定。“看看我们是否能用我们拥有的东西做到。”他当然是对的;我们尽力而为,尽管这让我们都度过了一个相当不舒服的夜晚。
你可能知道也可能不知道大卫·塞达里斯的写作(或者即使知道也不觉得有趣),但第一个例子显然是一个更好的模仿,据我(或Gemini)所知,没有直接抄袭。我没有保存其他例子,因为我不是为了发布在这里而测试的,但在所有情况下,muse glimmer版本不仅远超qwen 27b,而且与我过去尝试的任何其他本地模型相比都真正令人印象深刻。
我好奇是否有人也用这个模型进行创意写作或类似目的,如果是这样,你的看法是什么。此外,我对微调了解不多,但我想知道是否有可能通过在不同源材料上训练来创造更好的东西。我对ERP世界如何运作知之甚少,但我知道足够多,知道许多高性能模型都是为此目的训练的,因为huggingface似乎充满了微调模型。对于glimmer,我主要看到abliterated版本,我猜这填补了人们的需求,但考虑到这种性能,以及这个subreddit中对此感兴趣的人数,我有点惊讶没有更多的微调。
我应该提到的最后一点是,我在任何测试中都没有使用系统提示,但事后我想到,一个为代理编码训练的模型似乎是一个用系统提示引导的理想候选,但也许不会有太大不同。也许我会再玩玩并汇报。
相似文章
被低估的 Muse Glimmer
基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。
Muse Glimmer 在纸面上看起来很棒,但真的有人在切换到它吗?
这篇文章是一个用户查询,旨在寻求关于 Muse Glimmer 模型的真实使用经验,以评估其在编码、工具调用和本地代理工作流等任务中的实用性。
Qwen-3.8-27B、Nemotron-3.5-Lightning-30B-A3B、Ornith-1.5-35B-A3B、Muse-Glimmer-30B oQ8e 对比
对比了多个AI模型,包括Qwen、Nemotron、Ornith和Muse-Glimmer在基准测试上的表现。Ornith表现优异,而TielCoder在编程任务中展现了潜力。
本地基准测试:Muse Glimmer 30B vs Qwen 3.6 27B vs Gemma4 31B(以及许多其他模型和微调)
本地基准测试,对比 Muse Glimmer 30B、Qwen 3.6 27B 和 Gemma4 31B,记录请求次数和最终得分,并附有详细结果的链接。