Muse-glimmer-30b 在创意写作中远超预期

Reddit r/LocalLLaMA 模型

摘要

作者测试了Muse-glimmer-30b模型在创意写作方面的表现,发现它令人印象深刻,在模仿作家风格方面优于其他本地模型如qwen3.8-27b。

在注意到它在EQ-Bench创意写作基准和Hemingway-bench中排名高于许多更大的前沿模型后,我决定尝试一下,结果印象深刻。我没有进行非常正式的测试,但我要求它模仿几位不同作家的风格,包括亨利·米勒、大卫·塞达里斯和斯蒂芬·金,它产生了尚可的散文,甚至在几种情况下让我笑了出来。下面的段落是提示“以大卫·塞达里斯的风格写一个幽默段落”的结果(第一次尝试,未经挑选)。 我最近努力成为一个更好的人,开始堆肥,这主要意味着我现在厨房里有一个小型的、潮湿的科学实验,我妈妈称之为“你未来的味道”。我买了一个带活性炭过滤器的台面垃圾桶,好像这能骗过谁似的,我开始对自己讲述我的食物残渣——“再见,牛油果皮,你是个错误”——而我的丈夫在门口看着,表情担忧,仿佛意识到他娶了一个会跟垃圾说话的女人。市政府寄来了一本关于正确堆肥的小册子,我像其他人读星座运势一样读它,划掉那些说“不要放肉”的部分,心想,嗯,这真是无礼。 相比之下,以下是qwen3.8-27b用相同提示产生的内容。 我的叔叔埃德,整个旅程都在仔细解释如何正确折叠一张床笠,发现我们的酒店房间有两张床,每张都有一张床笠。“这是一个考验,”他说,坐在靠近浴室的床边,面容镇定。“看看我们是否能用我们拥有的东西做到。”他当然是对的;我们尽力而为,尽管这让我们都度过了一个相当不舒服的夜晚。 你可能知道也可能不知道大卫·塞达里斯的写作(或者即使知道也不觉得有趣),但第一个例子显然是一个更好的模仿,据我(或Gemini)所知,没有直接抄袭。我没有保存其他例子,因为我不是为了发布在这里而测试的,但在所有情况下,muse glimmer版本不仅远超qwen 27b,而且与我过去尝试的任何其他本地模型相比都真正令人印象深刻。 我好奇是否有人也用这个模型进行创意写作或类似目的,如果是这样,你的看法是什么。此外,我对微调了解不多,但我想知道是否有可能通过在不同源材料上训练来创造更好的东西。我对ERP世界如何运作知之甚少,但我知道足够多,知道许多高性能模型都是为此目的训练的,因为huggingface似乎充满了微调模型。对于glimmer,我主要看到abliterated版本,我猜这填补了人们的需求,但考虑到这种性能,以及这个subreddit中对此感兴趣的人数,我有点惊讶没有更多的微调。 我应该提到的最后一点是,我在任何测试中都没有使用系统提示,但事后我想到,一个为代理编码训练的模型似乎是一个用系统提示引导的理想候选,但也许不会有太大不同。也许我会再玩玩并汇报。
查看原文

相似文章

被低估的 Muse Glimmer

Reddit r/LocalLLaMA

基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。

推出 Muse Glimmer

Simon Willison's Blog

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。