Qwen3.8 27B Q8 竟然幻觉出了整个计划???
摘要
一名用户报告称,尽管事先精心规划且之前表现良好,Qwen3.8 27B模型在任务中产生了幻觉并实现了一个意外的功能。
我想这是提醒大家,尽管Qwen3.8非常出色,但它仍然是一个推荐温度为1的模型... Qwen3.8一直表现很好,以至于我变懒了,在告诉它实现计划后没有监控它的操作(我一直在规划,确保计划良好,然后确保输出良好...通常除非耗时超出预期,否则不会一直盯着它工作),但在处理了120k tokens后,结果发现它根本没有读取计划,而是开始实现一个完全不同的功能,这个功能我甚至没有考虑过(主要是因为它不是一个有用的功能;从现有代码和agent文件中可能有点合理,但从未在任何地方提到过)。难道我的Qwen中邪了? 使用Unsloth的第二个Q8版本(发布日之后但修复了模板) llama.cpp 版本: 0.3.0-dev (build 10630, commit 2dd3922) pi v0.84.3 Args: exec llama-server --host 0.0.0.0 --port 8080 \\ -m /home/connor/AI/LLM/Models/Qwen3.8-27B-Q8/Qwen3.8-27B-Q8_0.gguf \\ --mmproj /home/connor/AI/LLM/Models/Qwen3.8-27B-Q8/mmproj-F16.gguf \\ -np 1 \\ --ctx-size 200000 \\ -ngl 99 \\ -fa on \\ --load-mode mlock \\ --temp 1 \\ --top-p 0.95 \\ --top-k 20 \\ --min-p 0 \\ --presence-penalty 0 \\ --repeat_penalty 1 \\ --spec-type draft-mtp \\ --spec-draft-n-max 2 \\ -dev Vulkan0,Vulkan1
相似文章
Qwen 3.8 27B 表现优异,但默认启用过度推理模式
Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。
通义千问 3.8 27b 版本的表现大致是这样的...
这篇文章戏剧性地呈现了针对Qwen 3.8 27b AI模型的测试套件执行过程,强调将重心置于即时行动与结果,而非冗长的分析阶段。
Qwen 3.8 27B 在 RTX 3090 上运行63小时以解决黎曼猜想
一项实验在RTX 3090上运行了Qwen 3.8 27B模型63小时,试图解决黎曼猜想,展示了自主推理、自我纠正和无幻觉的能力。
Qwen3.8: 大量思考却无果
一位用户对Qwen3.8 27B模型表示不满,批评其过度思考和过度发挥的倾向,这在任务中浪费了时间和上下文,并征求社区对实际使用的反馈。
在等待Qwen3.8-27B发布的同时,让我们试着猜测会发生什么。
一位社区成员对即将发布的Qwen3.8-27B进行了推测,重点提到了诸如VLM、智能体改进以及思考模式等被预告的功能,并开玩笑地建议采用一种“僧侣”式的推理强度,以实现长时程的认知超脱。