Qwen 3.8 27b:工具与定向搜索在非编程专业领域的应用

Reddit r/LocalLLaMA 模型

摘要

用户评测显示,Qwen 3.8 27b 在房地产和金融领域的专业资格考试中表现卓越,借助工具和引导式搜索,得分高达98.44%。

以下数据展示了工具对 Qwen 3.8 27b 专业能力的提升。我使用 Qwen 的主要工作集中在房地产、私募股权及相关金融领域。这并非典型的编程领域,因此这些结果可能不适用于所有人。我运行的是 Qwen 3.8 27b nvp4 "RadixArk kVarN",基于5090 GPU,使用 vLLM 0.27.1 版本,并应用了一些 TurboQuant 和调度器修复以防止程序频繁挂起: vllm serve RadixArk/Qwen3.8-27B-NVFP4 \ --quantization modelopt \ --kv-cache-dtype turboquant_4bit_nc \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}' \ --max-model-len 180224 \ --max-num-seqs 2 \ --max-num-batched-tokens 1024 \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 我的用例需同时支持后台进程和实时人工交互,因此在规模和速度上做了一些权衡。最大输入长度:180,224 tokens。支持两个并发的“中等”推理代理请求。设置8,192 tokens的硬性限制以防止思维过程失控。每个并发代理的生成速度约为108 tokens/s(两个代理总计约200 tokens/s)。平均模型首token延迟(TTFT)约1.28秒。 我使用了一个由600道题目组成的自定义测试集来评测开箱即用的模型,这些题目源自专业资格考试,涵盖承销、估值、信贷、REIT会计、1031交换税法等专业内容,还包括一组需要模型排障的虚构商业场景。在没有任何外部辅助或联网的情况下,Qwen 在这些测试中取得了95.25%的混合得分,这已经非常出色。 随后,我接入了一个工具/MCP层,包含以下基本功能: - 确定性金融计算器(免费) - 网络研究(使用排名提供商,设有API费用上限,上限为10美元) - 基础日期与时间函数(免费) 使用相同的测试输入,工具将混合得分提升至98.05%。 之后,我明确提示模型使用一组与专业相关的搜索工具。例如,提示它在需要时搜索 SEC Edgar 数据库,而不仅仅是咨询 Google。这些进一步的提示将混合得分推高至98.44%。 得分详情: | 指标 | 无工具 | 工具启用 | 搜索提示 | | :--- | :--- | :--- | :--- | | 测试数量 | 600 | 600 | 600 | | 完美答案数 | 543 | 551 | 563 | | 核心专业定量分析(100题) | 98.95% | 100.00% | 98.40% | | 初级分析师专业定量分析(100题) | 100.00% | 99.30% | 100.00% | | 综合案例研究(100题) | 98.60% | 97.53% | 98.12% | | 基础知识、伦理与上报(100题) | 91.08% | 96.45% | 97.56% | | 中级知识、伦理与上报(100题) | 90.80% | 97.58% | 98.05% | | 高级知识、伦理与上报(100题) | 92.08% | 97.45% | 97.17% | | 综合加权得分 | 95.25% | 98.05% | 98.44% | 至少对我而言,最终结论是:Qwen 开箱即用已相当扎实,而工具与引导式搜索支持使其变得非常胜任。
查看原文

相似文章

Qwen 3.8 27b 即使在 Q3_xxs 下也很强大

Reddit r/LocalLLaMA

用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。

Qwen 3.6 27B 太牛了

Reddit r/LocalLLaMA

一位用户分享了在本地使用 Qwen 3.6 27B 进行复杂研究和编程的积极体验,发现它在职业建议和移民研究方面优于 Gemini Pro,同时也提到 Gemma 4 31B 存在性能问题。

Qwen 3.8 27B SlopCodeBench 测试结果

Reddit r/LocalLLaMA

这篇文章展示了 Qwen 3.8 27B 模型在 SlopCodeBench 上的基准测试结果,显示在严格检查点上表现不佳,但在核心检查点上表现尚可,这表明在没有指导的情况下,它可能不适合自主代码管理。