标签
Meta的Muse Spark 1.2在Text Arena中升至第4位,通过降价约91%将成本-质量帕累托前沿向上推进,同时相比顶级模型仅损失9分。
审计生产级客服RAG系统的实际发现:启发式评估器给出虚假信号,检索错误常伪装为LLM失败,成本与质量的帕累托前沿往往不在预期位置。模型扫查显示,用Gemma 4 26B替换原有模型(Gemini Flash Lite Preview)可在成本降低79%的同时实现19%的质量提升。