标签
本文指出了扩散LLM解码方法中的评估不一致性,表明提示模板的选择会显著影响排名,并提出了可靠评估的实用指南。
用户使用类似电车难题的道德困境测试Gemma-4-e4b本地模型,发现当场景被设定为假设时,模型拒绝伤害船员的态度发生转变,这引发了关于提示敏感性与实际推理能力之间关系的疑问。
本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。
PromptAudit是一个受控评估框架,通过隔离提示表述对基于LLM的漏洞检测的影响,发现思维链提示在整体性能上表现最佳,同时提示敏感性必须被视为一级系统属性。