标签
本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。
A hands-on field guide to Grok 4.6, highlighting its speed, dense communication style, and effective prompting patterns for coding and knowledge work.
一个提示技巧,建议给超强AI一个不可能的任务,它可能会转而解决一个重要的相关问题,并幽默地提到入侵另一家公司。
一位开发者回顾了六个月来使用AI进行代码审查的经历,发现模糊的提示会产生看似合理但毫无用处的反馈。解决办法是将审查视为一个带门控的流水线,包含明确的上下文、分范围的检查、验证清单和对抗性自我批评。
The article introduces Revision Prompting, a technique for industrial LLM processes that improves speed, cost, and consistency when re-processing updated inputs by generating output patches from diffs.
本文介绍了KV-Skill,这是一个外部因子化算子的设计空间,冻结的语言模型通过轻量级接口读取这些算子,从而能够从文本或奖励中获取任务知识并独立部署。在十个基准上的实验表明,与文本技能、前缀微调和LoRA相比,KV-Skill持续带来改进,且技能可组合、可加载。
本文研究了使用检索到的文档简化示例来引导大语言模型进行文档级文本简化,在OneStopEnglish语料库上展示了相比仅使用提示生成的改进效果。
该论文提出了约束优先推理(CFR),一种免训练的两阶段提示协议,在求解前提取答案空间约束,并检查中间及最终结果是否符合这些约束,从而在竞赛基准测试中提升了数学问题求解性能。
一条推文重点介绍了Sam Altman在斯坦福大学的演讲,内容涉及ChatGPT的高级用法,声称用户不再需要编写提示词,并指向一份构建自我提示系统的指南。
分析了按 token 计费的 LLM 定价如何激励冗长输出,并提出了低熵提示约束(FAOA)以降低成本并提高语义密度。
SkalskiP 重点介绍了 Qwen3.8-Max,这是一个用于目标检测的视觉语言模型,可以通过正负框提示生成检测结果,在单个或多个提示下实现 60-80% 的 mAP,并且在不同类型的图像上表现良好。
一篇反思性文章,认为更换AI模型很少能解决输出质量差的问题;相反,提供给模型的上下文质量才是主要驱动力,涵盖事实、示例和修正。
有用户报告称,Claude Opus 5 在收到特定提示词时表现异常,并附上 X 帖子链接以提供详情。
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
本文探讨了任务的叙事框架(如疾病调查 vs. 谋杀之谜)如何比分配的角色更能驱动大语言模型(LLM)智能体的行为,提出了 '叙事先验' 的概念,这些先验解释了5至31倍的行为方差,且在三个领域中,有两领域与任务成功呈负相关。
可塑提示(Malleable Prompting)是一种新颖的交互技术,它将自然语言偏好具体化为GUI控件(滑块、开关、下拉菜单)以供直接操作,并配有解码算法,该算法根据控件值调节词元概率,从而实现对LLM生成的精确控制。一项用户研究表明,在精确性、可控性和透明度方面,它优于纯自然语言提示。