选择大语言模型擅长与不擅长的任务
摘要
该文章强调,大语言模型在处理模糊判断任务方面表现卓越,但在执行一致性计算时表现平平,因此主张在多智能体系统中实现任务专门化。
构建多Agent系统的另一个模式,是关于“类型化契约”的后续探讨。LLM在特定类型任务中表现卓越,但在另一类任务上则平庸无奇。我在多Agent系统中遇到的大多数痛苦,都源于未能正确区分这两类任务。
LLM真正擅长的领域是:**需要判断、没有唯一正确答案的任务**。例如:
- 在这三个信号中,哪一个在此刻最重要?为什么?
- 面对如此杂乱的输入,最合理的解读是什么?
这是模糊性下的推理,也是LLM带来的真正价值。即便你想为它编写确定性函数,也难以实现——因为这类问题本就不存在唯一的标准答案。
LLM表现平庸的领域是:**一致性计算**。当你要求LLM将一组输入转化为评分、排名或具体数值时,它会给出看似自信且合理的输出。但它并非在“计算”那个数字,而是在根据上下文匹配这类结果通常应有的样子。若调整输入顺序、修改一句表述,同样的数据就可能悄然生成不同的数值。整个过程不会报错,其输出的可信度在错误时与正确时如出一辙——这比普通漏洞更危险,因为连问题堆栈追踪都无处寻觅。
因此我最终采用的模式是:**LLM仅承担第一类任务**。所有属于第二类的任务都交给纯代码处理。
```python
# 欺骗性任务(若交给LLM执行)
score = llm("请根据这些信号给出0-100分的评分")
# 按照实际能力拆分任务
weights = llm.decide_which_signals_matter(inputs) # 判断性任务(模糊领域)
score = composite_score_tool(inputs, weights) # 计算性任务(存在唯一正确答案)
```
相似文章
你的LLM不应该是你的编码智能体工作流
主张在编码智能体工作流中,LLM应仅用于推理,而由确定性基础设施处理队列、状态、重试和恢复,这样即使达到使用限制,流程也不会中断。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。
LLMs 现在变得复杂了
文章讨论了LLMs如何变得越来越复杂,从简单的Transformer堆栈演变为融入多种注意力变体、混合专家模型和多模态编码器,与推荐系统进行了类比,并强调了像FlexAttention这样可组合内核优化的必要性。
法律中多智能体协商研究
本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。
在添加LLM之前要问的六个问题
本文主张不应盲目采用LLM,并提出了六个问题来评估LLM是否适合特定工作流程,强调LLM以确定性换取灵活性,仅在必要时才应使用。