标签
本文介绍了一种生产级企业分析系统,该系统通过领域专家技能和知识编译,将交互模式从问题优先反转为分析师优先,从而实现带有验证指标和建议问题的主动分析。
本可行性研究比较了独立LLM与预定义智能体流水线在解释ICU死亡率预测中的效果,发现智能体方法改善了指南依据和患者特异性细节,但需要基于归因的检查以确保安全性。
HarnessEval-W 是一个智能代理管道,通过生成透明的证据树而非不透明的评分来自动化世界模型的人类评估,增强基准测试中的信任和可检查性。
作者分享了在预算有限的情况下构建本地智能管道的经验,得出结论:在可靠性和资源使用方面,刚性Python代码优于灵活的AI智能体。
一个自我优化的智能体管线,在TerminalBench上将基准性能从约30%提升至约90%,并且可以通过记录交互、使用本地模型进行反思、以及将经验注入未来的系统提示中,扩展应用到日常对话场景。