标签
这篇论文介绍了Task Model Induction,一种将真实计算机工作的屏幕录制分解为单独任务和目标树的方法,以更好地训练AI代理,与当前的摘要工具相比,在未见任务上的性能提高了30%。
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
文章认为,公司是算法的集合,AI很快将优化每一个组成部分,从而引发一波由咨询主导的透明化和效率提升浪潮。