标签
This paper presents ZhuLong, an execution-grounded LLM coding agent for EDA scripting that uses API retrieval, documentation inspection, and sandbox execution via MCP tools, augmented by an offline API self-exploration mechanism to infer undocumented API behaviors. It achieves 78.5% Pass@1 on a benchmark of 158 real-world EDA tasks, significantly outperforming a pure LLM baseline.
Agent-MD is a framework that selectively applies LLM reasoning to long-running molecular simulation campaigns, using a deterministic rule-based agent for routine tasks and event-triggered LLM review for exceptional conditions. Demonstrated in GCMC–MD water-vapor desorption simulations, it shows that auditable, reproducible scientific workflows can avoid placing every operation inside an LLM reasoning loop.
一位开发人员构建了一个完全自主的定制智能体架构,可以在无人干预的情况下运行数周。他正在向社区寻求极端、对抗性的任务来对其进行彻底的压力测试,因为他无法再相信自己的判断。
作者构建了 sidetap,这是一个 Python 工具集,允许 LLM 智能体通过 USB 从 Windows 控制真实 iPhone,并具备紧急停止开关和护栏等安全功能。文章详细介绍了使用免费 Apple ID 侧载 WebDriverAgent 所面临的技术挑战,并介绍了这个开源工具。
介绍 phone-harness,一个开源工具,通过 macOS 的 iPhone Mirroring 让 LLM(如 Codex)像人类一样自动化任意 iOS 应用,无需 API 或越狱,利用屏幕截图、Vision OCR 和 HID 事件实现视觉与操作。
提出了SkillTrace,一种面向LLM智能体技能复用的多迹溯源审计框架,该框架提取表达迹、实现迹和操作迹,在基准测试上取得了较高的准确率,并能够进行大规模真实环境审计。
本文提出了一种可解释的LLM智能体层,放置于开放世界学习管道的下游,用于油井异常检测,利用Qwen3.5-397B-A17B模型在3W数据集上提供自然语言理由和新颖性命名。
介绍了AutoProteinEngine(AutoPE),这是一个由大语言模型驱动的智能体框架,使不具备深度学习专业知识的生物学家能够通过自然语言执行蛋白质工程中的多模态AutoML,展示了相比零样本和手动微调方法的性能提升。
This paper proposes A/B Agent, a closed-loop agent framework that organizes historical A/B testing knowledge into a hierarchical experience tree, retrieves transferable strategies via multi-path Tree-RAG, and self-evolves through online experiment feedback, achieving a 4.829% GMV improvement in a short-video e-commerce recommendation system.
NeSyFS是一个面向部分可观测环境下LLM智能体的神经符号框架,利用知识图谱表示信念状态,结合快慢思考与不确定性感知规划及反思机制,在ALFWorld、Webshop和ScienceWorld上取得了显著效果。
LOLM的构建者宣布推出Qira开发的Transformer-SSM混合语言模型与智能体系统,具备实时决策控制器、运行收据、CLI、编码沙箱、MCP支持以及更低成本的托管访问。
本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。
PowerAtlas是一个LLM代理框架,用于在数据中心中联合调度电力和计算,确保电网可行性和任务SLA。通过与真实电力公司和包含2000个实例的新基准(ECBench)进行验证,它在多个开放权重LLM上显示出一致的性能提升。
DataScienceDojo 主办了一场由 Docker 赞助的网络研讨会,主题是使用 Docker 沙箱安全运行 LLM 智能体,由 Docker 开发者成功倡导者 Dan Ndombe 主持实践环节。
CogEEGAgent 是一个基于大型语言模型的智能体,用于自主认知脑电分析,它采用落地执行与选择感知验证框架,确保可靠的分析选择,并阻止自适应搜索产生的误报。
本文介绍了PATHFinder Agent,一个端到端的对话式AI系统,该系统根据ACOG的PATH指南生成个性化产前护理计划,整合了患者信息采集、动态对话、计划合成及临床医生监督。对包括GPT-5.2在内的前沿大语言模型的评估显示出有希望但不完全的性能,凸显了产前检测建议方面的不足。
本文提出了一种用于智能体记忆的纵向评估工具,通过在文本生成之前生成事实来避免标签错误和污染,并证明短期基准测试相比长期性能可能会错误地排序记忆架构。同时,它还发布了用于智能体记忆评估的开源库Veracium。
本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。
HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。
CoWeaver是一种双向、可学习且可解释的匹配引擎,旨在通过填补能力差距、两阶段排序和不确定性感知探索,在科学网络中促成人类与基于LLM的智能体之间的强大协作。