llm-agent

标签

Cards List
#llm-agent

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

arXiv cs.AI · 4小时前 缓存

This paper presents ZhuLong, an execution-grounded LLM coding agent for EDA scripting that uses API retrieval, documentation inspection, and sandbox execution via MCP tools, augmented by an offline API self-exploration mechanism to infer undocumented API behaviors. It achieves 78.5% Pass@1 on a benchmark of 158 real-world EDA tasks, significantly outperforming a pure LLM baseline.

0 人收藏 0 人点赞
#llm-agent

Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC--MD Campaigns

arXiv cs.AI · 4小时前 缓存

Agent-MD is a framework that selectively applies LLM reasoning to long-running molecular simulation campaigns, using a deterministic rule-based agent for routine tasks and event-triggered LLM review for exceptional conditions. Demonstrated in GCMC–MD water-vapor desorption simulations, it shows that auditable, reproducible scientific workflows can avoid placing every operation inside an LLM reasoning loop.

0 人收藏 0 人点赞
#llm-agent

寻找极端/不可能的任务来对我的智能体进行彻底的压力测试。我再也不能相信自己的判断了

Reddit r/AI_Agents · 22小时前

一位开发人员构建了一个完全自主的定制智能体架构,可以在无人干预的情况下运行数周。他正在向社区寻求极端、对抗性的任务来对其进行彻底的压力测试,因为他无法再相信自己的判断。

0 人收藏 0 人点赞
#llm-agent

让智能体在真实 iPhone 上自由操作,教会了我先构建紧急停止开关

Reddit r/AI_Agents · 昨天

作者构建了 sidetap,这是一个 Python 工具集,允许 LLM 智能体通过 USB 从 Windows 控制真实 iPhone,并具备紧急停止开关和护栏等安全功能。文章详细介绍了使用免费 Apple ID 侧载 WebDriverAgent 所面临的技术挑战,并介绍了这个开源工具。

0 人收藏 0 人点赞
#llm-agent

@jinglian: 卧槽,Codex 可以使用你的 iPhone! 介绍一下:phone-harness > 像人类一样自动化任何 iOS 应用 > 原生 iPhone 控制 → 无需 API,无需越狱 > 连接一次,随时控制 只需一个提示即可设置。 立即开…

X AI KOLs Timeline · 昨天 缓存

介绍 phone-harness,一个开源工具,通过 macOS 的 iPhone Mirroring 让 LLM(如 Codex)像人类一样自动化任意 iOS 应用,无需 API 或越狱,利用屏幕截图、Vision OCR 和 HID 事件实现视觉与操作。

0 人收藏 0 人点赞
#llm-agent

SkillTrace:面向LLM智能体技能复用的多迹溯源审计

arXiv cs.AI · 4天前 缓存

提出了SkillTrace,一种面向LLM智能体技能复用的多迹溯源审计框架,该框架提取表达迹、实现迹和操作迹,在基准测试上取得了较高的准确率,并能够进行大规模真实环境审计。

0 人收藏 0 人点赞
#llm-agent

用于油井开放世界异常检测的可解释LLM智能体层

arXiv cs.LG · 5天前 缓存

本文提出了一种可解释的LLM智能体层,放置于开放世界学习管道的下游,用于油井异常检测,利用Qwen3.5-397B-A17B模型在3W数据集上提供自然语言理由和新颖性命名。

0 人收藏 0 人点赞
#llm-agent

AutoProteinEngine:用于蛋白质工程中多模态AutoML的大语言模型驱动智能体框架

arXiv cs.AI · 5天前 缓存

介绍了AutoProteinEngine(AutoPE),这是一个由大语言模型驱动的智能体框架,使不具备深度学习专业知识的生物学家能够通过自然语言执行蛋白质工程中的多模态AutoML,展示了相比零样本和手动微调方法的性能提升。

0 人收藏 0 人点赞
#llm-agent

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

arXiv cs.AI · 5天前 缓存

This paper proposes A/B Agent, a closed-loop agent framework that organizes historical A/B testing knowledge into a hierarchical experience tree, retrieves transferable strategies via multi-path Tree-RAG, and self-evolves through online experiment feedback, achieving a 4.829% GMV improvement in a short-video e-commerce recommendation system.

0 人收藏 0 人点赞
#llm-agent

NeSyFS:面向部分可观测环境下LLM智能体的神经符号快慢思考框架

arXiv cs.AI · 2026-08-03 缓存

NeSyFS是一个面向部分可观测环境下LLM智能体的神经符号框架,利用知识图谱表示信念状态,结合快慢思考与不确定性感知规划及反思机制,在ALFWorld、Webshop和ScienceWorld上取得了显著效果。

0 人收藏 0 人点赞
#llm-agent

我构建了LOLM:一个更低成本、支持实时控制决策和密封运行收据的LLM智能体

Reddit r/ArtificialInteligence · 2026-07-31

LOLM的构建者宣布推出Qira开发的Transformer-SSM混合语言模型与智能体系统,具备实时决策控制器、运行收据、CLI、编码沙箱、MCP支持以及更低成本的托管访问。

0 人收藏 0 人点赞
#llm-agent

IDP AutoOpt:文档处理流水线配置的智能体驱动优化

arXiv cs.AI · 2026-07-31 缓存

本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。

0 人收藏 0 人点赞
#llm-agent

PowerAtlas:面向电力系统的电算协同调度

arXiv cs.LG · 2026-07-30 缓存

PowerAtlas是一个LLM代理框架,用于在数据中心中联合调度电力和计算,确保电网可行性和任务SLA。通过与真实电力公司和包含2000个实例的新基准(ECBench)进行验证,它在多个开放权重LLM上显示出一致的性能提升。

0 人收藏 0 人点赞
#llm-agent

@DataScienceDojo: 您的 LLM 智能体可以自行调用工具、写入文件并访问 API —— 这意味着它需要一个安全的环境来执行这些操作。

X AI KOLs Timeline · 2026-07-29 缓存

DataScienceDojo 主办了一场由 Docker 赞助的网络研讨会,主题是使用 Docker 沙箱安全运行 LLM 智能体,由 Docker 开发者成功倡导者 Dan Ndombe 主持实践环节。

0 人收藏 0 人点赞
#llm-agent

CogEEGAgent: 迈向基于落地执行与选择感知验证的自主认知脑电分析

arXiv cs.AI · 2026-07-29 缓存

CogEEGAgent 是一个基于大型语言模型的智能体,用于自主认知脑电分析,它采用落地执行与选择感知验证框架,确保可靠的分析选择,并阻止自适应搜索产生的误报。

0 人收藏 0 人点赞
#llm-agent

PATHFinder Agent:用于定制化产前护理的智能系统

arXiv cs.AI · 2026-07-29 缓存

本文介绍了PATHFinder Agent,一个端到端的对话式AI系统,该系统根据ACOG的PATH指南生成个性化产前护理计划,整合了患者信息采集、动态对话、计划合成及临床医生监督。对包括GPT-5.2在内的前沿大语言模型的评估显示出有希望但不完全的性能,凸显了产前检测建议方面的不足。

0 人收藏 0 人点赞
#llm-agent

先验真相:一种用于智能体记忆的纵向评估工具,以及记忆架构排名中的任期交叉现象

arXiv cs.CL · 2026-07-27 缓存

本文提出了一种用于智能体记忆的纵向评估工具,通过在文本生成之前生成事实来避免标签错误和污染,并证明短期基准测试相比长期性能可能会错误地排序记忆架构。同时,它还发布了用于智能体记忆评估的开源库Veracium。

0 人收藏 0 人点赞
#llm-agent

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI · 2026-07-24 缓存

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。

0 人收藏 0 人点赞
#llm-agent

检索即足够:使用工具代理的无训练可解释性

arXiv cs.LG · 2026-07-21 缓存

HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。

0 人收藏 0 人点赞
#llm-agent

CoWeaver:面向人与智能体混合科学协作的双向、可学习且可解释的匹配引擎

arXiv cs.AI · 2026-07-20 缓存

CoWeaver是一种双向、可学习且可解释的匹配引擎,旨在通过填补能力差距、两阶段排序和不确定性感知探索,在科学网络中促成人类与基于LLM的智能体之间的强大协作。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈