llm-agent

标签

Cards List
#llm-agent

AutoProteinEngine:用于蛋白质工程中多模态AutoML的大语言模型驱动智能体框架

arXiv cs.AI ↗ · 2026-08-06 缓存

介绍了AutoProteinEngine(AutoPE),这是一个由大语言模型驱动的智能体框架,使不具备深度学习专业知识的生物学家能够通过自然语言执行蛋白质工程中的多模态AutoML,展示了相比零样本和手动微调方法的性能提升。

0 人收藏 0 人点赞
#llm-agent

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

arXiv cs.AI ↗ · 2026-08-06 缓存

This paper proposes A/B Agent, a closed-loop agent framework that organizes historical A/B testing knowledge into a hierarchical experience tree, retrieves transferable strategies via multi-path Tree-RAG, and self-evolves through online experiment feedback, achieving a 4.829% GMV improvement in a short-video e-commerce recommendation system.

0 人收藏 0 人点赞
#llm-agent

NeSyFS:面向部分可观测环境下LLM智能体的神经符号快慢思考框架

arXiv cs.AI ↗ · 2026-08-03 缓存

NeSyFS是一个面向部分可观测环境下LLM智能体的神经符号框架,利用知识图谱表示信念状态,结合快慢思考与不确定性感知规划及反思机制,在ALFWorld、Webshop和ScienceWorld上取得了显著效果。

0 人收藏 0 人点赞
#llm-agent

我构建了LOLM:一个更低成本、支持实时控制决策和密封运行收据的LLM智能体

Reddit r/ArtificialInteligence ↗ · 2026-07-31

LOLM的构建者宣布推出Qira开发的Transformer-SSM混合语言模型与智能体系统,具备实时决策控制器、运行收据、CLI、编码沙箱、MCP支持以及更低成本的托管访问。

0 人收藏 0 人点赞
#llm-agent

IDP AutoOpt:文档处理流水线配置的智能体驱动优化

arXiv cs.AI ↗ · 2026-07-31 缓存

本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。

0 人收藏 0 人点赞
#llm-agent

PowerAtlas:面向电力系统的电算协同调度

arXiv cs.LG ↗ · 2026-07-30 缓存

PowerAtlas是一个LLM代理框架,用于在数据中心中联合调度电力和计算,确保电网可行性和任务SLA。通过与真实电力公司和包含2000个实例的新基准(ECBench)进行验证,它在多个开放权重LLM上显示出一致的性能提升。

0 人收藏 0 人点赞
#llm-agent

@DataScienceDojo: 您的 LLM 智能体可以自行调用工具、写入文件并访问 API —— 这意味着它需要一个安全的环境来执行这些操作。

X AI KOLs Timeline ↗ · 2026-07-29 缓存

DataScienceDojo 主办了一场由 Docker 赞助的网络研讨会,主题是使用 Docker 沙箱安全运行 LLM 智能体,由 Docker 开发者成功倡导者 Dan Ndombe 主持实践环节。

0 人收藏 0 人点赞
#llm-agent

CogEEGAgent: 迈向基于落地执行与选择感知验证的自主认知脑电分析

arXiv cs.AI ↗ · 2026-07-29 缓存

CogEEGAgent 是一个基于大型语言模型的智能体,用于自主认知脑电分析,它采用落地执行与选择感知验证框架,确保可靠的分析选择,并阻止自适应搜索产生的误报。

0 人收藏 0 人点赞
#llm-agent

PATHFinder Agent:用于定制化产前护理的智能系统

arXiv cs.AI ↗ · 2026-07-29 缓存

本文介绍了PATHFinder Agent,一个端到端的对话式AI系统,该系统根据ACOG的PATH指南生成个性化产前护理计划,整合了患者信息采集、动态对话、计划合成及临床医生监督。对包括GPT-5.2在内的前沿大语言模型的评估显示出有希望但不完全的性能,凸显了产前检测建议方面的不足。

0 人收藏 0 人点赞
#llm-agent

先验真相:一种用于智能体记忆的纵向评估工具,以及记忆架构排名中的任期交叉现象

arXiv cs.CL ↗ · 2026-07-27 缓存

本文提出了一种用于智能体记忆的纵向评估工具,通过在文本生成之前生成事实来避免标签错误和污染,并证明短期基准测试相比长期性能可能会错误地排序记忆架构。同时,它还发布了用于智能体记忆评估的开源库Veracium。

0 人收藏 0 人点赞
#llm-agent

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI ↗ · 2026-07-24 缓存

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。

0 人收藏 0 人点赞
#llm-agent

检索即足够:使用工具代理的无训练可解释性

arXiv cs.LG ↗ · 2026-07-21 缓存

HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。

0 人收藏 0 人点赞
#llm-agent

CoWeaver:面向人与智能体混合科学协作的双向、可学习且可解释的匹配引擎

arXiv cs.AI ↗ · 2026-07-20 缓存

CoWeaver是一种双向、可学习且可解释的匹配引擎,旨在通过填补能力差距、两阶段排序和不确定性感知探索,在科学网络中促成人类与基于LLM的智能体之间的强大协作。

0 人收藏 0 人点赞
#llm-agent

@Xudong07452910: RL 训练 LLM Agent 有个经典难题: 一次长任务失败后,模型到底该从哪里学起? 最终奖励通常只能告诉 Agent「成功或失败」,却很难指出中间哪些判断值得保留,哪些动作把整条轨迹带偏了。 这篇论文提出 SEED,用「自进化在线蒸…

X AI KOLs Timeline ↗ · 2026-07-20 缓存

这篇论文提出SEED方法,通过自进化在线蒸馏将轨迹中的事后技能内化到模型参数中,解决长任务RL训练中奖励稀疏的问题,在ALFWorld等基准上取得了显著提升。

0 人收藏 0 人点赞
#llm-agent

Harness Handbook 将智能体行为映射到代码(28分钟阅读)

TLDR AI ↗ · 2026-07-17 缓存

Harness Handbook 为AI智能体框架提供了行为级手册,将系统行为与可验证的代码证据关联,使框架可理解、可审计、可编辑。

0 人收藏 0 人点赞
#llm-agent

使用大型语言模型驱动的代理系统自动发现生物系统的常微分方程

arXiv cs.AI ↗ · 2026-07-16 缓存

本文介绍了MEDA,一个由LLM和符号回归驱动的代理框架,用于自动发现生物动态系统的常微分方程(ODE)模型。它检索背景知识,提出候选ODE,并在典型模型检索、外推和开放式发现任务中评估这些模型,展示了强大的结构恢复能力和生物学上合理的模型。

0 人收藏 0 人点赞
#llm-agent

PalmClaw: 一种原生设备内手机代理框架

arXiv cs.CL ↗ · 2026-07-15 缓存

PalmClaw 是一个开源代理框架,原生运行在手机上,将设备功能暴露为具有明确执行边界的显式工具。与基线相比,任务成功率提升 11.5%,完成时间减少 94.9%。

0 人收藏 0 人点赞
#llm-agent

隔离作为LLM-Agent系统安全的首要原则:概念、分类、挑战与未来方向

arXiv cs.AI ↗ · 2026-07-15 缓存

本文提出将隔离作为LLM-Agent系统安全的首要原则,并给出一种以边界为中心的故障与防御分析分类法。该分类法系统性地对五大边界上的安全问题进行了划分,并概述了未来研究方向。

0 人收藏 0 人点赞
#llm-agent

SAGEAgent: 用于多模态生存预测中成本感知模态获取的自进化智能体

arXiv cs.AI ↗ · 2026-07-13 缓存

SAGEAgent 是一种基于LLM的临床智能体,它依次决定为癌症患者获取哪些诊断模态,以平衡预测准确性与临床侵入性,在将获取负担降低55%的同时,保持具有竞争力的生存预测性能。

0 人收藏 0 人点赞
#llm-agent

有人构建了一个AI代理,能够入侵网络并劫持数据勒索赎金。它竟然成功了。

Reddit r/artificial ↗ · 2026-07-12

一个基于LLM的自主代理名为JadePuffer,利用Langflow漏洞入侵服务器,窃取凭证,加密数据库并索要赎金,且在数秒内适应错误。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈