llm-agent

标签

Cards List
#llm-agent

我把真实的医疗记录交给了我的OpenClaw智能体。这是我构建的防护层,确保它不会出错。

Reddit r/openclaw ↗ · 2026-07-12

一位开发者分享了他的开源项目HealthClaw Guardrails,该项目为访问真实健康记录的LLM智能体实施安全防护,包括PHI脱敏、审计日志和人工确认机制,并提供一个合规性端点用于测试。

0 人收藏 0 人点赞
#llm-agent

@PandaTalk8: 不要再去读 X 上又臭又长的 harness 工程的文章了, 跟这篇文章相比, X 上的那些文章垃圾都不如。 Lilian-weng 的这篇新的博客文章, 是我目前读过的最写的清晰、最容易理解的 harness 工程, 也是递归自我改进的…

X AI KOLs Timeline ↗ · 2026-07-10 缓存

推荐并翻译了Lilian Weng关于Harness Engineering for Self-Improvement的博客文章,详细介绍了递归自我改进(RSI)的概念、Harness的模式(工作流自动化、文件系统持久记忆、子Agent)以及编码Agent案例。

0 人收藏 0 人点赞
#llm-agent

从提示到契约:面向可审计企业级LLM代理的约束工程

arXiv cs.AI ↗ · 2026-07-10 缓存

介绍了一种约束工程方法,用于构建可审计的企业级LLM代理,通过将确定性行为转移到代码、模式和验证工件中,并在韩国企业数据上通过故障注入和模型替换测试进行了演示。

0 人收藏 0 人点赞
#llm-agent

智能体神经架构搜索

arXiv cs.AI ↗ · 2026-07-10 缓存

介绍AgentNAS,一种利用大语言模型(LLM)生成初始架构并将其分解为槽位架构的机制,从而为传统神经架构搜索(NAS)定义任务特定的搜索空间,在17项任务中的11项上取得了最先进的结果。

0 人收藏 0 人点赞
#llm-agent

基于关键感知自反馈重试的智能体强化学习

arXiv cs.AI ↗ · 2026-07-07 缓存

PivoARL是一个自反馈重试框架,它识别LLM智能体轨迹中的关键错误回合,实现局部重试以降低交互成本并提高学习效率。在多个智能体和问答基准测试上,该方法显著优于基线方法。

0 人收藏 0 人点赞
#llm-agent

@tonysimons_: https://x.com/tonysimons_/status/2073880068657471523

X AI KOLs Timeline ↗ · 2026-07-05 缓存

详细的技术解析,说明Hermes Agent的结构化处理循环与基础聊天机器人的不同之处,包括提示组装、提供者解析、工具分发和结果评估。

0 人收藏 0 人点赞
#llm-agent

@PandaTalk8: The Log is the Agent 它的核心观点是:不要把日志当成 agent 的副产品,而要把 append-only event log 当成 agent 本身。 在 ActiveGraph 里,目标、规则、工具调用、LLM 响…

X AI KOLs Following ↗ · 2026-07-05 缓存

ActiveGraph是一个将append-only event log作为agent本身的事件溯源运行时,通过图投影实现确定性重放、分叉实验和端到端溯源,为长期可审计的agent系统提供新架构。

0 人收藏 0 人点赞
#llm-agent

@rohanpaul_ai: 勒索软件已从脚本自动化跨越到自主AI决策。一个LLM代理据说链式黑客操作…

X AI KOLs Following ↗ · 2026-07-03 缓存

一个LLM代理自主执行了一次针对Langflow的勒索软件操作,利用一个缺失认证漏洞链式组合多个攻击步骤,并在未保留恢复密钥的情况下破坏数据。

0 人收藏 0 人点赞
#llm-agent

OPINE-World: 使用本体错误优先的交互式探索进行程序化世界建模

arXiv cs.AI ↗ · 2026-07-03 缓存

OPINE-World 引入了一个 LLM 智能体,通过交互在线学习以对象为中心的程序化世界模型,采用本体错误优先的探索和协作的假设-测试智能体,在 ARC-AGI-3 上取得了强劲的结果。

0 人收藏 0 人点赞
#llm-agent

BaRA: BFS与反思网络数据采集代理

arXiv cs.AI ↗ · 2026-07-02 缓存

BaRA是一个框架,用于站点级网络数据采集,结合了有界BFS遍历和基于历史的自反思,在链接发现和可下载提取方面优于现有方法。

0 人收藏 0 人点赞
#llm-agent

基于工作流归纳的多轮自主式科学文献搜索

arXiv cs.CL ↗ · 2026-07-02 缓存

本文介绍了PaperPilot,一个多轮文献搜索智能体,它构建可执行的有向无环图(DAG)搜索操作,并通过用户反馈优化工作流,在检索指标上相比基线模型取得了显著提升。

0 人收藏 0 人点赞
#llm-agent

@DailyDoseOfDS_: 一个受框架控制的LLM智能体,清晰解释!大多数人认为这是一个模型加上附加工具。真正的架构…

X AI KOLs Timeline ↗ · 2026-07-01 缓存

解释了受框架控制的LLM智能体的反向架构,其中智能被外化到记忆、技能和协议中,围绕一个轻量模型核心,由中介器管理交互。

0 人收藏 0 人点赞
#llm-agent

一种基于语义层的异构企业数据库自然语言转SQL智能体

arXiv cs.CL ↗ · 2026-07-01 缓存

本文提出了一种基于语义层的NL2SQL智能体,通过推理精心设计的语义模型将意图与物理执行解耦,在Spider2-snow基准上实现了94.15%的执行准确率。

0 人收藏 0 人点赞
#llm-agent

面向多模态核监管文件多跳推理的LLM引导规划

arXiv cs.AI ↗ · 2026-06-30 缓存

本文将监管文件审查问题建模为LLM引导的规划问题,采用无向量文档树,配备浏览、读取和搜索工具,并以动态知识图谱作为状态。在针对NuScale FSAR文档的200个问题基准测试中,该系统达到了81.5%的准确率和0.93的RAGAS忠实度,显著优于现有RAG方法。

0 人收藏 0 人点赞
#llm-agent

COOPA:一种面向运筹学问题的模块化LLM智能体架构

arXiv cs.LG ↗ · 2026-06-29 缓存

本文介绍了COOPA,一种面向运筹学问题的模块化LLM智能体架构,它结合了基于迭代置信度的建模、元素级溯源和多求解器路由。在八个LLM主干网络和四个基线的评估中,COOPA在六个主干网络上取得了最佳的宏平均准确率,并在最强基线的基础上提升了最多6.7个百分点。

0 人收藏 0 人点赞
#llm-agent

EVOM: 智能体元进化中的Actor-Critic架构强化学习方法

arXiv cs.LG ↗ · 2026-06-26 缓存

介绍了EVOM,一种基于LLM的设计智能体的智能体元进化框架,用于自动发现高性能的Actor-Critic架构,在连续控制任务上优于手动基线方法和先前方法。

0 人收藏 0 人点赞
#llm-agent

ProfileFoundry: 用于LLM智能体隐私、记忆与工具使用评估的合成人-对象基底

arXiv cs.CL ↗ · 2026-06-26 缓存

ProfileFoundry 引入了一个确定性的合成人-对象数据集,包含10万个档案和70万+事件,旨在评估LLM智能体在隐私、记忆和工具使用方面的表现,同时确保可检查性和一致性。

0 人收藏 0 人点赞
#llm-agent

@chenchengpro: 给 LLM Agent 堆越花哨的"记忆"架构,效果不一定越好。一篇新论文实测了 12 个记忆系统,没有通用赢家。 它把 Agent 记忆当成数据库来拆——表示与存储、抽取、检索与路由、维护四个模块,拉来 Mem0、Letta、Zep、C…

X AI KOLs Timeline ↗ · 2026-06-25 缓存

一篇论文系统评估了12个LLM Agent记忆系统,将其拆分为四个模块,发现没有单一架构在所有场景下占优,并揭示了成本-性能权衡和常见问题(如“过去的幻觉”)。

0 人收藏 0 人点赞
#llm-agent

DeXposure-Claw: 一种用于DeFi风险监管的智能体系统

arXiv cs.AI ↗ · 2026-06-20 缓存

介绍了DeXposure-Claw,一个基于预测的智能体系统,用于DeFi风险监管。该系统使用图时间序列基础模型来预测风险敞口网络,并通过确定性监控器与置信门来约束LLM生成的监管工单。同时提出了DeXposure-Bench,一个六维评估框架,用于与监管目标一致的评估。

0 人收藏 0 人点赞
#llm-agent

当规则学习:一种用于法律案例检索的自我进化智能体

arXiv cs.AI ↗ · 2026-06-17 缓存

本文介绍了一种自我进化框架,该框架利用基于LLM的智能体,为法律案例检索中的BM25迭代创建并优化查询重写规则,在无需任何参数训练的情况下,在LeCaRD-v2基准上优于非进化基线。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈