taxonomy

标签

Cards List
#taxonomy

ENTRAP-VL: 面向视觉语言模型的双重语境夹带分类探测工具

Hugging Face Daily Papers · 2026-07-22 缓存

介绍了ENTRAP-VL,这是一个由1500个条目构成的分类结构化数据集,用于探测视觉语言模型中的语境夹带现象,并研究文本语境与视觉语境如何独立影响模型输出。

0 人收藏 0 人点赞
#taxonomy

强化学习策略验证综述

arXiv cs.AI · 2026-07-21 缓存

本综述为强化学习策略的验证方法提供了统一视角,提出了一个按三个维度(验证范式、时间范围和保证强度)分类的方法,并指出了新兴研究方向。

0 人收藏 0 人点赞
#taxonomy

超越二元检测:Reddit上癌症错误信息的多维度分类

arXiv cs.CL · 2026-07-15 缓存

本文提出了一种多维度分类法,用于描述Reddit上的癌症错误信息,评估了大型语言模型(LLMs)在注释方面的表现,发现约6%的癌症讨论包含错误信息。它识别出反复出现的叙事,如未经支持的治疗方法和对传统医学的不信任。

0 人收藏 0 人点赞
#taxonomy

隔离作为LLM-Agent系统安全的首要原则:概念、分类、挑战与未来方向

arXiv cs.AI · 2026-07-15 缓存

本文提出将隔离作为LLM-Agent系统安全的首要原则,并给出一种以边界为中心的故障与防御分析分类法。该分类法系统性地对五大边界上的安全问题进行了划分,并概述了未来研究方向。

0 人收藏 0 人点赞
#taxonomy

利用LP2Graph进行LP挖掘:铁路重新调度的一个用例

arXiv cs.AI · 2026-07-15 缓存

本文介绍了利用LP2Graph进行LP挖掘的方法,该方法通过类型化变量-方程图从文献中提取LP和MILP公式并将其分类为可复现的数据集,并以铁路重新调度为例进行了展示。

0 人收藏 0 人点赞
#taxonomy

量化LLM推理中的无声失败:基于分类法的空洞收敛与失败模式转变分析

arXiv cs.CL · 2026-07-14 缓存

本文通过一个基于分类法的分析,对多个模型和基准测试中的30,000个思维链输出进行研究,证明了训练后量化可以无声地改变大语言模型的推理方式,即使任务准确性保持不变。

0 人收藏 0 人点赞
#taxonomy

动态代理技能:演化技能库的生命周期调查与分类法

arXiv cs.AI · 2026-07-14 缓存

本文提出了大语言模型代理的动态技能库的分类法与生命周期调查,设计了一个八阶段生命周期架构和一个六感分类法来组织演化的技能工件。

0 人收藏 0 人点赞
#taxonomy

@qingke_ai: https://x.com/qingke_ai/status/2076115489219297455

X AI KOLs Timeline · 2026-07-12 缓存

普林斯顿博士后Shilong Liu提出自进化代理的三层分类体系:工件迭代优化、Agent Harness自我改进和无黄金答案的模型学习,系统梳理了相关概念和前沿工作。

0 人收藏 0 人点赞
#taxonomy

AI中的递归自我改进:从有界自我优化到自主研究循环

arXiv cs.AI · 2026-07-09 缓存

对2024–2026年间1,250篇关于AI递归自我改进的论文进行了全面综述,提出了将有界自我优化与开放式递归自我改进相区分的分类体系,并分析了评估器设计空间和失败模式。

0 人收藏 0 人点赞
#taxonomy

自我进化智能体分类法(15分钟阅读)

TLDR AI · 2026-07-09 缓存

Shilong Liu 提出了一种分类法,将自我进化智能体分为产物优化、框架自我改进和模型学习三类,为新兴智能体研究提供了通用语言。

0 人收藏 0 人点赞
#taxonomy

超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析

arXiv cs.AI · 2026-07-08 缓存

本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。

0 人收藏 0 人点赞
#taxonomy

具身算子与基准测试:迈向可复用和可部署的具身智能系统

arXiv cs.AI · 2026-07-07 缓存

本文定义具身算子为具身智能流水线中的可复用功能模块,提出一个涵盖五大类别的分类体系,并构建了一个多维基准框架来评估其可部署性和可组合性。

0 人收藏 0 人点赞
#taxonomy

OmniOpt:现代优化器的分类体系、几何特性与基准测试

Hugging Face Daily Papers · 2026-07-04 缓存

OmniOpt 提出了一个用于大规模模型训练中优化器选择的统一框架,该框架结合了元流水线变换、范数约束的线性最小化预言机以及跨领域基准,以系统分析优化器家族及其权衡。

0 人收藏 0 人点赞
#taxonomy

@omarsar0: 如果你使用MCP构建,这篇值得一读。(收藏它)论文涵盖了五个反复出现的MCP服务器模式……

X AI KOLs Following · 2026-06-30 缓存

本文对在十五个独立开发的服务器中观察到的五个反复出现的MCP服务器架构模式进行了分类,提供了一个包含上下文、问题、解决方案和后果的分类法。还记录了反模式、横切关注点以及定量评估,包括评分者间信度和传输开销。

0 人收藏 0 人点赞
#taxonomy

Agent-Native 免疫系统:架构、分类与工程

arXiv cs.AI · 2026-06-29 缓存

本文介绍了Agent-Native免疫系统(ANIS),这是一种受生物启发的内源性防御架构,直接嵌入在智能体的认知循环内。它提出了六层免疫塔、统一的智能体病毒与疫苗分类法,以及用于持续免疫学习的Harness Triad,以应对自主智能体中的运行时劫持漏洞。

0 人收藏 0 人点赞
#taxonomy

人类书写文本中事实错误的实证分析及其应用

arXiv cs.CL · 2026-06-29 缓存

本文基于报纸勘误,提出了一种人类书写文本中事实错误的分类法,并评估了LLMs在检测这些错误上的表现,发现即使像GPT-5.4这样的顶级模型,在词语级别的F1得分上也仅达到52%,凸显了该任务的难度。

0 人收藏 0 人点赞
#taxonomy

广义同步的局限:架构、权衡与决策因素的分类体系

Lobsters Hottest · 2026-06-25 缓存

本论文来自阿尔托大学,提出了同步架构的分类体系,分析了权衡与决策因素,以指导广义同步引擎的设计。

0 人收藏 0 人点赞
#taxonomy

记忆造就差异:评估不同记忆角色如何塑造对话代理

arXiv cs.CL · 2026-06-25 缓存

本文介绍了一种对话记忆类型的分类法和一个以用户为中心的评估框架,用于研究不同记忆角色如何影响基于RAG的对话代理的响应质量。

0 人收藏 0 人点赞
#taxonomy

@cuisitekp: 9B 的模型,把比它大好几倍的模型干下去了。 Ai2 和华盛顿大学那拨做 OLMo / Tülu 的人,放出一篇新论文叫 Tmax,自称是目前最强的开源「终端 agent」RL 训练配方。 成绩:一个 9B 模型在 Terminal-Be…

X AI KOLs Timeline · 2026-06-24 缓存

Ai2和华盛顿大学发布论文Tmax,提出目前最强的开源终端智能体RL训练配方。仅用9B参数模型在Terminal-Bench 2.0上击败更大模型,关键在于低成本生成大量可验证训练数据,而非模型规模或算法。

0 人收藏 0 人点赞
#taxonomy

(Re//Verse 2026) 现实世界二进制混淆器的分类与去混淆化方法 [pdf]

Hacker News Top · 2026-06-11

本文介绍了一种现实世界二进制混淆器的分类法和去混淆化方法,该论文很可能在Re//Verse 2026会议上发表。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈