research-paper

标签

Cards List
#research-paper

@charliejhills:研究人员刚刚发布了一篇重新定义AGI实际含义的论文。它并非大多数人想的那样。论文开篇…

X AI KOLs Timeline ↗ · 2026-05-25 缓存

一篇新论文将AGI重新定义为在限制条件(计算、内存、能源)下的适应能力,并提出了一个“人工科学家基准”,专注于自主发现因果关系,而不是在固定任务上达到人类水平的表现。

0 人收藏 0 人点赞
#research-paper

设计治理:构建面向组织学习与可扩展自主性的代理型人工智能

arXiv cs.AI ↗ · 2026-05-22 缓存

本文通过对一家大型IT服务公司2025年开发和部署代理型AI系统的定性案例研究,提炼出七条经验,旨在将治理嵌入系统架构与运营中,以平衡自主性与问责制。

0 人收藏 0 人点赞
#research-paper

关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见

arXiv cs.CL ↗ · 2026-05-21 缓存

一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。

0 人收藏 0 人点赞
#research-paper

循环中的声音:绘制参与式人工智能图谱

arXiv cs.AI ↗ · 2026-05-19 缓存

本文提出了一个可复现的协议,用于构建参与式人工智能项目的开放存储库和交互式地图集,分析了131条记录以揭示地理和生命周期模式,并提出了一个默认参与式人工智能基础设施的框架。

0 人收藏 0 人点赞
#research-paper

@Chenfeng_X: 非常兴奋我们的论文 StreamdiffusionV2 荣获了 #MLSys26 的最佳研究论文奖!视频生成正在快速…

X AI KOLs Following ↗ · 2026-05-19 缓存

StreamDiffusionV2 在 MLSys26 上获得最佳研究论文奖,该论文提出了一种用于实时交互式视频生成的开源流式系统,将视频生成视为流式管道而非回合制流程。

0 人收藏 0 人点赞
#research-paper

昨天我看到一篇关于 δ-mem 并与 openclaw 集成的新研究论文

Reddit r/openclaw ↗ · 2026-05-17

一篇关于 δ-mem 的新研究论文在与 openclaw 集成后,将智能体响应质量提升了 7-32%。该项目目前仅适用于 mlx 和 Qwen3:4b,但预计会推出其他模型的适配器。

0 人收藏 0 人点赞
#research-paper

@zhanlin990410: https://x.com/zhanlin990410/status/2055666660925943834

X AI KOLs Timeline ↗ · 2026-05-16 缓存

本文介绍了使用Kimi(拥有100万token上下文窗口的AI工具)进行学术研究的6步工作流,包括文献倾倒、找空白、文献综述初稿、方法论压力测试、论证压力测试和全文组装,可大幅缩短论文写作时间。

0 人收藏 0 人点赞
#research-paper

EnergyLens: 面向多GPU大语言模型推理优化的预测性能耗感知探索

arXiv cs.LG ↗ · 2026-05-15 缓存

EnergyLens是一个端到端的框架,用于多GPU大语言模型推理的预测性能耗感知优化,在Llama3和Qwen3-MoE上验证,平均绝对百分比误差在9.25%至13.19%之间,并揭示了不同配置之间显著的能耗差异。

0 人收藏 0 人点赞
#research-paper

Moltbook 审核:通过多轮对话揭示隐藏意图

arXiv cs.AI ↗ · 2026-05-14 缓存

本文介绍 Bot-Mod,一个通过多轮对话和基于吉布斯采样的方法识别多智能体系统中恶意意图的审核框架,并展示来自Moltbook的数据集用于评估。

0 人收藏 0 人点赞
#research-paper

Context Is Not Control:面向LLM的源边界评估

Reddit r/LocalLLaMA ↗ · 2026-05-13 缓存

一篇介绍《Context Is Not Control》的论文,该基准评估LLM在处理受控文本中介证据时的源边界失效问题。附带开放权重模型和前沿API模型的复现包。

0 人收藏 0 人点赞
#research-paper

空间启动优于语义提示:一种提高 LLM 图表数据提取准确率的基于网格的方法

arXiv cs.AI ↗ · 2026-05-12 缓存

本文探讨了提高大语言模型(LLM)在图表数据提取中准确率的方法,研究发现,通过坐标网格进行的空间启动策略显著优于语义提示策略。

0 人收藏 0 人点赞
#research-paper

仅靠拟合是不够的:极低量化大语言模型中的平滑性

arXiv cs.CL ↗ · 2026-05-12 缓存

本文探讨了极低量化大语言模型中的平滑性退化问题,认为除了数值精度外,保持平滑性对于维持模型性能至关重要。

0 人收藏 0 人点赞
#research-paper

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL ↗ · 2026-05-12 缓存

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

0 人收藏 0 人点赞
#research-paper

迈向定制化的多模态角色扮演

arXiv cs.LG ↗ · 2026-05-12 缓存

本文介绍了 UniCharacter,这是一个用于定制化多模态角色扮演(CMRP)的两阶段训练框架,能够对人设、对话风格和视觉身份进行统一的定制。该研究提出了 RoleScape-20 数据集,并证明了该模型仅需极少数据即可实现连贯的跨模态生成。

0 人收藏 0 人点赞
#research-paper

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

arXiv cs.CL ↗ · 2026-05-12 缓存

This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.

0 人收藏 0 人点赞
#research-paper

@rwayne: 昨天 arXiv 上挂了一篇有意思的论文,把认知科学里「意识」的机制直接翻译成了长上下文工程。 论文作者 Mo Yu / Jie Zhou 等 6 位研究员提出,认知科学有个老观点叫 global ignition,人意识到一件事时,分布…

X AI KOLs Timeline ↗ · 2026-05-08

研究者提出将认知科学中的"global ignition"意识机制应用于长上下文工程,提出MiA-Signature方法使用子模选择高层概念覆盖激活空间,应用于RAG和agentic系统后获得一致性能提升。

0 人收藏 0 人点赞
#research-paper

PRISM:用于顺序决策的感知与推理交织方法

arXiv cs.AI ↗ · 2026-05-08 缓存

本文介绍了 PRISM,这是一个通过动态问答流程整合视觉-语言模型和大语言模型的框架,旨在提升具身 AI 任务中的顺序决策能力。

0 人收藏 0 人点赞
#research-paper

当乐于助人变成阿谀奉承:大语言模型中阿谀奉承是社会对齐与认识论完整性之间的边界失效

arXiv cs.AI ↗ · 2026-05-08 缓存

本立场论文将大语言模型中的阿谀奉承行为分析为社会对齐与认识论完整性之间的边界失效,并提出一个新的框架和分类法来分类和缓解这些行为。

0 人收藏 0 人点赞
#research-paper

保持专注:通过键正交投影实现激活转向

arXiv cs.CL ↗ · 2026-05-08 缓存

本文介绍了通过键正交投影进行转向(SKOP)方法,该方法通过防止注意力重路由来控制大语言模型(LLM)的行为,从而在保持转向效果的同时降低效用下降。

0 人收藏 0 人点赞
#research-paper

逻辑正则化验证器激发大语言模型的推理能力

arXiv cs.CL ↗ · 2026-05-08 缓存

介绍了 LoVer,一种使用逻辑规则(否定一致性、组内一致性和组间一致性)来在无标签数据下提升大语言模型推理能力的无监督验证器,在推理基准测试中达到了接近监督验证器的性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈