最新

全部文章,按抓取时间从新到旧排列。

Cards List

Sendov猜想证明的解析

Hacker News Top · 3天前 缓存

本文讨论Sendov猜想的证明及其变体,重点关注单位圆盘内零点的多项式及其临界点。

0 人收藏 0 人点赞

加州的新轮胎效率规则可能每年为司机节省10亿美元

Hacker News Top · 1小时前 缓存

加州已批准新的轮胎效率标准,以节省司机开支并减少排放,计划从2029年开始分阶段实施,并在2033年实施更严格的标准。

0 人收藏 0 人点赞

以色列疑似为欺骗AI聊天机器人而设立虚假智库

Hacker News Top · 7小时前 缓存

以色列设立虚假智库,旨在生成影响Claude和Gemini等AI聊天机器人的报告,此举被称为LLM投毒。

0 人收藏 0 人点赞

NaviDC-OCR:数字与相机捕获文档的解析导航

Hugging Face Daily Papers · 5天前 缓存

NaviDC-OCR是一个统一的视觉-语言框架,通过变形感知学习和自适应采样提高文档解析准确性,在多个基准测试中达到了最先进的结果。

0 人收藏 0 人点赞

MegaParts: 通过令牌高效的自回归建模扩展部件感知3D物体生成至300个部件

Hugging Face Daily Papers · 4天前 缓存

MegaParts 引入了一个可扩展的框架,用于部件感知3D物体生成,该框架使用令牌高效的向量量化令牌和自回归建模,使得能够生成具有多达300个部件的物体。

0 人收藏 0 人点赞

理解代理AI系统中认知引发的风险

Hugging Face Daily Papers · 3天前 缓存

本文系统分析了代理AI系统中由扩展认知能力在物理、社会和自反性层面引发的风险,并提出了缓解策略以确保其安全发展。

0 人收藏 0 人点赞

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Hugging Face Daily Papers · 3天前 缓存

本文提出了VibeWorlding,一个用于基准测试和训练多模态智能体的框架,使其能够从用户查询构建3D开放世界,并展示了强化学习如何提升开源模型以与闭源前沿模型竞争。

0 人收藏 0 人点赞

GenRouter:代理式图像生成的统一路由工作流

Hugging Face Daily Papers · 昨天 缓存

GenRouter 是一个用于代理式图像生成的统一路由框架,能够自适应地将提示引导至最优工作流,通过需求建模和自我进化显著降低成本与延迟,同时提升视觉对齐效果。

0 人收藏 0 人点赞

R^3-Bench:大型语言模型在共享预算下的资源理性推理面临挑战

Hugging Face Daily Papers · 昨天 缓存

R^3-Bench 引入了一个基准测试,表明大型语言模型在跨数学、编程和抽象推理等多个推理任务分配共享计算预算时,难以维持性能表现。

0 人收藏 0 人点赞

ClawGym II:基于代理工具的黑箱强化学习探索

Hugging Face Daily Papers · 昨天 缓存

本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。

0 人收藏 0 人点赞

ENTLORE:面向企业问答中潜在组织推理的基于图的基准

Hugging Face Daily Papers · 2026-08-11 缓存

ENTLORE是一个基于图的基准框架,用于企业问答中的潜在组织推理评估,它表明即使拥有黄金文档来源,许多隐式关系问题仍然无法回答。

0 人收藏 0 人点赞

Ventor-QTest: 威胁模型驱动的供应商托管LLM API验证

Hugging Face Daily Papers · 昨天 缓存

Ventor-QTest提出了一种针对供应商托管LLM API的黑盒审计方法,通过重复和长序列探测来测量保真度损失并检测长期代理任务中的退化。

0 人收藏 0 人点赞

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Hugging Face Daily Papers · 2天前 缓存

ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。

0 人收藏 0 人点赞

当上下文反噬:通过文档级注意力崩溃检测RAG投毒

Hugging Face Daily Papers · 2026-08-07 缓存

本文提出D-SCAN,一种针对RAG投毒的检测框架,通过监控语言模型生成中的注意力崩溃动态,即使在输出看似良性时,也能有效抵御对抗性攻击。

0 人收藏 0 人点赞

立场:科学团队中的AI代理应作为人-代理系统来研究

Hugging Face Daily Papers · 2026-08-02 缓存

本文立场论文认为,科学团队中的AI代理应作为人-代理系统来研究,以增强协作并缓解风险,例如科学探究中多样性的减少。

0 人收藏 0 人点赞

UI-Mate:通过上下文演示推进开放权重基础GUI代理

Hugging Face Daily Papers · 2天前 缓存

UI-Mate 是一个基础GUI代理,它使用环境接地训练和上下文演示来提高在长期办公任务中的可靠性,并在计算机使用基准测试中取得了最先进的成果。

0 人收藏 0 人点赞

VideoGAIA: 通用AI助手智能视频理解基准

Hugging Face Daily Papers · 6天前 缓存

VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。

0 人收藏 0 人点赞

PACE-Bench:动态环境中通过代码演化进行物理适应的基准测试

Hugging Face Daily Papers · 4天前 缓存

PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。

0 人收藏 0 人点赞

Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分

Simon Willison's Blog · 4小时前 缓存

在 Simon Willison 的博客文章中强调,Qwen 3.8 27B AI 模型在 Artificial Analysis Intelligence Index 上取得了 52 分。

0 人收藏 0 人点赞

利用现代优化与AlphaEvolve改进矩阵乘法指数

Hugging Face Daily Papers · 昨天 缓存

本文提出利用现代技术和AlphaEvolve改进组合损失分析中的优化问题,从而得到矩阵乘法指数的改进上界。

0 人收藏 0 人点赞
下一页 →
← 返回首页

提交意见反馈