real-world

标签

Cards List
#real-world

Nvidia的自主机器人研究(6分钟阅读)

TLDR AI · 2026-06-22 缓存

ENPIRE是一个框架,使编码代理能够通过真实世界的反馈循环自主改进机器人操作策略,在插针和剪扎带等灵巧任务上实现了99%的成功率。

0 人收藏 0 人点赞
#real-world

Llama基准测试与实际性能差距很大(求助)

Reddit r/LocalLLaMA · 2026-06-18

关于Llama模型基准测试分数与实际性能之间存在显著差距的讨论,作者正在寻求帮助。

0 人收藏 0 人点赞
#real-world

ENPIRE: 现实世界中自主机器人策略自我改进

Hugging Face Daily Papers · 2026-06-18 缓存

ENPIRE是一个框架,通过环境反馈、策略优化和进化代码优化的闭环系统,使机器人能够在现实世界中自主实现策略自我改进,在灵巧操作任务上达到99%的成功率。

0 人收藏 0 人点赞
#real-world

@FinanceYF5: ENPIRE 已能独立完成扎束线带、整理细针、安装 GPU 等高精度操作,并展现出“物理扩展”现象:多机器人并行探索,进步速度明显更快。 NVIDIA GEAR 实验室的一部分如今已能通宵自我改进,人类早上只需查看报告。项目也将开源。 项…

X AI KOLs Following · 2026-06-17 缓存

NVIDIA GEAR lab introduces ENPIRE, a framework for autonomous real-world robot policy self-improvement that achieves 99% success on dexterous manipulation tasks like GPU insertion and zip-tying, with multi-robot parallel learning and open-source release.

0 人收藏 0 人点赞
#real-world

@Murderlon: FrontierCode终于发布,一个面向真实世界的编码智能体基准测试。通过广泛的强化流程进行人工验证……

X AI KOLs Following · 2026-06-08 缓存

FrontierCode是一个面向编码智能体的全新基准测试,通过人工验证并采用持续评分模型,旨在评估真实世界的性能。

0 人收藏 0 人点赞
#real-world

@mdancho84: 玩具项目已死。如果你的项目组合不涉及真实业务问题,你就会被淘汰。这里有300多个真实M…

X AI KOLs Timeline · 2026-06-08 缓存

这条推文推荐了一个免费的合集,包含300多份来自顶级公司的真实ML系统案例研究,并指出仅靠玩具项目不足以构建强有力的作品集。

0 人收藏 0 人点赞
#real-world

你见过生产环境中最有用的AI智能体是什么?

Reddit r/AI_Agents · 2026-06-08

关于实际部署的最有用AI智能体的讨论,强调了简单、单问题解决方案,如潜在客户资格评估和支持工单分类。

0 人收藏 0 人点赞
#real-world

@rohanpaul_ai:Arena 刚刚发布了一个真实世界的智能体排行榜,该排行榜根据人工智能模型完成实际用户任务的效果进行排名,而不仅仅是……

X AI KOLs Following · 2026-06-05 缓存

Agent Arena 是一个新的排行榜,它通过任务成功、可操控性和恢复等信号评估人工智能模型在编码、研究、文件分析等真实世界智能体任务上的表现,其中 GPT-5.5 High 领先。

0 人收藏 0 人点赞
#real-world

AI智能体是否终于从演示跨越到实际工具?

Reddit r/AI_Agents · 2026-06-05

讨论AI智能体是否正在从令人印象深刻的演示转变为在研究、编码、运营和个人生产力方面真正有用的工具。

0 人收藏 0 人点赞
#real-world

连续六周每日使用开源桌面Agent Shell的三模型拆分(Haiku三分类器 → Sonnet审查器 → Opus执行器)的真实成本数据与故障记录。

Reddit r/AI_Agents · 2026-06-05

一项为期六周的真实世界实验,使用开源桌面Agent Shell的三模型拆分(Haiku三分类器、Sonnet审查器、Opus执行器),报告了64%的成本降低,并详细描述了诸如上下文膨胀和子Agent失控等故障模式。

0 人收藏 0 人点赞
#real-world

有人想了解先进公司是如何在实际生产环境中运行AI代理的吗?

Reddit r/AI_Agents · 2026-05-26

作者在一家AI基础设施公司工作,观察到在实际生产环境中运行AI代理更多是关于环境、访问控制、隔离和安全状态管理,而非模型本身,并询问社区是否想要详细的架构模式。

0 人收藏 0 人点赞
#real-world

我为客户构建了50多个AI自动化方案,以下是大多数失败的原因以及成功案例做对了什么

Reddit r/AI_Agents · 2026-05-26

一位机构创始人分享了从50多个AI自动化实施中获得的经验教训,指出大多数失败的原因是底层流程混乱、缺乏内部所有权和过度工程化,而最成功的自动化方案简单、专注,并有指定的客户方负责人支持。

0 人收藏 0 人点赞
#real-world

Apex-Testing:真实世界、真实仓库的智能编码基准测试(更新)

Reddit r/LocalLLaMA · 2026-05-23

Apex-Testing 是一个用于评估智能编码模型的基准测试,基于真实的私有 GitHub 仓库。该测试已更新,加入了最新模型和详细指标,包括成本、时间以及基于 ELO 的排行榜。

0 人收藏 0 人点赞
#real-world

TerminalWorld:在真实终端任务中评估智能体的基准

Hugging Face Daily Papers · 2026-05-21 缓存

本文介绍了TerminalWorld,这是一个基于80,870个终端记录构建的、用于在真实终端任务中评估AI智能体的基准。当前系统最高仅达到62.5%的通过率,凸显了真实终端工作流中的挑战。

0 人收藏 0 人点赞
#real-world

有没有人也觉得AI代理在事情变得复杂之前都表现得很惊艳?

Reddit r/AI_Agents · 2026-05-20

对AI代理令人印象深刻的演示和可靠的实际执行之间差距的反思,认为当前代理擅长结构化任务但在不可预测条件下会失败,并指出近期AI角色将主要集中于带人类监督的窄范围自动化。

0 人收藏 0 人点赞
#real-world

AI agents初体验令人惊艳,但工作流一乱就麻烦不断

Reddit r/AI_Agents · 2026-05-19

对AI agents的反思:在狭窄的监督任务中令人印象深刻,但由于会话过期、上下文漂移和静默失败等问题,在长期运行、混乱的工作流程中显得脆弱且不可靠。

0 人收藏 0 人点赞
#real-world

@cyrilXBT: Anthropic 刚刚终结了演示代理时代。他们的 Agent 团队展示了生产级风范。不是理论……

X AI KOLs Timeline · 2026-05-19 缓存

Anthropic 的 Agent 团队在一次 30 分钟的演示中,揭晓了一套生产级的多代理系统四层框架,标志着从演示到真实应用的转变。

0 人收藏 0 人点赞
#real-world

Mega-ASR: 通过扩展真实世界声学模拟实现 In-the-wild^2 语音识别

Hugging Face Daily Papers · 2026-05-19 缓存

Mega-ASR 提出通过扩展真实世界声学模拟来改进在极具挑战性的野外条件下的自动语音识别,旨在缩小实验室与真实环境之间的性能差距。

0 人收藏 0 人点赞
#real-world

DetectRL-X:面向可靠的多语言及真实世界的LLM生成文本检测

arXiv cs.CL · 2026-05-18 缓存

DetectRL-X是一个全面的多语言基准测试,用于评估跨8种语言和6个领域的LLM生成文本检测器,包括针对AI辅助写作操作和扰动的压力测试。它揭示了当前检测器在多语言场景中的优势与局限性。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈